NLTECH LogoNLTECH

AWS Và Strands Labs Công Bố Strands Decider 2B: Kiến Trúc Phân Luồng AI Agent Dưới 150ms Bằng Cơ Chế Single-Pass Scoring

Tác giả: NLTECH Engineering Team
3 tháng 10, 2026
7 phút đọc
Mascot nữ kỹ sư AI và mô hình quyết định Strands Decider 2B trên nền kính sáng
Tóm Tắt Kỹ Thuật (Fact Capsule)

Strands Decider 2B là mô hình quyết định mã nguồn mở 1.9B tham số do Strands Labs (AWS) phát hành ngày 01/10/2026. Mô hình sử dụng đầu Pointer Head để tính phân phối xác suất trên các lựa chọn định sẵn trong 1 lượt duy nhất, đạt độ trễ 80-140ms trên phần cứng cục bộ.

Ngày 01 tháng 10 năm 2026, phòng thí nghiệm Strands Labs trực thuộc Amazon Web Services (AWS) đã chính thức công bố mô hình mã nguồn mở Strands Decider 2B. Đây là dòng mô hình chuyên biệt hóa phục vụ tác vụ phân luồng và ra quyết định tức thì cho các hệ thống AI Agent, giúp giảm thiểu độ trễ vận hành xuống dưới 150 mili-giây mà không cần phụ thuộc vào các mô hình ngôn ngữ lớn cồng kềnh.

1. Bối Cảnh Trước Khi Có Thay Đổi Này

Trong làn sóng xây dựng các hệ thống tác tử tự hành (AI Agent) phục vụ doanh nghiệp, đa số kiến trúc hiện hành đều vận hành theo mô hình nguyên khối. Mọi thao tác xử lý, từ việc phân tích câu hỏi người dùng, quyết định gọi công cụ ngoại vi, kiểm tra tính hợp lệ của tham số cho đến sinh câu trả lời cuối cùng, đều được ủy thác cho một mô hình ngôn ngữ lớn đơn lẻ. Cách tiếp cận này bộc lộ những hạn chế rõ rệt khi đưa vào môi trường sản xuất thực tế:

Chi Phí Ẩn Và Nút Thắt Độ Trễ

  • Độ trễ tích lũy kéo dài: Một chuỗi hành động gồm năm bước gọi công cụ (tool calling) trung bình tiêu tốn từ 8 đến 15 giây nếu mỗi lần rẽ nhánh đều phải truy vấn qua API của các mô hình nền tảng từ 70 tỷ đến 400 tỷ tham số.
  • Lãng phí tài nguyên tính toán: Việc bắt một mô hình khổng lồ sinh ra hàng trăm token diễn giải chỉ để trả về một kết quả nhị phân hoặc chọn một mã định danh công cụ gây tiêu tốn lượng điện năng và chi phí API không cần thiết.
  • Hiện tượng ảo giác ở tầng điều hướng: Khi số lượng công cụ trong một hệ thống tăng cao, các mô hình tạo sinh truyền thống thường gặp khó khăn trong việc tuân thủ cấu trúc dữ liệu nghiêm ngặt, dẫn đến tình trạng gọi sai hàm hoặc điền sai kiểu tham số.

Nhiều đội ngũ kỹ thuật từng tìm cách khắc phục bằng cách viết các bộ lọc thủ công dựa trên biểu thức chính quy (Regex). Tuy nhiên, các giải pháp này thường thiếu tính mềm dẻo trước ngôn ngữ tự nhiên đa dạng của người dùng và đòi hỏi công sức bảo trì lớn mỗi khi có thêm công cụ mới.

2. Chuyện Gì Vừa Thay Đổi

Theo Strands Labs & VentureBeat, kho mã nguồn strands-decider trên GitHub cùng trọng số mô hình Strands Decider 2B trên Hugging Face đã được phát hành rộng rãi dưới giấy phép mã nguồn mở Apache 2.0. Mô hình mang lại sự thay đổi căn bản trong tư duy thiết kế hệ thống tác tử:

Cơ Chế Chấm Điểm Đơn Pha Thay Vì Sinh Chữ

  • Kiến trúc nền tảng tinh gọn: Mô hình được phát triển dựa trên bộ khung mô hình mở hai tỷ tham số, trải qua quá trình tinh chỉnh chuyên sâu bằng phương pháp học tăng cường có hiệu chuẩn xác suất (calibration-aware reinforcement learning).
  • Đầu tính toán Pointer Head: Đội ngũ nghiên cứu đã lược bỏ hoàn toàn phần đầu tạo sinh văn bản tự do. Thay vào đó, mô hình tích hợp một lớp đầu con trỏ (pointer head) có khả năng tính toán phân phối xác suất trên một tập hợp các phương án định sẵn trong đúng một lượt suy diễn (single-pass scoring).
  • Thời gian phản hồi dưới 150 mili-giây: Khi triển khai trực tiếp trên các phần cứng cục bộ như card đồ họa phổ thông hoặc chip máy tính cá nhân, mô hình đạt độ trễ trung bình từ 80 đến 140 mili-giây cho mỗi quyết định phân luồng.

Mô hình hỗ trợ bốn nhóm tác vụ điều phối cốt lõi bao gồm: lựa chọn công cụ thực thi từ danh sách có sẵn, đánh giá an toàn dữ liệu đầu ra, phân nhánh yêu cầu theo thang đo phân cấp và trả về câu trả lời nhị phân có kèm xác suất tin cậy. Nhờ đó, luồng xử lý của tác tử được tách bạch thành hai tầng rõ rệt: tầng phản xạ nhanh đóng vai trò như hệ thống điều hướng tức thì và tầng suy luận sâu chỉ được kích hoạt khi thực sự cần giải quyết bài toán phức tạp.

Sơ đồ kiến trúc định tuyến đơn pha Single-Pass Scoring của mô hình Strands Decider 2B

3. Tác Động Và Rào Cản Thực Tế

Sự xuất hiện của các mô hình quyết định chuyên biệt hóa như Strands Decider 2B mở ra hướng đi thực tế cho các bài toán tối ưu hóa chi phí vận hành AI Agent ở quy mô lớn, song cũng đi kèm những thách thức triển khai cần được đánh giá khách quan:

Những Giá Trị Cải Thiện Đo Lường Được

  • Giảm tải chi phí API: Việc chuyển giao phần lớn các quyết định điều hướng cục bộ cho mô hình hai tỷ tham số tự vận hành giúp doanh nghiệp tiết kiệm đáng kể chi phí token hàng tháng đối với các dịch vụ đám mây thương mại.
  • Trải nghiệm tương tác mượt mà: Việc cắt giảm độ trễ phản hồi ở mỗi bước trung gian giúp toàn bộ quy trình tương tác của hệ thống tác tử trở nên liền mạch, tạo cảm giác tức thì đối với người sử dụng cuối.
  • Khả năng kiểm soát cục bộ an toàn: Do toàn bộ trọng số được phát hành mở, các đơn vị phát triển có thể tự đóng gói và chạy mô hình trong hạ tầng nội bộ, bảo đảm dữ liệu truy vấn không bị rò rỉ ra môi trường bên ngoài.

Những Rào Cản Và Giới Hạn Cần Lưu Ý

  • Giới hạn về không gian lựa chọn: Do vận hành theo cơ chế chấm điểm danh sách phương án, mô hình chỉ phát huy hiệu quả khi tập công cụ hoặc các nhánh hành động đã được định nghĩa kiểu dữ liệu tường minh từ trước.
  • Yêu cầu về hạ tầng bộ nhớ đệm: Mặc dù kích thước hai tỷ tham số là tương đối nhẹ, việc duy trì mô hình thường trực trong bộ nhớ RAM hoặc VRAM để đạt độ trễ mili-giây vẫn đòi hỏi sự tính toán phân bổ tài nguyên hợp lý trên các máy chủ biên.
  • Nguy cơ lệch phân phối trong ngữ cảnh hẹp: Tại các miền nghiệp vụ chuyên sâu mang tính đặc thù cao, mô hình có thể cần trải qua thêm các vòng huấn luyện bổ sung trên tập dữ liệu nội bộ để bảo đảm độ chính xác của các điểm số xác suất.

So sánh quy mô kiến trúc giữa mô hình phản xạ nhanh hai tỷ tham số và mô hình ngôn ngữ lớn

4. Góc Nhìn Từ NLTECH

Đối với thị trường phát triển phần mềm và ứng dụng trí tuệ nhân tạo tại Việt Nam, sự ra đời của Strands Decider 2B đánh dấu bước chuyển dịch quan trọng từ việc phụ thuộc vào các mô hình khổng lồ sang xu hướng xây dựng hệ thống tác tử phân tầng chuyên biệt. Việc kết hợp một mô hình phản xạ nhanh có chi phí thấp ở tuyến đầu với các mô hình nền tảng mạnh mẽ ở tuyến sau chính là chìa khóa để triển khai các giải pháp AI thực chiến vừa bảo đảm bài toán kinh tế vừa đáp ứng yêu cầu khắt khe về thời gian phản hồi thực tế của doanh nghiệp.