Ultralytics Công Bố YOLO27: Kiến Trúc Hai Nhánh Bổ Trợ, Loại Bỏ NMS Và Vượt Mốc 60 mAP

Ultralytics hé lộ dòng mô hình YOLO27 kế nhiệm YOLO26 với thiết kế hai nhánh bổ trợ, hỗ trợ suy luận không cần NMS, đạt tới 61.2 mAP trên COCO và tối ưu toàn diện 7 tác vụ thị giác máy tính.
Ultralytics Công Bố YOLO27: Kiến Trúc Hai Nhánh Bổ Trợ, Loại Bỏ NMS Và Vượt Mốc 60 mAP
Cộng đồng thị giác máy tính vừa đón nhận thông tin kỹ thuật đáng chú ý khi Ultralytics chính thức hé lộ tài liệu về dòng mô hình thế hệ tiếp theo mang tên YOLO27. Kế nhiệm YOLO26, thế hệ mới mang đến thiết kế hai nhánh bổ trợ, hỗ trợ suy luận không cần bộ lọc NMS và lần đầu tiên vượt mốc 60 mAP trong lịch sử hãng.
1. Những Điểm Nổi Bật Cần Biết
Theo Ultralytics Documentation, thế hệ YOLO27 đang trong giai đoạn nghiên cứu và hoàn thiện cuối cùng trước khi phát hành chính thức. Thay vì áp dụng một cấu trúc mạng cố định, phiên bản này giới thiệu nhiều cải tiến hệ thống:
Điểm 1: Thiết Kế Hai Nhánh Độc Lập Cho Từng Nhóm Thiết Bị
Điểm thay đổi đáng kể của YOLO27 nằm ở việc phân tách kiến trúc cho tác vụ phát hiện đối tượng thành hai nhánh riêng biệt:
- Quy mô nhỏ gọn (YOLO27n và YOLO27s): Sử dụng kiến trúc mạng tích chập (CNN) tinh gọn hai quy mô. Mô hình loại bỏ bản đồ đặc trưng trung bình, chỉ dự đoán trên bản đồ chi tiết cho vật thể nhỏ và bản đồ thô cho vật thể lớn. Thiết kế này giúp giảm khối lượng tính toán ở tầng đầu ra, tối ưu cho các thiết bị điện toán biên (Edge AI) và vi xử lý nhúng.
- Quy mô lớn (YOLO27m và YOLO27l): Ứng dụng kiến trúc dựa trên query kết hợp bộ giải mã transformer, phù hợp cho việc triển khai trên các cụm máy chủ và máy trạm GPU mạnh mẽ.
Điểm 2: Phát Hiện Đối Tượng Không Cần Hậu Xử Lý NMS
Ở các mô hình lớn (M và L), YOLO27 thay thế cơ chế dự đoán dày đặc bằng bộ giải mã transformer, tinh chỉnh tập hợp truy vấn đối tượng và xuất thẳng kết quả cuối cùng.
Cải tiến này loại bỏ hoàn toàn bước hậu xử lý ức chế phi cực đại (Non-Maximum Suppression - NMS). NMS vốn là điểm nghẽn tính toán trong các đường ống thị giác thời gian thực khi mật độ đối tượng trong khung hình tăng cao. Nhờ loại bỏ NMS, thời gian suy luận toàn trình (End-to-End Latency) trở nên ổn định và dễ dự đoán hơn.
Điểm 3: Hỗ Trợ Toàn Diện Bảy Tác Vụ Thị Giác Qua Một Giao Diện
Họ mô hình mới mở rộng phạm vi xử lý sang 7 tác vụ thị giác khác nhau:
- Phát hiện đối tượng (Object Detection).
- Phân đoạn thể hiện (Instance Segmentation).
- Phân đoạn ngữ nghĩa (Semantic Segmentation).
- Ước lượng độ sâu đơn ảnh (Monocular Depth Estimation).
- Phân loại hình ảnh (Image Classification).
- Ước lượng tư thế và điểm mốc khung xương (Pose/Keypoint Estimation).
- Phát hiện đối tượng định hướng xoay góc (Oriented Bounding Box - OBB).
Toàn bộ tác vụ trên đều đồng bộ qua giao diện Python quen thuộc, giúp dễ dàng tái sử dụng mã nguồn mà không phải đổi cấu trúc đường ống dữ liệu.
Điểm 4: Vượt Mốc 60 mAP Với Độ Trễ Dưới 2.5 Millisecond
Trên tập dữ liệu tiêu chuẩn COCO, các phiên bản YOLO27 đạt độ chính xác từ 42.3 đến 60.4 mAP ở kích thước đầu vào 640 pixel. Khi nâng kích thước đầu vào lên 800 pixel, phiên bản YOLO27l đạt tới 61.2 mAP, trở thành mô hình đầu tiên của Ultralytics vượt ngưỡng 60 mAP.
Về tốc độ thực thi, khi kiểm thử trên card đồ họa NVIDIA RTX PRO 6000 với TensorRT 11 ở định dạng bán chính xác FP16, độ trễ suy luận dao động từ 0.62 ms đối với bản Nano đến 2.32 ms đối với bản Large. Các kỹ sư có thể tham khảo bảng chỉ số chi tiết tại Tài liệu Ultralytics YOLO27 trước khi chuẩn bị hạ tầng thử nghiệm.

2. Tác Động Với Ngành Công Nghệ Và Doanh Nghiệp
Sự xuất hiện của kiến trúc lai kết hợp CNN và Transformer trong cùng một hệ sinh thái mô hình mang đến nhiều tác động tích cực đối với các dự án thị giác máy tính thực tế:
Chuẩn Hóa Quá Trình Phát Triển Sản Phẩm
Trước đây, khi chuyển ứng dụng thị giác từ máy chủ xuống thiết bị biên, kỹ sư thường phải dùng hai họ mô hình khác nhau (như DETR cho máy chủ và YOLO nhỏ cho biên), buộc phải duy trì hai bộ mã riêng biệt. Việc YOLO27 tích hợp cả hai cách tiếp cận dưới một giao diện giúp rút ngắn thời gian thử nghiệm và tinh giản chu trình DevOps cho AI.
Nâng Cao Năng Lực Nhận Diện Vật Thể Nhỏ
Nhờ việc mở rộng giai đoạn trích xuất đặc trưng độ phân giải cao ở đầu mạng và cơ chế giám sát căn chỉnh vùng tiền cảnh khi huấn luyện, khả năng định vị đối tượng kích thước nhỏ (biển số xe ở xa, linh kiện điện tử trên băng chuyền) được cải thiện rõ rệt so với các thế hệ trước.

3. Ai Nên Theo Dõi
Những cải tiến kỹ thuật trong thông báo lần này gắn liền với nhu cầu thực tiễn của nhiều nhóm chuyên môn:
- Kỹ sư thị giác máy tính và AI biên: Những người đang trực tiếp triển khai mô hình nhận diện trên phần cứng hạn chế tài nguyên như NVIDIA Jetson, Raspberry Pi hay chip NPU.
- Doanh nghiệp phát triển giải pháp giao thông và an ninh: Các đơn vị vận hành camera giám sát thông minh, nhận diện biển số ANPR tốc độ cao cần độ trễ thấp và bám vết liên tục.
- Đội ngũ tự động hóa công nghiệp và kiểm soát chất lượng (QC): Các nhà máy cần phân loại sản phẩm, phát hiện lỗi bề mặt vi mô hoặc định vị kiện hàng xoay nghiêng qua tác vụ OBB trên dây chuyền sản xuất.
4. Góc Nhìn Từ NLTECH
Tại NLTECH, đội ngũ kỹ sư luôn theo dõi sát sao các thế hệ mô hình mở nhằm ứng dụng vào các dự án camera AI và phần mềm nhúng thực tế.
Từ kinh nghiệm thực chiến trong các bài toán camera giao thông và thị giác công nghiệp, chúng tôi ghi nhận ba nhận định định hướng:
Thứ nhất, việc phân tách rõ ràng giữa kiến trúc CNN cho thiết bị biên và Transformer cho máy chủ là lựa chọn kỹ thuật rất thực tế. Thiết bị biên ngoài hiện trường cần tính toán nhẹ, tản nhiệt tốt và tiêu thụ điện thấp, trong khi các tác vụ tổng hợp tại trung tâm lại ưu tiên độ chính xác cao và hiểu ngữ cảnh toàn cục.
Thứ hai, việc loại bỏ NMS trên các mô hình lớn là bước tiến đáng mong đợi cho các hệ thống giám sát mật độ cao. Tại giao lộ đông đúc với hàng trăm phương tiện cùng lúc, bước tính toán NMS thường chiếm tỷ trọng lớn trong tổng thời gian xử lý khung hình. Loại bỏ NMS giúp giảm hiện tượng giật cục (frame drop) trong các luồng RTSP thời gian thực.
Thứ ba, doanh nghiệp chưa nên vội vã chuyển đổi mã nguồn ngay lúc này. Vì YOLO27 vẫn đang hoàn thiện R&D và chưa công bố trọng số chính thức, việc duy trì vận hành ổn định trên nền tảng đã kiểm chứng như YOLO26 kết hợp TensorRT vẫn là chiến lược an toàn nhất cho hệ thống production.
