NLTECH LogoNLTECH

Kiểm Chuẩn OmniDocBench v1.6: Các Mô Hình SLM Thị Giác Dưới 2B Tham Số Vượt Trội LLM Khổng Lồ Trong Trích Xuất Bảng Biểu

Tác giả: NLTECH Engineering Team
9 tháng 10, 2026
6 phút đọc
Mascot nữ kỹ sư AI người Việt bên bảng điều khiển mô hình thị giác phân tích tài liệu.
Tóm Tắt Kỹ Thuật (Fact Capsule)

Tháng 10/2026, kiểm chuẩn OmniDocBench v1.6 ghi nhận PaddleOCR-VL-1.6 (0,9B tham số, chính xác bảng 92,4%) và MinerU2.5-Pro (1,2B tham số, độ trễ 120ms) vượt trội các LLM đa phương thức trong bóc tách chứng từ kế toán và văn bản hành chính phức tạp.

Đầu tháng 10 năm 2026, cộng đồng nghiên cứu thị giác máy tính trên Hugging Face đã công bố kết quả bảng xếp hạng kiểm chuẩn tài liệu phức tạp OmniDocBench v1.6. Đáng chú ý, các mô hình ngôn ngữ thị giác quy mô nhỏ (Small Language Models - SLM) như PaddleOCR-VL-1.6 và MinerU2.5-Pro với dung lượng từ 0,9 tỷ đến 1,3 tỷ tham số đã vượt qua các mô hình ngôn ngữ khổng lồ hàng trăm tỷ tham số trong tác vụ bóc tách cấu trúc bảng biểu kế toán và chứng từ hành chính.

1. Những Điểm Nổi Bật Cần Biết

Bảng xếp hạng OmniDocBench v1.6 ghi nhận bước tiến quan trọng của thế hệ mô hình thị giác chuyên biệt hóa cho tài liệu:

Điểm 1: Khả Năng Nhận Diện Bảng Biểu Phức Tạp Không Viền

Các dòng hóa đơn mua hàng, phiếu xuất kho hay báo cáo tài chính thường chứa bảng biểu lồng nhau, ô gộp nhiều hàng và thiếu các đường kẻ viền phân cách rõ ràng. Phiên bản PaddleOCR-VL-1.6 đạt điểm chính xác cấu trúc bảng lên tới 92,4%, vượt trội so với mức trung bình 78% của các mô hình đa phương thức tổng quát. Mô hình tái lập chính xác định dạng Markdown và HTML bảng biểu mà không làm lệch dòng dữ liệu số liệu kế toán.

Điểm 2: Tối Ưu Hóa Tham Số Dưới Ngưỡng 1,5 Tỷ

Thay vì sử dụng kiến trúc cồng kềnh, các mô hình như MinerU2.5-Pro chỉ sở hữu 1,2 tỷ tham số nhưng được huấn luyện chuyên sâu trên hàng triệu mẫu tài liệu đa ngôn ngữ. Nhờ kiến trúc nén trọng số và phân loại vùng tài liệu thông minh, thời gian xử lý một trang tài liệu quét giảm xuống dưới 120 mili-giây trên một GPU phổ thông, cho phép triển khai hàng loạt trạm số hóa tài liệu với chi phí phần cứng rất thấp.

Điểm 3: Bóc Tách Văn Bản Viết Tay Và Con Dấu Chồng Chéo

Một trong những bài toán phức tạp nhất tại các doanh nghiệp truyền thống là tài liệu bị đóng dấu đè lên chữ ký hoặc có chữ viết tay ghi chú ngoài lề. Các mô hình thế hệ mới trên bảng xếp hạng áp dụng thuật toán phân tách lớp điểm ảnh theo phổ màu, giúp nhận diện rõ ràng từng trường ký tự mà không bị lem mực hoặc nhầm lẫn giữa nét mực con dấu và chữ số hợp đồng.

2. Tác Động Với Ngành Công Nghệ Và Doanh Nghiệp

Theo các đánh giá kỹ thuật từ cộng đồng Hugging Face (https://huggingface.co), kết quả từ OmniDocBench v1.6 định hình lại hoàn toàn chiến lược đầu tư công nghệ số hóa tài liệu (Intelligent Document Processing - IDP) trong các tổ chức:

  • Tối ưu hóa ngân sách vận hành: Doanh nghiệp không còn phải chi trả chi phí thuê bao đắt đỏ cho các API đám mây nước ngoài để đọc từng trang hóa đơn. Một máy chủ nội bộ cấu hình trung bình có thể tự vận hành mô hình SLM để xử lý hàng chục nghìn chứng từ mỗi ngày với chi phí gần như cố định.
  • Bảo mật tuyệt đối thông tin nhạy cảm: Toàn bộ dữ liệu sao kê ngân hàng, hợp đồng lao động và hồ sơ thầu được xử lý khép kín trong mạng nội bộ, đáp ứng các tiêu chuẩn khắt khe về an toàn dữ liệu và quy định bảo vệ bí mật kinh doanh.
  • Tích hợp tự nhiên vào quy trình tự động hóa RPA: Dữ liệu đầu ra có cấu trúc chuẩn JSON giúp các hệ thống phần mềm kế toán và ERP tiếp nhận thông tin tự động, rút ngắn chu kỳ nhập liệu từ vài ngày xuống vài giây.

Sơ đồ kiến trúc hai nhánh phân tách vùng văn bản và cấu trúc bảng biểu của mô hình thị giác.

3. Ai Nên Theo Dõi

Những chuyển biến từ thế hệ mô hình thị giác tài liệu nhỏ gọn tác động trực tiếp đến nhiều nhóm chuyên môn:

  • Kỹ sư phát triển phần mềm và giải pháp AI: Cần nắm bắt phương pháp triển khai các mô hình SLM thị giác kết hợp cùng bộ công cụ suy luận biên để đóng gói thành các phần mềm độc lập cho khách hàng.
  • Giám đốc công nghệ và trưởng phòng chuyển đổi số: Có thêm căn cứ kỹ thuật để lựa chọn phương án xây dựng hệ thống số hóa văn bản nội bộ thay vì phụ thuộc vào các dịch vụ đám mây công cộng.
  • Bộ phận kế toán và kiểm soát nội bộ: Có thể kỳ vọng vào các giải pháp tự động hóa nhập liệu và đối soát hóa đơn có độ chính xác cao, giảm tải khối lượng công việc kiểm đếm thủ công.

Bo mạch vi xử lý thị giác máy tính hỗ trợ suy luận bóc tách tài liệu tốc độ cao tại chỗ.

4. Góc Nhìn Từ NLTECH

Thực tế triển khai các dự án phần mềm doanh nghiệp tại Việt Nam cho thấy rào cản lớn nhất của số hóa quy trình không nằm ở việc thiếu dữ liệu, mà nằm ở khối lượng khổng lồ các chứng từ giấy, hóa đơn viết tay và văn bản hành chính lưu trữ rải rác chưa được chuyển đổi thành dữ liệu số có cấu trúc.

Sự trỗi dậy của các mô hình SLM thị giác chuyên sâu như trong bảng kiểm chuẩn OmniDocBench v1.6 mở ra hướng đi thực tế và hiệu quả cho các công ty công nghệ trong nước. Thay vì theo đuổi những mô hình ngôn ngữ quá khổ đòi hỏi hạ tầng siêu máy tính, việc tập trung tinh chỉnh các mô hình thị giác nhỏ gọn cho đúng thể thức văn bản hành chính và hóa đơn đặc thù tại Việt Nam sẽ là chìa khóa để xây dựng các giải pháp tự động hóa may đo thiết thực, mang lại giá trị gia tăng rõ rệt cho cộng đồng doanh nghiệp Việt.