Thủ thuật
GPT-5.6 Sol: Mô hình thị giác mạnh mẽ nhất từ trước đến nay của OpenAI
(giờ Việt Nam)
Tóm tắt AI
Dòng GPT-5.6 mới của OpenAI, đặc biệt là phiên bản Sol, đã thiết lập tiêu chuẩn mới về khả năng thị giác máy tính với hiệu suất vượt trội trong các bài kiểm tra phát hiện vật thể và đếm đối tượng so với thế hệ tiền nhiệm.
Bản dịch AI

Tuần trước, OpenAI đã công bố dòng sản phẩm GPT-5.6, giới thiệu các mô hình Sol, Terra và Luna. Trong buổi phát trực tiếp ra mắt, đội ngũ phát triển tập trung mạnh vào khả năng sử dụng máy tính, trình diễn các mô hình có khả năng điều hướng và vận hành các ứng dụng trên máy tính để bàn. OpenAI nhấn mạnh vào các tác nhân giao diện người dùng (UI agents) và khả năng trực quan hóa 3D chi tiết, nhưng cả hai đều phụ thuộc vào khả năng hiểu hình ảnh mạnh mẽ hơn.
Để đo lường khả năng thị giác của chúng, chúng tôi đã chạy các mô hình này qua bộ tiêu chuẩn đánh giá VLM sắp tới của mình, dự kiến sẽ ra mắt trong vài tuần tới. Bộ tiêu chuẩn này bao gồm các tác vụ thị giác phổ biến, bao gồm phát hiện, đếm, OCR và trích xuất dữ liệu. Trong bài viết này, chúng tôi sẽ xem xét kỹ hơn cách GPT-5.6 thể hiện trong từng tác vụ đó.

Sol rõ ràng là mô hình thị giác tốt nhất mà OpenAI từng phát hành cho đến nay. Bước nhảy vọt này đặc biệt rõ rệt trong việc phát hiện và đếm đối tượng, nơi GPT-5.5 từng tụt hậu xa so với các VLM mạnh nhất. Terra và Luna không mạnh bằng Sol, nhưng cả hai đều cho thấy sự tiến bộ đáng kể so với GPT-5.5.
Hãy thử nghiệm Sol, Terra và Luna trong Roboflow Playground và so sánh kết quả của chúng với các mô hình như Claude Fable 5 và Gemini 3.5 Flash trên cùng các tác vụ thị giác.
Roboflow Playground
Phát hiện đối tượng (Object Detection)
Phát hiện là lĩnh vực mà GPT-5.6 cho thấy bước nhảy vọt rõ ràng nhất. GPT-5.5 đạt 13.8 mAP@50 trong bộ tiêu chuẩn của chúng tôi, trong khi Sol đạt 46.2. Terra và Luna theo sát phía sau với 44.7 và 43.3, đưa khả năng phát hiện đối tượng từ một điểm yếu lớn trở thành một năng lực thực tiễn.

Phát hiện bố cục tài liệu là một trong những thế mạnh rõ ràng nhất của GPT-5.6. Sol xử lý tốt các tiêu đề, đoạn văn, bảng biểu, hình ảnh và chữ ký. Nhiều quy trình làm việc với tài liệu bắt đầu bằng việc xác định các phần liên quan của một trang trước khi quá trình OCR hoặc trích xuất dữ liệu bắt đầu.

GPT-5.6 cũng hoạt động tốt trên các khung cảnh dày đặc. Các ví dụ về vỉ thuốc và trứng chứa nhiều đối tượng tương tự nằm sát nhau, một điểm yếu phổ biến đối với các mô hình phát hiện dựa trên VLM. Không giống như các bộ phát hiện truyền thống, VLM tạo ra từng nhãn lớp và tập hợp tọa độ dưới dạng văn bản. Khi số lượng đối tượng tăng lên, phản hồi trở nên dài hơn và nguy cơ bỏ sót đối tượng, trùng lặp hoặc lỗi tọa độ sẽ tăng lên. Mặc dù vậy, Sol vẫn phát hiện được hầu hết các đối tượng trong cả hai khung cảnh.

Để có kết quả phát hiện tốt nhất, hãy yêu cầu các mô hình GPT-5.6 trả về tọa độ XYXY tuyệt đối theo pixel hình ảnh. Điều này khác với Gemini 3.5 Flash, vốn hoạt động tốt nhất với tọa độ YXYX được chuẩn hóa về phạm vi 0–1000. Việc sử dụng sai định dạng tọa độ đã làm giảm hiệu suất phát hiện của GPT-5.6 khoảng 15 điểm mAP trong bộ tiêu chuẩn của chúng tôi.
Trong một vài trường hợp, GPT-5.6 Sol trả về các khung hình ở những vị trí dường như ngẫu nhiên trên ảnh. Nhiều khung hình không có sự chồng lấp, hoặc gần như không chồng lấp với dữ liệu thực tế (ground truth). Thay vì khớp với các đối tượng có thể nhìn thấy, các khung hình thường tạo thành các bố cục không tự nhiên, chẳng hạn như các hàng thẳng hoặc các nhóm cách đều nhau.

Chúng tôi đã chia sẻ những ví dụ đó với OpenAI. Đội ngũ của họ xác nhận rằng Sol trở nên kém ổn định hơn trên các hình ảnh có kích thước khoảng 2.000 x 2.000 pixel trở lên, đặc biệt là khi mức độ nỗ lực suy luận (reasoning effort) thấp. Nỗ lực suy luận cao hơn giúp cải thiện độ ổn định, nhưng cũng làm tăng mức sử dụng token, độ trễ và chi phí. Thay đổi kích thước hoặc cắt xén các hình ảnh lớn trước khi gửi chúng đến OpenAI API là giải pháp thay thế thiết thực nhất.
Đếm đối tượng (Object Counting)
Khả năng đếm đã được cải thiện trên toàn bộ dòng sản phẩm GPT-5.6. Sol đạt 73.0% trong bộ tiêu chuẩn của chúng tôi, tăng từ 64.9% của GPT-5.5, trong khi Terra và Luna đạt lần lượt 67.6% và 66.2%. Luna, mô hình rẻ nhất trong dòng sản phẩm, vẫn vượt qua mức cơ sở (baseline) trước đó của OpenAI.
Là một phần của bộ tiêu chuẩn, chúng tôi đã thử nghiệm các trường hợp đòi hỏi nhiều hơn việc chỉ phát hiện đối tượng và trả về tổng số. Sol đã đếm được các giá đỡ kim loại chồng lấp dày đặc, một trường hợp khó đối với cả bộ phát hiện đối tượng truyền thống và VLM. Sol cũng đếm các lỗ đạn chỉ bên trong các vùng tính điểm được chọn, cho thấy sự hiểu biết về cả đối tượng cần đếm và nơi áp dụng quy tắc.
Các vỉ thuốc (blister packs) tỏ ra khó khăn hơn nhiều. Trong các câu lệnh riêng biệt, chúng tôi yêu cầu Sol đếm các khe trống và các viên thuốc vẫn còn niêm phong bên trong bao bì. Bố cục lặp đi lặp lại, sự phản chiếu và những khác biệt nhỏ về hình ảnh giữa các khe trống và khe đầy đã làm cho cả hai tác vụ trở nên khó khăn.
Ví dụ về những viên kẹo bất thường đã bộc lộ một kiểu lỗi khác. Sol đưa ra số lượng sai, mặc dù không rõ liệu mô hình đếm nhầm số kẹo hay hiểu sai danh mục mục tiêu.
OCR và Trích xuất dữ liệu
Hiệu suất OCR vẫn gần tương đương với GPT-5.5. Sol đạt điểm tương đồng trung bình 90.7%, chỉ kém 0.5 điểm so với 91.2% của GPT-5.5, trong khi Terra và Luna đạt 88.8% và 88.4%. Khoảng cách lớn hơn trong việc trích xuất văn bản, nơi Sol đạt 82.5% so với 87.6% của GPT-5.5. Luna và Terra theo sau với 81.4% và 79.4%.
Là một phần của bộ tiêu chuẩn, chúng tôi đã tách biệt việc phiên âm toàn bộ văn bản khỏi việc trích xuất có mục tiêu. OCR yêu cầu mô hình phiên âm tất cả văn bản có thể nhìn thấy, trong khi trích xuất văn bản yêu cầu một thông tin cụ thể. Sol hoạt động tốt trên các ghi chú viết tay trong cả hai thiết lập, tạo ra bản phiên âm đầy đủ trong một trường hợp và trích xuất ngày tháng được yêu cầu trong trường hợp khác.
Sol hoạt động tốt trên văn bản được nhúng trong các khung cảnh hình ảnh phức tạp. Nó đọc được chuỗi kích thước lốp được in dọc theo bề mặt cong của một chiếc lốp bẩn và mòn. Trong một ví dụ khác, nó đã trích xuất tỷ số trực tiếp từ một chương trình phát sóng khúc côn cầu và trả về câu trả lời theo định dạng được yêu cầu, kiểm tra cả khả năng đọc hình ảnh và tuân thủ hướng dẫn.
Một số tác vụ trích xuất trông có vẻ đơn giản vẫn thất bại. Sol không thể đọc được ngày hết hạn in trên vỉ thuốc. Văn bản nhỏ, theo chiều dọc, độ tương phản thấp và bị ảnh hưởng bởi sự phản chiếu, điều này có thể giải thích cho lỗi này.
Đánh đổi
Những cải tiến về thị giác đi kèm với mức sử dụng token cao hơn trên toàn bộ dòng GPT-5.6. Sự khác biệt này ít quan trọng trong các thử nghiệm nhỏ, nhưng trở nên quan trọng hơn ở quy mô lớn, nơi khối lượng token làm tăng trực tiếp chi phí xử lý.
Sol trung bình mất gần 10 giây cho mỗi hình ảnh trong bộ tiêu chuẩn của chúng tôi. Terra giảm thời gian đó xuống còn khoảng 6 giây, trong khi Luna hoàn thành trong hơn 5 giây một chút. Luna mang lại sự cân bằng tốt nhất giữa độ trễ và chất lượng trong dòng sản phẩm, với tốc độ gần bằng Gemini 3.5 Flash trong khi vẫn vượt trội hơn GPT-5.5 về khả năng phát hiện và đếm.
Trong bộ tiêu chuẩn của chúng tôi, Sol có chi phí khoảng 2.5 cent mỗi hình ảnh, trở thành mô hình đắt thứ hai sau Claude Fable 5. Terra giảm chi phí trung bình xuống còn khoảng 1 cent mỗi hình ảnh, trong khi Luna có chi phí dưới 0.5 cent.
Với mức giá 0.8 cent mỗi hình ảnh, Gemini 3.5 Flash rẻ hơn nhiều so với Sol trong khi vẫn dẫn đầu các bộ tiêu chuẩn phát hiện và đếm của chúng tôi. Điều này làm cho nó trở thành một lựa chọn mạnh mẽ cho các khối lượng công việc đòi hỏi dữ liệu lớn, nơi chi phí tăng theo quy mô các lô hình ảnh lớn. Roboflow Playground cho phép bạn thử nghiệm Sol, Terra và Luna cùng với Claude Fable 5, Gemini 3.5 Flash và các VLM khác trên cùng các tác vụ.
Kết luận
Với GPT-5.6, OpenAI đã tiến gần hơn nhiều đến các VLM hàng đầu so với trước đây. Khả năng phát hiện đã chuyển từ điểm yếu thành một năng lực có thể sử dụng được, và khả năng đếm đã được cải thiện trên toàn bộ dòng mô hình.
Vẫn còn những giới hạn rõ ràng. Gemini 3.5 Flash vẫn là lựa chọn thực tế tốt hơn cho việc phát hiện và đếm khối lượng lớn trong bộ tiêu chuẩn của chúng tôi, đặc biệt là ở mức giá của nó.
GPT-5.6 cho thấy OpenAI hiện đang coi trọng thị giác hơn rất nhiều. Sol vẫn còn những khiếm khuyết, đặc biệt là về chi phí, độ trễ và một số trường hợp phát hiện không ổn định, nhưng sự tiến bộ là khó có thể phủ nhận. Đối với các tác nhân (agents), khả năng hiểu màn hình, quy trình làm việc với tài liệu và suy luận hình ảnh, bản phát hành này làm cho OpenAI trở thành một lựa chọn mạnh mẽ hơn nhiều so với trước đây.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.