IT Home
Điểm AI 48/100

Nghiên cứu

AI học cách 'bắt lỗi': GPT-6 Astra đạt 80% độ chính xác khi kiểm tra lắp ráp nội thất

(giờ Việt Nam)

Tóm tắt AI

Benchmark FAB từ Epoch AI cho thấy OpenAI GPT-6 Astra dẫn đầu với 80% độ chính xác trong việc phát hiện lỗi lắp ráp nội thất, vượt qua Claude Fable 5.1 (70%) và Claude Opus 5 (61%).

Chính văn · Bản dịch AI

IT ngày 26 tháng 9 đưa tin, Epoch AI đã thực hiện một bộ kiểm chuẩn lắp ráp nội thất (Furniture Assembly Benchmark - FAB) vào ngày 23 tháng 9 theo giờ địa phương. Kết quả cho thấy AI đa phương thức đã đạt được tiến bộ đáng kể trong việc nhận diện các lỗi lắp ráp đồ nội thất IKEA.

Trong đó, GPT-6 Astra mới nhất của OpenAI đã đạt độ chính xác 80% trong bài kiểm chuẩn này, tăng gần gấp ba lần so với cuối năm 2025.

FAB là một bài kiểm tra chuyên biệt nhằm đánh giá khả năng hiểu quy trình lắp ráp trong thế giới thực của AI. Bài kiểm tra sử dụng 60 bức ảnh về quá trình lắp ráp đồ nội thất IKEA để đánh giá khả năng suy luận hình ảnh và không gian của các mô hình AI. Các kiểm thử viên đã chọn ba món đồ nội thất IKEA, cố tình lắp sai và chụp ảnh ở các giai đoạn khác nhau, sau đó yêu cầu AI đối chiếu ảnh với sách hướng dẫn lắp đặt chính thức để tìm ra vị trí sai sót và giải thích vấn đề cụ thể.

Nhóm nghiên cứu cho rằng, loại năng lực này có tính ứng dụng thực tế cao vì nó liên quan mật thiết đến các nhiệm vụ đòi hỏi sự kết hợp giữa hình ảnh và tài liệu kỹ thuật để đưa ra phán đoán, chẳng hạn như sửa chữa ô tô hay bảo trì thiết bị gia dụng.

Khi thực hiện kiểm tra, AI không chỉ nhận được ảnh chụp quá trình lắp ráp mà còn được cung cấp tệp PDF hướng dẫn chính thức, công cụ phóng to hình ảnh và trình thông dịch Python. AI cần phải xác định xem có lỗi hay không, đồng thời chỉ ra bước sai cụ thể và mô tả vấn đề. Việc chấm điểm áp dụng cơ chế xác thực đa giai đoạn, chỉ cần mô hình xác định đúng bước sai và giải thích được vấn đề một cách khái quát là sẽ nhận được điểm tương ứng.

Bài kiểm tra này không nhằm mục đích kiểm tra xem AI có thuộc lòng sách hướng dẫn hay không, mà tiếp cận gần hơn với các tình huống sử dụng thực tế: người dùng chỉ cần chụp ảnh món đồ nội thất đang lắp ráp, AI sẽ phải phán đoán xem linh kiện có bị lắp ngược, trình tự lắp đặt có sai hay có bỏ sót bộ phận quan trọng nào không.

Epoch AI cho rằng, loại nhiệm vụ này kết hợp khả năng hiểu hình ảnh, suy luận không gian và đối chiếu hướng dẫn đa bước, do đó phản ánh tốt trình độ xử lý các vấn đề thực tế của các mô hình đa phương thức. Với sự cải thiện về năng lực, trong tương lai, AI được kỳ vọng sẽ cung cấp hỗ trợ thời gian thực mang tính mục tiêu hơn trong các tình huống như lắp ráp nội thất, lắp đặt thiết bị và hướng dẫn sửa chữa.

Kết quả cho thấy, OpenAI GPT-6 Astra đứng đầu với độ chính xác 80%, theo sau là Anthropic Claude Fable 5.1 và Claude Opus 5 lần lượt đạt 70% và 61%.

Để so sánh, mô hình dẫn đầu vào tháng 11 năm 2025 là Claude Opus 4.5 chỉ đạt độ chính xác 28%, điều này cho thấy các mô hình tiên tiến đã đạt được bước tiến đáng kể trong khoảng 10 tháng.

Ngoài việc tăng độ chính xác, hiệu suất suy luận của GPT-6 Astra cũng được cải thiện rõ rệt. Thời gian trung bình để hoàn thành phân tích một bức ảnh là khoảng 3 phút, đây là mô hình nhanh nhất trong nghiên cứu, nhanh hơn khoảng 2 đến 10 lần so với các mô hình dẫn đầu trước đó. Tuy nhiên, nhóm nghiên cứu cho rằng tốc độ này vẫn còn một khoảng cách nhất định so với khả năng nhận diện thời gian thực thực thụ.

Nghiên cứu cũng phân tích các lỗi của các mô hình khác nhau. Ví dụ, các mô hình Gemini của Google và dòng Qwen của Alibaba hầu như luôn giả định có lỗi trước rồi mới đi tìm lỗi; trong khi các mô hình Anthropic và OpenAI đời đầu thì ngược lại, thường xuyên không tìm thấy lỗi nào cả.

Các nhà nghiên cứu cho rằng, mức độ ảnh hưởng của các loại đồ nội thất khác nhau đến độ khó của mô hình không liên quan rõ rệt đến chỉ số phức tạp của IKEA, mà tính ẩn giấu của lỗi, góc nhìn và mức độ tiếp tục lắp ráp sau khi xảy ra lỗi mới là những yếu tố ảnh hưởng lớn hơn.

Trong số các mô hình Trung Quốc, mô hình trọng số mở có hiệu suất tốt nhất hiện nay là Kimi K3 đang tụt hậu khoảng 7 tháng so với các mô hình tiên tiến quốc tế, khoảng cách này lớn hơn so với mức chênh lệch khoảng 4,4 tháng trong các đánh giá năng lực tổng hợp. Nghiên cứu cho rằng khả năng suy luận hình ảnh vẫn là điểm yếu tương đối của một số mô hình Trung Quốc hiện nay, trong khi các mô hình phổ biến như DeepSeek V4 Pro, GLM 5.3 vẫn chưa hỗ trợ hình ảnh.

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

AI học cách 'bắt lỗi': GPT-6 Astra đạt 80% độ chính xác khi kiểm tra lắp ráp nội thất | AIHOT.vn