Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Thử nghiệm thực tế: GPT-6 Astra đối đầu Claude Fable 5/5.1 trong điều khiển cánh tay robot

(giờ Việt Nam)

Tóm tắt AI

So sánh khả năng điều khiển cánh tay robot YAM giữa GPT-6 Astra và Claude Fable 5/5.1. Kết quả cho thấy GPT-6 Astra hoàn thành 19/20 nhiệm vụ xếp bát nhưng vẫn gặp khó khăn tương tự đối thủ ở bài toán xếp hình.

Bản dịch AI

GPT-6 Astra on robotic manipulation

Ngày 4 tháng 9 năm 2026

Bài viết tiếp nối so sánh của chúng tôi giữa Claude Fable 5 và Fable 5.1. Chúng tôi đã để GPT-6 Astra của OpenAI điều khiển cùng các cánh tay robot YAM dưới cùng chính sách tác nhân Inspect Robots, trên cùng hai nhiệm vụ:

“Nhặt khối màu đỏ trên bàn và đặt nó vào trong bát.”

“Nhặt mảnh ghép hình tròn màu xanh bằng núm ở giữa và đặt nó vào rãnh tròn tương ứng trên bảng.”

Đối với nhiệm vụ với cái bát, Astra đã đặt khối vào bát thành công trong 19 trên 20 lần thử, so với 8 trên 20 của Fable 5.1 và 1 trên 20 của Fable 5, với thời gian 2,5 phút mỗi lần thử so với 6,8 phút của Fable 5.1, cùng chi phí ước tính là 0,94 USD mỗi lần chạy so với 2,12 USD.

Nhiệm vụ xếp hình lại là một câu chuyện khác: Astra hoàn thành việc lắp ghép 2 lần trong 20 lần thử, ngang bằng với 2 trên 20 của Fable 5.1. Nó tiếp cận được rãnh nhưng bị khựng lại ở cùng bước cuối cùng như Fable, với chi phí 1,36 USD mỗi lần chạy so với 2,18 USD.

Khối vào bát: lần chạy hoàn thành tốt nhất của mỗi mô hình (giai đoạn cao nhất, sau đó là thời gian ngắn nhất), mỗi lần được phát theo thời gian riêng ở cùng tốc độ tăng tốc. Bộ đếm thời gian hiển thị thời gian thực đã trôi qua với các khoảng dừng suy nghĩ đã được loại bỏ.

Astra hoàn thành nhiệm vụ với cái bát thường xuyên hơn nhiều, với chi phí mỗi lần chạy chỉ bằng khoảng một nửa.

2026-09-04T18:50:02.475437 image/svg+xml Matplotlib v3.11.1, https://matplotlib.org/ $1 $2 $3 0 20 40 60 80 100 tỷ lệ hoàn thành (%) Fable 5 Fable 5.1 GPT-6 Astra tỷ lệ hoàn thành cao hơn 2,4 lần rẻ hơn 2,3 lần Khối vào bát $1 $2 $3 Fable 5 Fable 5.1 GPT-6 Astra cùng tỷ lệ hoàn thành rẻ hơn 1,6 lần Mảnh ghép vào rãnh chi phí ước tính mỗi lần chạy (USD, giá niêm yết)

Các dấu chấm lớn là giá trị trung bình của điều kiện; các dấu chấm mờ là các lần thử riêng lẻ (100 nếu hoàn thành, 0 nếu không) theo chi phí tương ứng.

Chấm điểm

Mỗi lần thử được chấm điểm bởi một người đánh giá dựa trên giai đoạn cao nhất mà nó đạt được, vì vậy một lần chạy thất bại vẫn ghi lại được mức độ tiến triển của nó. Thang điểm không thay đổi so với báo cáo Fable.

Astra đặt khối vào bát gần như mọi lúc; đối với nhiệm vụ xếp hình, nó bị khựng lại ở cùng vị trí với Fable.

2026-09-04T18:50:02.444943 image/svg+xml Matplotlib v3.11.1, https://matplotlib.org/ Fable 5 (n=20) Fable 5.1 (n=20) GPT-6 Astra (n=20) 2 13 3 2 6 2 2 8 19 Khối vào bát 0 20 40 60 80 100 tỷ lệ các lần thử (%) Fable 5 (n=20) Fable 5.1 (n=20) GPT-6 Astra (n=20) 2 11 2 5 4 4 9 2 3 6 8 2 Mảnh ghép vào rãnh 0 không tiếp cận 1 tiếp xúc 2 đã nhấc 3 đã định vị 4 đã đặt

Tỷ lệ các lần thử theo mỗi mô hình đạt đến từng giai đoạn; n mỗi hàng là số lần thử trong ô đó.

Kết quả

Tất cả các lần chạy

Mọi lần thử được tính, tổng cộng 120 lần.

Thông số kỹ thuật

Hạn chế

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.