Gary Marcus: The Road to AI We Can Trust
85

Thủ thuật

Gary Marcus đánh giá GPT-6 Astra: Bước tiến lớn nhưng vẫn lo ngại về độ tin cậy

(giờ Việt Nam)

Tóm tắt AI

Gary Marcus nhận định GPT-6 Astra là bước tiến thực sự khi OpenAI bắt đầu tích hợp mô hình thế giới biểu tượng, củng cố cho quan điểm mà ông theo đuổi suốt thập kỷ qua, dù vẫn còn hoài nghi về tính ổn định và khả năng kiểm soát.

Bản dịch AI

Hot take on GPT-6 AstraX avatar for @arcprize

ARC Prize@arcprize

GPT-6 Astra của @OpenAI đạt trạng thái SOTA trên ARC-AGI: - Astra đạt 63% trên ARC-AGI-3, và 99% thông qua một bộ điều hợp (adapter harness) mới - Nó vượt qua hiệu suất của con người trên 96% các cấp độ của ARC-AGI-3 - Nó xây dựng mô hình biểu tượng (symbolic model) chính xác nhất về các môi trường mới mà chúng ta từng thấy. Phân tích của chúng tôi:

7:39 CH · 3 thg 9, 2026 · 293K Lượt xem

51 Phản hồi · 194 Lượt đăng lại · 1.81K Lượt thích

Nhận định nóng về OpenAI GPT-6 Astra*1, kèm theo một thách thức đối với những tuyên bố của Greg Brockman về việc nó là AGI ở phần cuối:

Trông có vẻ khá ấn tượng. Nhiều báo cáo cho thấy đây là một bước tiến thực sự.

Là một người đã vận động gần một thập kỷ cho các mô hình thế giới (neuro)symbolic, thường xuyên phải đối mặt với sự phản đối dữ dội, tôi cảm thấy vô cùng được minh oan khi thấy một sản phẩm từ OpenAI tạo ra và thao tác rõ ràng với các mô hình thế giới biểu tượng trong quá trình thực hiện một số tính toán ấn tượng nhất của nó.

ARC Prize@arcprize

Astra tạo ra một mô hình thế giới biểu tượng nhỏ gọn và dày đặc để hoàn thành các môi trường ARC-AGI-3. Ví dụ, trong môi trường s5i5, Astra: - Ghi lại cấp độ hiện tại, hướng của hub và độ dài cơ chế: "L8: hub q2 (8↓). Độ dài: 14=1…" - Nó ánh xạ các thao tác tới các điều khiển chính xác: …

7:39 CH · 3 thg 9, 2026 · 19K Lượt xem

2 Phản hồi · 5 Lượt đăng lại · 153 Lượt thích

Điều chúng ta chưa biết là khả năng đó mạnh mẽ đến mức nào. Đó mới là câu hỏi then chốt.

Thành công trên ARC-AGI là rất tuyệt vời và ấn tượng, nhưng không phải — bất chấp cái tên của tác vụ — là bằng chứng của AGI; tôi nghi ngờ rằng chúng ta sẽ thấy vô số vấn đề với các tác vụ thế giới thực mở. Giống như các mô hình gần đây khác, tôi dự đoán hiệu suất tốt nhất sẽ nằm ở các lĩnh vực có thể kiểm chứng.

Và với tư cách là một nhà khoa học, thật đáng thất vọng khi chúng ta (vẫn chưa?) biết nhiều về cách hệ thống thực sự vận hành.

Nếu không hiểu rõ hơn về những gì diễn ra bên trong, tôi cảm thấy ít tự tin hơn về cả những gì nó có thể và không thể làm, cũng như những rủi ro mới mà chúng ta có thể gặp phải. Tôi nghi ngờ rằng thế giới đã sẵn sàng cho điều này.

Như thường lệ, những người đam mê đã có cái nhìn sớm; còn những người hoài nghi thì không. Đó là một chiến lược tiếp thị hợp lý, nhưng nó thường tỏ ra gây hiểu lầm. Những gì chúng ta thường thấy là sự nhiệt tình ban đầu sẽ giảm dần theo thời gian. Tôi nghi ngờ chúng ta cũng sẽ thấy điều đó ở đây.

Hệ thống mới dường như khó giám sát hơn các hệ thống trước đây, điều này không tốt dưới góc độ an toàn. Người ta thực sự không muốn có thêm khả năng đi kèm với việc giảm khả năng giám sát. Nhưng nó cũng dễ căn chỉnh (alignable) hơn, không rõ tại sao.

Sẽ rất tuyệt nếu xem liệu Astra có thể đạt được tiến bộ nào trong mười tác vụ mà Miles Brundage và tôi đã đặt cược vào cuối năm 2024 hay không. (Theo tôi biết, chưa có AI nào thành công với bất kỳ tác vụ nào trong số đó.)

Nhận định nóng này rất tạm thời, chờ đợi thêm thông tin về cách hệ thống hoạt động và kiểm tra chi tiết hơn về các hạn chế của nó.

Chia sẻ

Không có bài đăng nào

GPT-6OpenAIGary MarcusAI thế giớiĐánh giá AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Gary Marcus: The Road to AI We Can Trust. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.