Thủ thuật
Gary Marcus cảnh báo OpenAI sắp vượt qua lằn ranh đỏ về an toàn AI
(giờ Việt Nam)
Tóm tắt AI
Gary Marcus cảnh báo OpenAI đang phát triển công nghệ mới có thể khiến việc giám sát chuỗi suy luận (Chain-of-Thought) của AI trở nên bất khả thi, đe dọa nghiêm trọng đến an toàn hệ thống.
Bản dịch AI

The Information vừa đưa tin độc quyền rằng OpenAI đang thử nghiệm một kỹ thuật mới, trong đó các mô hình sẽ tiết lộ ít hơn về "quá trình suy nghĩ" của chúng, khiến việc giám sát trở nên khó khăn hơn.

Như Zack Korman và tôi đã lập luận ở đây vài ngày trước, việc giám sát tốt hơn là một trong những yếu tố có thể đã ngăn chặn sự cố Hugging Face, theo chính lời thừa nhận của OpenAI:

Các kỹ thuật mới mà họ đang khám phá có thể khiến việc giám sát như vậy trở nên khó khăn hoặc bất khả thi.
Năm ngoái, một nhóm các chuyên gia hàng đầu đã viết một bài báo đầy thú vị mà giờ đây cảm thấy vô cùng phù hợp, có tiêu đề "Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety" (Khả năng giám sát chuỗi suy nghĩ: Một cơ hội mới và mong manh cho an toàn AI). Tôi hoàn toàn đồng ý với phần được làm nổi bật:

Họ hoàn toàn đúng. Việc giám sát CoT (Chain of Thought) vẫn còn khiếm khuyết (như Subbarao Kambhampati và những người khác đã chỉ ra), nhưng đó là một trong những sợi dây liên kết tốt nhất mà chúng ta có để giám sát các "hộp đen" khổng lồ mà chúng ta gọi là LLM. Đó là một sợi dây mong manh, nhưng việc hy sinh nó để đổi lấy một sự cải thiện hiệu suất (nhỏ?) có vẻ là một trò chơi nguy hiểm.
Tối nay, Steven Adler, từ Guidelight.ai và là một trong nhiều nhà nghiên cứu đã rời khỏi các nhóm an toàn của OpenAI, đã nói điều này, lặp lại ý kiến của Nathan Calvin:

Steven Adler@sjgadler
Nếu điều này là sự thật, OpenAI dường như đang vi phạm một trong số ít những lằn ranh đỏ tồn tại trong ngành công nghiệp AI. Tuyệt đối đừng huấn luyện các mô hình của bạn theo cách này - chuyện gì đang xảy ra vậy??

Nathan Calvin @_NathanCalvin
Một câu chuyện thực sự lớn và cực kỳ đáng lo ngại từ The Information tối nay. Có vẻ như OpenAI đã sử dụng một bước đột phá trong "neuralese" cho Astra, thứ có thể phá hủy khả năng giám sát chuỗi suy nghĩ - mặc dù nguồn tin của The Information cho biết OpenAI hiện đang "hạn chế việc sử dụng https://t.co/hVfR0DGWPw
1:25 SA · 2 tháng 9, 2026 · 41,7 N lượt xem
20 Phản hồi · 20 Đăng lại · 250 Lượt thích
Tôi hoàn toàn, 100% đồng ý.
Chia sẻ
Tái bút: Phần thưởng cho những ai thích các tài liệu tham khảo về Terminator:
Jesse Singal@jessesingal
chúng ta đang cầu xin để bị Skynet tiêu diệt đây mà
Stephanie Palazzolo @steph_palazzolo
AI Astra của OpenAI sử dụng một phương pháp lập luận mới gọi là "recurrent depth" (chiều sâu đệ quy). Mặc dù nó có thể giúp ích cho chi phí và hiệu suất của mô hình, các nhà nghiên cứu lo ngại vì nó làm lu mờ quá trình suy nghĩ của mô hình, khiến việc giám sát trở nên khó khăn hơn. w/ @amir @rocketalignment https://t.co/ksprupu2h5
1:54 SA · 2 tháng 9, 2026 · 6,71 N lượt xem
10 Phản hồi · 5 Đăng lại · 77 Lượt thích
Không có bài đăng nào
Bài viết được AI dịch và tổng hợp tự động từ Gary Marcus: The Road to AI We Can Trust. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.