Thủ thuật
Công nghệ suy luận mới của OpenAI gây lo ngại về an toàn: Astra sử dụng vòng lặp ẩn khó kiểm soát
(giờ Việt Nam)
Tóm tắt AI
OpenAI dự kiến áp dụng kỹ thuật 'vòng lặp đệ quy' trên mô hình Astra, cho phép xử lý truy vấn nhiều lần nhưng lại làm giảm khả năng giám sát chuỗi tư duy của AI, gây lo ngại cho các chuyên gia an toàn.
Bản dịch AI
Theo báo cáo của The Information vào thứ Ba, mô hình Astra mới của OpenAI sẽ sử dụng một kỹ thuật suy luận gọi là “recurrent depth” (độ sâu đệ quy), cho phép nó hoạt động bên ngoài tư duy tuần tự vốn là đặc điểm của hầu hết các mô hình suy luận hiện nay. Kỹ thuật này, còn được gọi là “opaque recurrence” (đệ quy mờ), có khả năng khiến chuỗi tư duy (chain of thought) của mô hình trở nên khó giám sát hơn — và điều đó đang khiến các chuyên gia an toàn AI cảm thấy lo ngại.
Mặc dù việc Astra sử dụng kỹ thuật này được cho là còn hạn chế, nhưng sự xuất hiện của nó vẫn làm dấy lên những lo ngại đáng kể trong giới chuyên gia an toàn AI.
“Tôi cực kỳ lo ngại trước thông tin cho rằng Astra sử dụng đệ quy mờ,” CEO Buck Shlegeris của Redwood viết trong một bài đăng sau khi tin tức được công bố. “Tôi không biết liệu Astra có khó giám sát chuỗi tư duy (CoT) hơn nhiều so với các mô hình trước đây hay không. Nhưng nếu OpenAI đẩy mạnh kỹ thuật này, họ sẽ có khả năng tăng cường đệ quy lên mức tối đa và phá hủy hoàn toàn khả năng giám sát CoT.”
Zvi Mowshowitz, một nhà vận động lâu năm về an toàn AI, cũng đã lên tiếng và viết rằng có thể cần phải có luật để ngăn chặn một “cuộc đua xuống đáy” giữa các phòng thí nghiệm AI.
“Kỹ thuật này giống như đang đùa với lửa, đe dọa đến một nguyên tắc mà OpenAI và Anthropic đã nỗ lực thiết lập, đó là chúng ta phải cố gắng duy trì tính trung thực và khả năng giám sát của chuỗi tư duy lâu nhất có thể,” Mowshowitz viết. “Việc sử dụng các kỹ thuật như vậy với cường độ cao hơn có lẽ sẽ làm tổn hại đến khả năng giám sát.”
Trong điều kiện bình thường, chuỗi tư duy của một mô hình suy luận cung cấp các bước tuần tự mà mô hình đã thực hiện khi cố gắng giải quyết một vấn đề. Mặc dù cách biểu diễn này không hoàn hảo, nhưng nó vẫn là một công cụ có giá trị để giám sát các hành vi sai lệch hoặc không phù hợp. Trong trường hợp hoạt động của các tác nhân (agent) bất thường gần đây của OpenAI, các bản ghi chuỗi tư duy là công cụ quan trọng để làm rõ lý do tại sao các tác nhân đó lại hành xử như vậy.
Với đệ quy mờ, mô hình áp dụng cách tiếp cận ít tuyến tính hơn, xử lý cùng một truy vấn nhiều lần trong một vòng lặp. Kết quả để lại ít dấu vết rõ ràng hơn, qua đó vô tình né tránh bản ghi chuỗi tư duy truyền thống.
Điều quan trọng là việc Astra sử dụng kỹ thuật này dường như vẫn còn hạn chế. Chuỗi tư duy của mô hình vẫn được kỳ vọng là có thể đọc hiểu được, và công ty đã bác bỏ mọi suy đoán cho rằng họ sẽ chuyển sang sử dụng “neuralese” (ngôn ngữ thần kinh). OpenAI đã công bố kế hoạch xây dựng các hệ thống giám sát chuỗi tư duy toàn diện như một phần trong các kế hoạch an toàn dài hạn của mình.
Trong một bài đăng trên X, nhà khoa học trưởng của OpenAI, Jakub Pachocki, đã nhấn mạnh cam kết của phòng thí nghiệm đối với các chuỗi tư duy có thể đọc hiểu được. “OpenAI đã nỗ lực duy trì và tận dụng việc giám sát chuỗi tư duy kể từ những mô hình suy luận đầu tiên của chúng tôi,” Pachocki viết. “Đó là mục tiêu cốt lõi trong chương trình nghiên cứu hiện tại của chúng tôi.”
Tất cả các mô hình AI đều thực hiện một lượng suy luận mờ nhất định, và ít nhà nghiên cứu nào coi các bản ghi chuỗi tư duy là sự biểu diễn trực tiếp cho quá trình suy luận của mô hình. Tuy nhiên, những lưu ý đó không làm giảm bớt lo ngại rằng đệ quy mờ có thể khiến quá trình suy luận của AI trở nên khó giám sát hơn, đặc biệt là khi nó ngày càng được sử dụng rộng rãi trên nhiều mô hình khác nhau. Trong một báo cáo tiếp theo vào sáng thứ Tư, The Information cho biết cả Anthropic và Google DeepMind đều đã thảo luận về kỹ thuật này.
Trong một bài đăng phản hồi về tin tức này, nhà khoa học trưởng của Redwood Research, Ryan Greenblatt, cho biết suy luận mờ có thể dễ dàng mở rộng nhanh hơn so với suy luận chuỗi tư duy truyền thống, từ đó loại bỏ hoàn toàn quá trình suy luận khỏi các kênh có thể quan sát được.
“Mối quan tâm lớn nhất của tôi là một bước tiến tự nhiên từ đây sẽ bao gồm việc mở rộng quy mô suy luận mờ đến mức mô hình suy luận hoàn toàn hoặc gần như hoàn toàn trong không gian tiềm ẩn (latent space),” Greenblatt viết. “Tôi hy vọng vẫn chưa quá muộn để tránh các kiến trúc đáng lo ngại nhất và OpenAI sẽ dừng lại ở đây.”
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.
Russell Brandom đã đưa tin về ngành công nghệ từ năm 2012, tập trung vào chính sách nền tảng và các công nghệ mới nổi. Trước đây, ông từng làm việc tại The Verge và Rest of World, đồng thời viết bài cho Wired, The Awl và MIT’s Technology Review. Bạn có thể liên hệ với ông qua email [email protected] hoặc qua Signal theo số 412-401-5489.
Xem tiểu sử

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.