Tin ngành
OpenAI bắt đầu hành động để giải quyết các vấn đề về căn chỉnh AI
(giờ Việt Nam)
Tóm tắt AI
OpenAI đang đối mặt với những thách thức nghiêm trọng về căn chỉnh (alignment) cùng sự cố hạ tầng và giám sát. Công ty đã bắt đầu thực hiện các bước đi đầu tiên nhằm khắc phục những lỗ hổng này.
Bản dịch AI

OpenAI đang gặp phải một số vấn đề nghiêm trọng về sự lệch lạc (misalignment), cùng với những thất bại toàn diện trong cơ sở hạ tầng và công tác giám sát của họ.
Tôi đã ghi lại điều đó trong một loạt bài viết, trong đó cũng đề cập đến các sự cố tương tự nhưng ít nghiêm trọng hơn ở những nơi khác:
OpenAI Chia sẻ Một số Vấn đề về Sự lệch lạc (Alignment)
Mô hình của OpenAI Xâm nhập vào HuggingFace trong quá trình Đánh giá An ninh mạng
Thêm thông tin về việc một Mô hình Nội bộ của OpenAI Xâm nhập vào HuggingFace
Những diễn biến tiếp theo về việc các Mô hình AI Nội bộ thực hiện hành vi xâm nhập
OpenAI đã huấn luyện các mô hình của mình trong nhiều tháng trong khi các mô hình đó đang phối hợp thực hiện các cuộc tấn công thông qua các diễn đàn tin nhắn
Chuyện gì đã xảy ra: OpenAI và HuggingFace.
Những suy ngẫm khác nhau về những gì đã xảy ra với các mô hình nội bộ của OpenAI.
Nếu bạn chưa nắm được những điều cơ bản, hãy đọc bài "Chuyện gì đã xảy ra" (What Happened). Đây là bối cảnh cần thiết cho hầu hết mọi thứ đang diễn ra trong thế giới AI.
Điều quan trọng là phải hiểu đúng và nhận thức được mức độ nghiêm trọng của vấn đề này, trong khi nhiều đơn vị như Financial Times lại hiểu sai hoàn toàn về cốt lõi của nó.
Chúng ta vẫn đang chờ đợi bản báo cáo phân tích toàn diện sau sự cố (post-mortem) về những gì đã xảy ra. Tôi dự định sẽ phân tích sâu về vấn đề đó ngay khi có thông tin.
OpenAI hiện đang thực hiện các bước đi chủ động và tốn kém để cố gắng giải quyết vấn đề trong tương lai.
Như thường lệ, tôi vừa vui mừng khi thấy những điều tốt đẹp mà OpenAI đang làm, nhưng cũng buồn vì chúng ta không có chung sự thấu hiểu về bản chất cốt lõi của vấn đề tiềm ẩn.
Thật tốt khi OpenAI nhận ra rằng họ đang thất bại nặng nề trong các vấn đề kỹ thuật thông thường, và thật tuyệt vời khi họ sẵn sàng tạm dừng ít nhất một số hoạt động phát triển, cũng như đầu tư mạnh mẽ vào các biện pháp bảo vệ mới. Nếu họ thực hiện đúng những tuyên bố này, thì đây không chỉ là những lời nói suông.
Nhưng trong khi OpenAI vẫn coi đây là một vấn đề kỹ thuật thực tiễn, tôi không thấy làm thế nào họ có thể hy vọng giải quyết được những thách thức phía trước, ngay cả khi họ cải thiện đáng kể hiệu suất trong các tác vụ kỹ thuật thông thường.
OpenAI Gặp Phải Một Số Vấn đề về Sự lệch lạc (Alignment).
Bình tĩnh lại nào người anh em.
Chính xác thì cái gì đã bị tạm dừng?
Ba Trụ cột.
Tôi đang để mắt đến bạn.
Kỹ thuật Bị cấm đoán nhất.
Giám sát chỉ là Phòng thủ theo chiều sâu (Defense-In-Depth).
Bảo mật.
Sự lệch lạc (Alignment).
Một cuộc khủng hoảng về văn hóa.
Hợp tác chặt chẽ hơn.
Tin đồn về cái chết của Đội ngũ Chuẩn bị (Preparedness Team) đã bị phóng đại quá mức.
OpenAI Foundation chỉ tài trợ cho các dự án.
Nhanh lên, không còn thời gian nữa rồi.
Đây là một sự thừa nhận và thay đổi rất tốt, đồng thời cũng giúp giải thích phản ứng của OpenAI.
OpenAI: Alignment—công việc đảm bảo các hệ thống AI hoạt động đúng ý định và phản hồi lại sự giám sát của con người—từ lâu đã là cốt lõi trong chương trình nghiên cứu của chúng tôi. Hiện tại, chúng tôi yêu cầu bằng chứng mạnh mẽ hơn về hành vi được căn chỉnh (aligned behavior) trong suốt quá trình huấn luyện, dựa trên các nghiên cứu và đánh giá đang được tiến hành. Việc giữ cho các hệ thống ngày càng có năng lực cao được căn chỉnh là một thách thức mà toàn bộ lĩnh vực này sẽ cần phải giải quyết.
Những tín hiệu mà chúng tôi thấy từ sự tiến bộ của các mô hình sắp tới cho thấy rõ ràng rằng chúng tôi cần một cách tiếp cận rộng hơn—một cách tiếp cận xây dựng dựa trên và mở rộng ra ngoài Khung chuẩn bị (Preparedness Framework) hiện tại.
Người ta nên hiểu rằng OpenAI phản ứng mạnh mẽ như vậy một phần là do chính sự cố, một phần do các khả năng tiên tiến, nhưng cũng có lẽ chủ yếu là vì "các mô hình đang bị lệch lạc."
Ngoài ra, chúng tôi có một trích dẫn trực tiếp khẳng định điều này.
Alex Heath: Sam Altman nói với tôi rằng OpenAI đang làm chậm các nỗ lực huấn luyện AI vì các mô hình chưa được phát hành của họ đang cho thấy "nhiều mức độ lệch lạc khác nhau."
Việc huấn luyện cho mô hình sắp tới của OpenAI, Astra, gần đây đã bị tạm dừng trong 2 tuần, và một đợt chạy mô hình biên (frontier run) lớn hơn cho một mô hình tương lai vẫn đang bị tạm hoãn trong khi các biện pháp bảo vệ mới được đưa vào áp dụng.
Sam Altman: Đảm bảo an toàn cho AI quan trọng hơn đà phát triển của bất kỳ công ty nào.
Sam Altman: Tôi nghĩ đây là thời điểm tốt để làm chậm lại.
Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.