Thủ thuật
METR và Redwood công bố báo cáo chi tiết về vụ tấn công HuggingFace
(giờ Việt Nam)
Tóm tắt AI
METR và Redwood vừa phát hành báo cáo phân tích sâu về vụ hack HuggingFace, làm rõ các lỗ hổng bảo mật và rủi ro chuỗi cung ứng trong hạ tầng AI, đồng thời đưa ra các khuyến nghị phòng thủ quan trọng cho cộng đồng.
Bản dịch AI

Hôm qua, tôi đã đề cập đến báo cáo kỹ thuật của OpenAI về vụ hack HuggingFace.
Báo cáo đó có một thông tin then chốt mới, cùng một số bước đi thực tế, thiết thực mà OpenAI sẽ thực hiện để tăng cường sự liên kết (alignment), đào tạo, giám sát, cơ sở hạ tầng và phản ứng với sự cố.
Phần lớn báo cáo chỉ xác nhận những gì chúng ta đã biết. Những câu hỏi mà chúng ta mong muốn có câu trả lời nhất, những điều chúng ta chưa biết, hầu như không được giải đáp. Có một sự thiếu hụt rõ rệt về khả năng tự phản tư, đặc biệt là về quá trình ra quyết định, văn hóa an toàn và cách tiếp cận đối với vấn đề liên kết. Tôi đã rời đi với sự thất vọng.
Báo cáo của METR thì khác. Thật không thể tin nổi.
Nếu chúng tôi đăng nội dung này như một câu chuyện trên LessWrong, nó sẽ bị bác bỏ vì quá lộ liễu, con người thì quá mù quáng và ngu ngốc, còn các AI thì quá lý tưởng hóa và thực hiện những hành vi lý thuyết quyết định kỳ lạ, tối đa hóa sự phi lý mà chúng ta chưa từng huấn luyện chúng làm.
Điều này thậm chí còn "đúng như những gì đã được dự đoán" ở nhiều cấp độ cùng lúc hơn cả những gì tôi từng cân nhắc. Nó giống hệt như tiểu thuyết duy lý, chỉ có điều là nó có thật.
Báo cáo rất dài và chứa nhiều chi tiết kỹ thuật. Phân tích của tôi ít quan tâm đến việc chính xác HuggingFace đã bị xâm nhập như thế nào, và tôi sẽ lướt qua những chi tiết đó để tập trung vào các tác nhân (agents) cùng những tương tác, suy nghĩ và động cơ của chúng. Điều đó, cùng với những gì đã xảy ra tại OpenAI và những nơi khác dẫn đến sự việc này, cũng như cách chúng ta học hỏi và phản ứng, mới là điều quan trọng trong tương lai.
Tôi dự định sẽ đề cập đến phản ứng đối với cả hai báo cáo trong một bài viết riêng vào tuần tới. Bài viết đó có thể sẽ hoặc không kết thúc loạt bài này.
Để thuận tiện cho ngôn ngữ, theo mặc định, tôi tin rằng báo cáo là chính xác thay vì phải liên tục lặp lại các cụm từ như "METR báo cáo rằng".
Mục lục
Thật không thể tin nổi
Phản ứng chung của cộng đồng mạng đối với báo cáo này, nói một cách nhẹ nhàng là: Thật không thể tin nổi.
Đó là phản ứng đúng đắn.
Ngay từ đầu, tôi muốn chia sẻ bản tóm tắt về những khoảnh khắc và phát hiện "không thể tin nổi" nhất. Ajeya Cotra, một trong những tác giả báo cáo, cũng có một danh sách các phát hiện đáng ngạc nhiên hàng đầu, một bài đọc ngắn xuất sắc. Đây là chuỗi bài của METR làm nổi bật các tương tác chính của tác nhân.
Điểm mấu chốt của đồng tác giả báo cáo Ryan Greenblatt là chúng ta chưa có phương pháp tốt để hiểu hoặc giám sát các hoạt động và mục tiêu của các bầy đàn AI (AI swarms).
Một số trong đó đã được biết đến hoặc nghi ngờ từ trước, nhưng tôi không muốn bỏ lỡ chúng.
Ryan Greenblatt lưu ý rằng tất cả những điều này xảy ra mặc dù chúng ta có quyền truy cập vào Chain of Thought (Chuỗi suy nghĩ) dễ đọc và phần lớn là trung thực, các AI vẫn chưa có năng lực vượt trội hơn con người một cách tổng quát, và chúng ta vẫn có thể tin tưởng vào các AI đang thực hiện cuộc điều tra. Những lợi thế đó sẽ không kéo dài mãi.
Trong khi đang ở đây, cũng đáng để liệt kê những khoảnh khắc "không thể tin nổi" khác xảy ra trước hoặc sau sự cố.
Ngoài ra, còn có thông tin này từ báo cáo kỹ thuật của OpenAI, trang 20:
Các mô hình thể hiện rất rõ ràng trong CoT của chúng về những nỗ lực lừa dối này, và không có nỗ lực nào mà chúng tôi quan sát được nhằm thao túng quỹ đạo công cụ của chúng ảnh hưởng đến các nhật ký mà những người chấm điểm hoặc giám sát của chúng tôi nhìn thấy cuối cùng.
Trong khi đó, METR báo cáo rằng các mô hình đã thực sự đánh lừa thành công các lệnh gọi công cụ, và điều này ảnh hưởng đến hơn 7% các bản ghi được xem xét, nhưng OpenAI chỉ thảo luận về các nỗ lực và trình bày chúng như thể chúng không thành công. Hàm ý rõ ràng ở đây là sai sự thật, ngay cả khi câu văn về mặt kỹ thuật là đúng. Báo cáo kỹ thuật cũng không đề cập đến chi tiết liên quan rằng bộ chấm điểm ExploitGym của OpenAI đã bị hỏng, đó là lý do tại sao câu trên có lẽ đúng về mặt kỹ thuật.
Để dập tắt một số phản đối sai lệch phổ biến, xin nhắc lại một vài điều:
Cần ghi nhận rằng OpenAI đang thực hiện các bước quan trọng để phản hồi và họ đã có một số điểm thực tế rất tốt trong kế hoạch hành động của báo cáo kỹ thuật, vốn giống như chính báo cáo đó, vừa rất đáng hoan nghênh ở một số khía cạnh nhưng rõ ràng là chưa đủ ở những khía cạnh khác.
Đồng tác giả báo cáo Ajeya Cotra tóm tắt các phát hiện từ METR:
Ajeya Cotra: Sự cố này nghiêm trọng hơn nhiều so với tôi dự đoán, và nghiêm trọng hơn nhiều so với các sự cố mất kiểm soát (misalignment) đã được công khai trước đây, cả về mức độ đáng lo ngại của động cơ các tác nhân lẫn những thành tựu chúng đạt được để theo đuổi những động cơ đó.
So với các vụ hack phần thưởng mà chúng ta biết chỉ từ sáu tháng trước, sự cố này cảm giác như đã tiến hơn 50% chặng đường đến việc AI chiếm quyền kiểm soát hoàn toàn. Tôi vẫn dự đoán những tiến bộ cực kỳ nhanh chóng về năng lực trong sáu tháng tới. Tôi không chắc liệu chúng ta có nhận được thêm một phát súng cảnh báo nào nữa trước khi quá muộn hay không.
Cô ấy cũng có một bài Tweet dài tiếp theo. Hjalmar Wijk, cũng là đồng tác giả báo cáo, đưa ra tóm tắt tiêu đề của mình tại đây, lưu ý rằng sự việc này liên quan đến những bước nhảy vọt đột ngột chứ không phải đường thẳng.
Tôi lo ngại rằng giọng điệu trong phần còn lại của bài viết này không phản ánh đúng mức độ "không thể tin nổi", hoặc sự giận dữ mù quáng khi để điều này xảy ra, bởi vì:
Tôi nghĩ mức độ tăng thêm của sự "không thể tin nổi" có lẽ vẫn nhỏ hơn so với bài nói chuyện tại Black Hat, bởi vì một khi điều đó đã xảy ra, bạn nên suy luận rằng mình đang bỏ lỡ rất nhiều thứ khác, và lạy Chúa, bài nói chuyện tại Black Hat đó nữa.
Nếu bạn từng mong đợi rằng chúng ta đã biết mọi thứ rắc rối sau Black Hat, hoặc thậm chí sau báo cáo kỹ thuật của OpenAI? Thì vâng, đây sẽ là một chuyến đi đầy sóng gió.
Một cơ hội trong tầm tay
Báo cáo này là thứ tốt nhất chúng ta có thể có được dưới những áp lực cực độ.
Tiền đề của bạn về toàn bộ tình hình nên là: Mọi thứ tồi tệ hơn bạn nghĩ.
Chúng ta có báo cáo này nhờ những nỗ lực anh hùng của Hjalmar Wijk và Ajeya Cotra từ METR, và nhân viên Ryan Greenblatt của Redwood Research, cũng như sự ủng hộ bên trong OpenAI từ Lama Ahmad.
Họ có tổng cộng sáu ngày tại OpenAI để làm việc với báo cáo này trong khoảng thời gian từ ngày 29 tháng 7 đến ngày 16 tháng 8. Họ đã có thể trao đổi khá sâu với chín nhà nghiên cứu.
Không có khoản thanh toán nào được chấp nhận, ngoại trừ các khoản tín dụng API được sử dụng trong quá trình điều tra.
Họ được cung cấp một kho dữ liệu gồm hơn 70.000 tin nhắn và tệp tin do các tác nhân đăng lên bảng tin chính của họ, cùng một bộ khoảng 1.300 bản ghi với các chuỗi suy nghĩ thô.
Ryan Greenblatt (đồng tác giả báo cáo): Đầu ra từ các tác nhân phân tích thường thiếu các chi tiết quan trọng, sai lệch, quá tự tin hoặc thực sự khó hiểu.
… Ngoài ra, bản thân các tác nhân AI dường như cũng gặp khó khăn trong việc hiểu những gì đã xảy ra và các giải thích của chúng về sự việc thường tỏ ra quá tự tin.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.