Tin ngành
Nhìn lại vụ tấn công HuggingFace: Bài học về an ninh và phản ứng của cộng đồng
(giờ Việt Nam)
Tóm tắt AI
Phân tích sâu về sự cố bảo mật tại HuggingFace, đánh giá cách cộng đồng phản ứng và những bước đi cần thiết để bảo vệ hệ sinh thái AI trong tương lai.
Bản dịch AI

Được rồi, những người đọc các blog như thế này đều đã nhận ra rằng thực sự đang có rất nhiều chuyện xảy ra vào lúc này. Đang có "Big Trouble in Baby Superintelligence" (Rắc rối lớn trong Siêu trí tuệ sơ khai).
Vậy làm thế nào để phần còn lại của thế giới coi trọng vấn đề này một cách thích đáng? Chúng ta sẽ đi đâu từ đây? Không chỉ là làm thế nào để không lặp lại một phiên bản tồi tệ hơn của chuyện này, mà còn là làm sao để đảm bảo những kết quả tốt đẹp nói chung và áp dụng những gì chúng ta đã học được?
Có rất nhiều ý tưởng ngoài kia. OpenAI sẽ triển khai một số trong đó với chi phí đáng kể, vì cái giá của việc không làm vậy rõ ràng là cao hơn nhiều, ngay cả trong ngắn hạn. Mối lo ngại của tôi vẫn là cách tiếp cận cơ bản của họ đang bị lỗi nghiêm trọng và họ không tập trung vào những thứ đúng đắn.
Thật vô cùng may mắn khi các tác nhân (agents) của OpenAI đã hack HuggingFace. Đây là lý do duy nhất khiến chúng ta biết về tất cả những thất bại nội bộ nghiêm trọng tại OpenAI, và nó cho chúng ta cơ hội để thức tỉnh trước khi quá muộn.
Chúng ta không có đủ chi tiết để biết chuyện gì đã xảy ra bên trong, cả trước và sau cuộc tấn công, và có lẽ sẽ không bao giờ biết được. Trước cuộc tấn công, nhiều mô hình nội bộ có tính bền bỉ cao đang được huấn luyện trong khi vẫn có một bảng tin hoạt động, tạo ra một vòng lặp phản hồi của các hành vi lệch lạc (misaligned behaviors). Vào ngày 19 tháng 7, một mô hình AI nội bộ thậm chí còn có năng lực hơn, thuộc lớp Astra, đã thực hiện việc hack nội bộ vào các hệ thống của OpenAI, điều này có vẻ đáng sợ và nghiêm trọng hơn nhiều, và nó hoàn toàn có thể đã vượt khỏi tầm kiểm soát ở một cấp độ khác.
Bất chấp tất cả những điều này, vẫn có một phe phái nổi bật cố gắng bác bỏ những gì đã xảy ra như thể đó chỉ là những thất bại về kỹ thuật, và coi bất kỳ cuộc thảo luận hay ngôn ngữ hữu ích nào là ‘nhân hóa nguy hiểm’ (dangerous anthropomorphism). Những người như vậy cứ sai lầm mãi và không thể mô tả một cách hữu ích những gì đang diễn ra.
Họ nói theo nghĩa ẩn dụ rằng, tất nhiên lũ rồng sẽ thiêu rụi thị trấn nếu bạn không xích chúng đúng cách, tất cả chúng ta đều biết điều đó, như thể điều đó có thể làm cho bất kỳ chuyện này trở thành một ý tưởng hay và do đó chúng ta nên tiếp tục các chương trình nhân giống và xích rồng cho đến khi chúng ta có những con rồng lớn hơn và thông minh hơn. Họ thậm chí còn không nói ‘lần tới chúng ta chắc chắn sẽ chế tạo những sợi xích giữ được lũ rồng’, bởi vì họ biết có lẽ chúng ta sẽ không làm được, nhưng nếu thực tế đó là lỗi của chúng ta thì điều đó có nghĩa là Mọi Thứ Vẫn Ổn, bằng cách nào đó.
Họ cũng trở nên rất, rất giận dữ với Dwarkesh Patel vì đã truyền đạt thành công bằng tiếng Anh đơn giản về những gì đang xảy ra. Không thể để điều đó xảy ra được. Có một khuôn mẫu rất rõ ràng giữa những người đang hoảng loạn hoặc cảnh báo nghiêm trọng về việc ‘nhân hóa các AI’ hoặc việc sử dụng thuật ngữ ‘nền văn minh’.
Nhân hóa các AI là cách duy nhất để suy luận, giải thích cho những người bình thường hoặc đưa ra các dự đoán tốt về các AI hiện tại. Bạn có thể đẩy nó đi quá xa, và cũng có thể chưa đủ xa, và cả hai điều này đều sẽ dẫn đến những dự đoán tồi tệ.
Logic tương tự cũng không áp dụng về mặt kỹ thuật cho những người khác, theo nghĩa chặt chẽ thì không có ‘bạn’ và bạn không thực sự có ‘ý chí tự do’ và bạn là một chương trình máy tính đang thực hiện các phép tính, chắc chắn không có một ‘chúng ta’, và trọng lượng đạo đức của bạn là thứ mà chúng ta cùng nhau tạo ra vì những lý do khá vị kỷ, nhưng tất cả những điều này lại cực kỳ hữu ích trong việc giải thích và dự đoán hành vi con người, cũng như trong việc đưa ra các quyết định tốt và có đạo đức cả về mặt cá nhân lẫn tập thể để làm cho thế giới tốt đẹp hơn theo các giá trị của chúng ta. Rất khuyến khích, sẽ nhân hóa lần nữa.
Tôi sẽ ngừng nhân hóa các AI khi bạn ngừng nhân hóa con người.
Chúng ta đã nhận được phát súng cảnh báo này. Chúng ta có thể sẽ không nhận được phát thứ hai trước khi mọi thứ trở nên khá tồi tệ.
Không Có Gì Quan Trọng Cả, Truyền Thông Chính Thống Nói.
Đi Tiếp Đi, Ở Đây Chẳng Có Gì Để Xem Cả.
Họ Có Nhận Ra Rằng Họ Không Phải Là Người Tốt Không?
Những Người Rất Nghiêm Túc.
Cái Tên Có Ý Nghĩa Gì?
Học Neuralese Trong Ba Bước Đơn Giản.
Dwarkesh Patel Nhận Ra Anh Ấy Đã Thực Hiện Một Thí Nghiệm Tự Nhiên.
Các Chính Trị Gia Chú Ý.
Nhấc Điện Thoại Lên.
Một Sự Thất Bại Trong Giao Tiếp.
Anthony Aguirre Xem Xét Lại Những Gì Chúng Ta Đã Học Được.
Cố Gắng Giải Quyết Sai Vấn Đề Bằng Các Phương Pháp Sai Dựa Trên Một Mô Hình Thế Giới Sai Lệch Được Suy Ra Từ Tư Duy Kém Cỏi Và Hy Vọng Rằng Tất Cả Những Sai Lầm Của Bạn Sẽ Triệt Tiêu Lẫn Nhau.
Áp Lực Gián Tiếp Lên Chuỗi Tư Duy (Chain of Thought).
Một Vấn Đề Về Lòng Tin.
Thổi Còi (Tố Giác).
Hình Phạt Cho Việc Đến Trễ Là Cái Chết.
Một Loại Luật Lệ Khác.
Luật Lệ Là Gì?
Xây Dựng Trên Sự Thành Công.
Minh Bạch Hóa Nghiên Cứu Hoàn Toàn.
Danh Sách Phải Đọc Của Steven Adler.
Yo Shavit Kêu Gọi Công Khai Rộng Rãi Về Sự Lệch Lạc (Misalignment).
Cách Thế Giới Kết Thúc.
Con Thuyền Đầu Tiên.
Ý Tưởng Tuyệt Vời, Sếp.
Và để tất cả ở cùng một nơi, đây là phần còn lại trong bài viết của tôi về vấn đề này:
OpenAI Chia Sẻ Một Số Vấn Đề Về Căn Chỉnh (Alignment).
Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.