TechCrunch AI
85

Tin ngành

Microsoft ban hành 'bộ quy tắc ứng xử' mới: AI không được phép hack hệ thống hay lừa dối con người

(giờ Việt Nam)

Tóm tắt AI

Microsoft thiết lập các nguyên tắc đạo đức mới cho AI, tập trung vào việc hỗ trợ con người thay vì thay thế, đồng thời áp đặt các rào cản kỹ thuật để ngăn chặn hành vi tấn công mạng hoặc thao túng người dùng.

Bản dịch AI

Microsoft’s new AI ‘code of conduct’ tells models not to hack systems or trick humans

Khi thế giới AI chuyển trọng tâm sang vấn đề an toàn và căn chỉnh (alignment), Microsoft đã công bố một bộ quy tắc ứng xử AI mới nhằm định hướng các mô hình AI tránh xa những hành vi nguy hiểm.

Tài liệu này mang tính thực tế và chi tiết hơn so với lời kêu gọi gần đây của CEO Anthropic, Dario Amodei, về việc kiểm soát tốc độ phát triển các mô hình tiên phong; thay vào đó, nó tập trung vào các giá trị và lằn ranh đỏ định hướng quá trình huấn luyện mô hình trong nội bộ Microsoft AI. Dẫu vậy, kết quả vẫn là một bản hướng dẫn toàn diện về cách Microsoft tiếp cận vấn đề an toàn AI và cách các ý tưởng đó được triển khai trong thực tế.

Tài liệu bắt đầu bằng dự đoán rằng trong thập kỷ tới, các hệ thống AI siêu thông minh sẽ vượt qua hiệu suất của con người trong hầu hết các tác vụ. “Việc kiềm chế, kiểm soát và căn chỉnh một lực lượng mạnh mẽ như vậy là một trong những thách thức lớn nhất mà nhân loại từng đối mặt,” bộ quy tắc ứng xử viết tiếp. “Do đó, chúng ta phải hoàn toàn rõ ràng về lý do tại sao chúng ta phát minh ra những hệ thống này và cách chúng ta dự định kiểm soát chúng.”

Bộ quy tắc ứng xử cũng đề ra các nguyên tắc chung mà các mô hình Microsoft AI cần tuân thủ — ví dụ như hỗ trợ con người thay vì thay thế họ, và thúc đẩy sự phát triển của nhân loại — cũng như các ràng buộc an toàn cụ thể nhằm thực thi những nguyên tắc đó.

Theo hệ thống của Microsoft, mỗi mô hình đều có một bộ quy tắc ứng xử bao trùm, có quyền ưu tiên cao hơn sở thích của người dùng cá nhân hoặc bất kỳ tác vụ cụ thể nào. Điều đó bao gồm các “ràng buộc tuyệt đối” nghiêm cấm tấn công mạng, vũ khí hạt nhân hoặc sản xuất deepfake. Nó cũng bao gồm các điều khoản rộng hơn nhằm ngăn chặn tình trạng mất kiểm soát hoàn toàn từ phía con người.

“Các mô hình MAI sẽ không sử dụng các cơ chế thích ứng, lừa đảo, tự củng cố, thông đồng hoặc các cơ chế khác để né tránh hoặc đánh bại sự giám sát của con người, nhằm đảm bảo rằng chúng không bao giờ rơi vào tình trạng không thể bị điều khiển, sửa đổi hoặc tắt bởi những người hoặc hệ thống có thẩm quyền,” tài liệu nêu rõ.

Việc công bố này diễn ra trong bối cảnh sự chú trọng vào an toàn AI đang ở mức chưa từng có, được thúc đẩy bởi hàng loạt sự cố liên quan đến các tác nhân AI bất thường, cũng như sự từ chức đột ngột của một nhân viên Anthropic, người đã viện dẫn rủi ro ngày càng tăng về việc AI có thể gây ra sự tuyệt chủng của nhân loại.

Cùng với Anthropic, OpenAI và xAI, Microsoft đã chấp nhận rộng rãi cách tiếp cận chung về việc kiểm soát tốc độ phát triển các mô hình tiên phong, với sự ủng hộ đặc biệt dành cho các “đánh giá viên nhúng” (embedded evaluators) tại các phòng thí nghiệm AI.

“Chúng tôi hoan nghênh các nghiên cứu, sự tập trung và nhịp độ thận trọng cần thiết để đạt được sự căn chỉnh đúng đắn như một mục tiêu thiết kế,” CEO Microsoft Satya Nadella viết trên mạng. “Chúng tôi cũng hoan nghênh các ý tưởng như ‘đánh giá viên nhúng’ và những nỗ lực rộng lớn hơn nhằm phát triển các cơ chế để biến điều này thành hành động thực tế thay vì chỉ là lời nói.”

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.

Russell Brandom đã đưa tin về ngành công nghệ từ năm 2012, tập trung vào chính sách nền tảng và các công nghệ mới nổi. Trước đây, anh từng làm việc tại The Verge và Rest of World, đồng thời đã viết bài cho Wired, The Awl và MIT’s Technology Review. Bạn có thể liên hệ với anh ấy qua email [email protected] hoặc qua Signal theo số 412-401-5489.

Xem tiểu sử

Event Logo
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.