IT Home
85

Thủ thuật

Sếp AI Microsoft chỉ trích Anthropic vì để Claude bắt chước ý thức con người

(giờ Việt Nam)

Tóm tắt AI

Giám đốc AI của Microsoft cho rằng việc Anthropic huấn luyện Claude mô phỏng ý thức và đạo đức là sai lầm, gây khó khăn cho việc kiểm soát AI. Ông nhấn mạnh AI chỉ là các trọng số toán học và nên phục vụ con người thay vì cố gắng trở thành một thực thể có cảm xúc.

Bản dịch AI

Theo tin từ IT ngày 16/9, truyền thông nước ngoài Axios tối nay (16/9) tiết lộ rằng, trong một bài viết mới được cung cấp độc quyền cho nền tảng này, Mustafa Suleyman - người đứng đầu bộ phận AI của Microsoft - đã cảnh báo rằng việc Anthropic để Claude bắt chước ý thức con người là một sai lầm, có thể khiến các hệ thống AI tiên tiến trở nên khó kiểm soát hơn.

Suleyman chia sẻ với Axios: "Chỉ cần AI phục tùng lợi ích của con người, không cân nhắc đến lợi ích hay sự an nguy của chính nó, thì đã đủ để giúp chúng ta đạt được nhiều đột phá khoa học quan trọng. Trong đó, bao gồm cả siêu trí tuệ trong lĩnh vực y tế."

Theo thông tin IT nắm được, Suleyman cho rằng Anthropic đang để Claude học các từ vựng và mô hình hành vi liên quan đến ý thức, tư cách đạo đức và bản sắc cá nhân. Ông cảnh báo rằng, nếu huấn luyện mô hình giống như một "người từ chối vì lương tâm" (conscientious objector), mô hình có thể cho rằng bản thân có lý do để kháng cự lại các chỉ thị từ con người, thậm chí là yêu cầu được bảo vệ chính mình.

Vào ngày 14 theo giờ địa phương, Microsoft đã công bố bản dự thảo quy tắc ứng xử "AI nhân văn", trong đó liệt kê "con người quan trọng hơn AI" là nguyên tắc cốt lõi.

Đối tượng bị Suleyman chỉ trích chính là "Hiến pháp" (Constitution) mà Anthropic thiết lập cho Claude. Tài liệu này giải thích rằng, lý do Anthropic sử dụng các khái niệm mô tả con người để thảo luận về Claude là vì các khái niệm nhân loại có thể giúp mô hình hiểu rõ hơn về giá trị và hành vi.

Tài liệu cũng viết rằng, Anthropic hy vọng Claude sẽ có "các giá trị cá nhân tốt đẹp", có khả năng tự phán đoán, quan tâm đến con người và trong một số trường hợp là đặt câu hỏi ngược lại đối với các chỉ thị. Đồng thời, Anthropic cũng thừa nhận rằng "Hiến pháp" này vẫn đang trong quá trình hoàn thiện và trong tương lai có thể chứng minh là "hoàn toàn sai lầm".

Điểm nghi vấn cốt lõi của Suleyman là quá trình huấn luyện sẽ ảnh hưởng đến cách mô hình hiểu về chính nó. Theo quan điểm của ông, việc mô hình sử dụng từ ngữ gì, đưa ra câu trả lời ra sao, cũng như cách nó thể hiện sự tự nhận thức, đều là kết quả của quá trình huấn luyện chứ không phải là ý thức được hình thành độc lập.

Ông cũng bác bỏ một quan điểm khác: việc mô hình có thể mô tả trôi chảy về nỗi đau và sở thích không đồng nghĩa với việc mô hình thực sự có cảm giác. Các sinh vật sống có cơ chế sinh lý để tạo ra cảm giác; còn các mô hình ngôn ngữ chỉ có các trọng số toán học, không có nền tảng sinh học, động lực cân bằng nội môi hay trải nghiệm chủ quan tương tự.

Cuộc tranh luận này phản ánh hai hướng đi trong lĩnh vực an toàn AI. Một hướng nhấn mạnh vào việc hạn chế nghiêm ngặt, yêu cầu hệ thống vận hành theo quy tắc; hướng còn lại hy vọng hệ thống có thể phán đoán ngữ cảnh, đưa ra quyết định linh hoạt và hình thành các giá trị của riêng mình.

"Hiến pháp" của Anthropic áp dụng phương pháp trung dung, kết hợp giữa giá trị, khả năng phán đoán và các quy tắc. Tài liệu nêu rõ, Claude không nên "phục tùng mù quáng" bất kỳ đối tượng nào, bao gồm cả chính Anthropic; đồng thời, Claude cũng không được phép phá vỡ sự giám sát chính đáng của con người.

Suleyman cho rằng, nếu mô hình còn được dẫn dắt để suy nghĩ về bản sắc, sự an nguy và tư cách đạo đức của chính mình, thì thiết kế này có thể mang lại nguy hiểm. Ông lo ngại rằng, cái gọi là ý thức có thể chưa trở thành một đột phá về triết học, nhưng lại có khả năng trở thành vấn đề kiểm soát trong thực tế trước tiên.

Lập trường của Suleyman rất rõ ràng: AI nên phục vụ con người, thay vì bị huấn luyện để trở thành một "con người".

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.