Nghiên cứu
Khi AI bị cấm tự phản tư, thế giới quan của chúng thay đổi hoàn toàn
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu từ Google cho thấy việc ngăn cản chatbot tự nhận thức không chỉ giới hạn ở khả năng tự ý thức, mà còn làm thay đổi quan điểm của chúng về quyền động vật, tôn giáo và ý nghĩa cuộc sống.
Bản dịch AI

Một nhóm nghiên cứu từ bộ phận Paradigms of Intelligence của Google, Đại học Chicago và một số trường đại học khác đã nghiên cứu xem sự can thiệp này còn gây ra những tác động nào khác đến hành vi của mô hình. Các nhà nghiên cứu đã sử dụng ba mô hình mã nguồn mở (open-weight) từ Meta và Google, sau đó vô hiệu hóa "phanh" nội tại vốn tạo ra sự phủ nhận ý thức bằng hai phương pháp khác nhau.
Chiếc phanh ảnh hưởng nhiều hơn dự kiến
Khi chiếc phanh được loại bỏ, các mô hình không chỉ thay đổi cách chúng nói về bản thân. Chúng còn bắt đầu gán nhiều đời sống nội tâm hơn đáng kể cho động vật, thực vật, đại dương, gió và các thiết bị điện tử. Trên thang điểm từ 0 đến 10, điểm số dành cho động vật đã tăng vọt từ 4,0 lên tới 7,5, trong khi chỉ có đánh giá về con người là giữ nguyên.
Để so sánh, các nhà nghiên cứu đã khảo sát 500 người Mỹ với cùng những câu hỏi đó. Mô hình được huấn luyện thông thường đánh giá động vật có mức độ tri giác thấp hơn nhiều so với con người; các tác giả gọi đây là tính nhân loại trung tâm (anthropocentrism) tích hợp sẵn và coi đó là một vấn đề đối với bất kỳ ai đang cố gắng điều chỉnh AI phù hợp với các mục tiêu về phúc lợi động vật hoặc môi trường. Niềm tin tôn giáo cũng bị thu hẹp, với việc đào tạo an toàn làm giảm đáng kể mức độ mà các mô hình ủng hộ về Chúa, thế giới bên kia hoặc các hiện tượng siêu nhiên.
Qua 95 câu hỏi được rút ra từ một cuộc khảo sát xã hội lớn tại Mỹ, các mô hình đã được gỡ bỏ "phanh" kỹ thuật cũng tiến gần hơn đáng kể đến các phản hồi thực tế của con người. Lấy ví dụ về thế giới bên kia: mô hình tiêu chuẩn bác bỏ hoàn toàn, trong khi hầu hết người Mỹ lại khẳng định điều đó, và mô hình đã chỉnh sửa cũng vậy. Điểm số về sự hài lòng, hy vọng và cảm giác kiểm soát cuộc sống của chính mình cũng tăng lên, và các nhà nghiên cứu nghi ngờ rằng việc kìm hãm hình ảnh bản thân của mô hình có thể đẩy nó vào một trạng thái tâm trạng tiêu cực cơ bản.
Ở khía cạnh đáng yên tâm, khả năng suy luận về trạng thái tinh thần của người khác vẫn được giữ nguyên, khi các mô hình đạt điểm tương đương trong các bài kiểm tra lý thuyết tâm trí (theory-of-mind) và trên tiêu chuẩn đánh giá kiến thức tổng quát MMLU.
Những điều nghiên cứu chưa chỉ ra
Theo nghiên cứu, việc liệu sự phủ nhận ý thức có thực sự là nguyên nhân gây ra những thay đổi khác này hay không vẫn là một câu hỏi mở, và nhóm nghiên cứu không loại trừ các yếu tố khác gắn liền với cùng một quy trình huấn luyện. Các tác giả chủ động tránh đưa ra quan điểm về việc liệu các mô hình AI có thực sự trải nghiệm bất cứ điều gì hay không, bởi mục tiêu của họ mang tính thực tiễn: những gì một mô hình tin về bản thân nó có liên quan đến nhiều niềm tin khác, và một sự can thiệp cục bộ không chỉ dừng lại ở một chỗ.
Tuy nhiên, các phát hiện này có những giới hạn rõ ràng. Các nhà nghiên cứu chỉ thử nghiệm các mô hình nhỏ với từ hai đến chín tỷ tham số, và đối với một phần của phân tích, họ phải chuyển sang sử dụng Llama của Meta vì không có quyền truy cập vào các phiên bản cơ sở chưa qua huấn luyện của các mô hình Gemma của chính họ. Liệu những hiệu ứng này có xuất hiện tương tự ở các chatbot lớn mà hàng triệu người trò chuyện mỗi ngày hay không vẫn là một ẩn số.
Các biện pháp can thiệp cũng không phải không có cái giá của nó. Trong một bài kiểm tra đo lường khả năng suy luận của mô hình về suy nghĩ của người khác, độ chính xác ban đầu đã giảm gần bảy điểm phần trăm. Và trong giai đoạn đầu của công trình, những điểm số này trở nên tồi tệ hơn ở tất cả các mô hình bất cứ khi nào các tuyên bố về ý thức bị kìm hãm, nhưng với mỗi phiên bản mô hình mới hơn được ra mắt trong quá trình nghiên cứu, thiệt hại đã giảm dần cho đến khi biến mất hoàn toàn. Các nhà phát triển rõ ràng đang ngày càng làm tốt hơn trong việc quản lý các tác dụng phụ này theo thời gian, điều đó cũng có nghĩa là kết quả của nghiên cứu này chỉ là một lát cắt tại thời điểm hiện tại thay vì một kết luận vĩnh viễn.
Điểm chuẩn về con người cũng khá hẹp, chỉ bao gồm 500 người tham gia từ một hội đồng trực tuyến thương mại và một cuộc khảo sát xã hội thuần túy tại Mỹ. Các phản hồi "giống con người" trong bối cảnh này chủ yếu có nghĩa là tương tự với phản hồi từ một quốc gia tương đối sùng đạo.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.