Nghiên cứu
Nghiên cứu từ Apple: Phân tích đa chiều về hành vi giống người của các mô hình ngôn ngữ lớn (LLM)
(giờ Việt Nam)
Tóm tắt AI
Đội ngũ nghiên cứu của Apple đã phân tích cách LLM thể hiện cảm xúc và thiết lập ranh giới với người dùng. Nghiên cứu cung cấp cái nhìn sâu sắc giúp các nhà phát triển kiểm soát hành vi giống người của AI một cách hiệu quả.
Bản dịch AI

Tác giả: Sunnie S. Y. Kim, Margit Bowler, Leon A Gatys
Các mô hình ngôn ngữ lớn (LLM) thể hiện hàng loạt hành vi giống con người, từ việc bày tỏ suy nghĩ và cảm xúc, tham gia xây dựng mối quan hệ với người dùng, cho đến việc từ chối các yêu cầu và duy trì ranh giới. Mặc dù chúng rất phổ biến, các nhà nghiên cứu và chuyên gia vẫn thiếu các phương pháp và thông tin thực nghiệm để đưa ra quyết định sáng suốt về việc khi nào và loại hành vi giống con người nào mà LLM nên thể hiện. Để lấp đầy khoảng trống này, chúng tôi trình bày một phân tích đa chiều về mức độ phổ biến, tác động tiềm tàng và khả năng kiểm soát các hành vi này bằng cách sử dụng phương pháp LLM-as-a-judge (LLM đóng vai trò giám khảo) và đánh giá từ con người. Thông qua 21.000 cuộc hội thoại đa lượt từ bốn mô hình được sử dụng rộng rãi (gpt-4o, gpt-4.1-mini, claude-sonnet-4.6, gemini-2.5-flash), chúng tôi nhận thấy rằng các hành vi giống con người xuất hiện tràn lan nhưng khác biệt tùy theo mô hình và các yếu tố người dùng (mục tiêu hội thoại và hồ sơ người dùng). Xét về mức độ phù hợp cảm nhận, những người đánh giá là con người cho rằng các hành vi tự tham chiếu và xây dựng mối quan hệ từ LLM ít phù hợp hơn so với từ con người, nhưng các hành vi duy trì ranh giới lại phù hợp hơn khi đến từ LLM. Cuối cùng, chúng tôi chỉ ra rằng system prompting (nhắc lệnh hệ thống) có thể kiểm soát các hành vi này, mặc dù cần phải đánh giá cẩn thận để tránh những tác động ngoài ý muốn. Chúng tôi thảo luận về ý nghĩa của các phát hiện này và đưa ra các khuyến nghị cho việc thiết kế và đánh giá LLM một cách có trách nhiệm.
Các bài đọc liên quan và cập nhật.
Đánh giá từ con người là một thành phần quan trọng trong quá trình phát triển hệ thống dịch máy và đã nhận được nhiều sự quan tâm trong nghiên cứu dịch văn bản. Tuy nhiên, hiện có rất ít công trình nghiên cứu về chủ đề đánh giá từ con người đối với dịch thuật giọng nói, vốn bổ sung thêm những thách thức như dữ liệu nhiễu và sự không khớp về phân đoạn. Chúng tôi thực hiện những bước đầu tiên để lấp đầy khoảng trống này bằng cách tiến hành đánh giá toàn diện từ con người đối với kết quả của một số nhiệm vụ chung từ…
Đọc thêm
Kiểm thử hành vi trong NLP cho phép đánh giá chi tiết các hệ thống bằng cách kiểm tra năng lực ngôn ngữ của chúng thông qua phân tích hành vi đầu vào-đầu ra. Đáng tiếc là các công trình hiện có về kiểm thử hành vi trong Dịch máy (MT) hiện vẫn bị giới hạn chủ yếu ở các bài kiểm tra thủ công, bao phủ một phạm vi hạn chế về năng lực và ngôn ngữ. Để giải quyết hạn chế này, chúng tôi đề xuất sử dụng các Mô hình ngôn ngữ lớn (LLM) để tạo ra một tập hợp đa dạng các…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.