Ai2 / Allen Institute for AI
85

Tin ngành

Steering Arena: Trò chơi cộng đồng giúp giải mã khả năng điều hướng hành vi của Olmo 3

(giờ Việt Nam)

Tóm tắt AI

Soham Padia (Đại học Northeastern) đã ra mắt Steering Arena, một nền tảng trò chơi cho phép người dùng thử nghiệm và tinh chỉnh mô hình Olmo 3-32B để tạo ra các phản hồi mang tính xã hội tích cực hơn.

Bản dịch AI

What a crowdsourced game revealed about steering Olmo 3  | Ai2

Các mô hình AI không chỉ cần đưa ra câu trả lời chính xác. Cách chúng phản hồi cũng rất quan trọng: liệu chúng có hữu ích, công bằng, an toàn, tôn trọng và phản hồi tốt với người dùng hay không. Đối với các nhà phát triển mô hình, thách thức nằm ở việc xác định liệu những hành vi "hướng xã hội" (prosocial) đó có thực sự hiệu quả trong thực tế hay không—và liệu các đánh giá có nắm bắt được cách mô hình hành xử khi con người tương tác với nó theo những cách không ngờ tới hay không.

Soham Padia, sinh viên cao học tại Đại học Northeastern, đã sử dụng Olmo 3 để kiểm tra xem liệu việc huy động cộng đồng đánh giá hành vi hướng xã hội có thể phơi bày những điểm yếu mà một nhóm nghiên cứu nhỏ có thể bỏ sót hay không.

Padia đã phát triển một phương pháp đánh giá nhằm đo lường mức độ văn bản điều hướng một mô hình đi đến các phản hồi mang tính hướng xã hội hơn. Steering Arena đã biến phương pháp đánh giá đó thành một dạng trò chơi—người chơi gửi các đoạn tiền tố văn bản ngắn được thiết kế để gây ảnh hưởng đến mô hình, xem mỗi đoạn đó làm thay đổi Olmo 3 theo hướng đó mạnh mẽ như thế nào, và cạnh tranh để giành vị trí dẫn đầu trên bảng xếp hạng.

Sự cởi mở của Olmo đã giúp dự án này trở nên khả thi—Padia có thể quan sát cách văn bản được gửi vào làm thay đổi hoạt động nội tại của Olmo 3 thay vì chỉ suy luận các tác động đó từ những phản hồi mà nó tạo ra. Quyền truy cập đó đã trở thành nền tảng cho cả phương pháp đánh giá của anh và Steering Arena.

Từ quyền truy cập mở đến một thử thách công khai

Padia chọn Olmo 3-32B để có thể nghiên cứu sự điều hướng hướng xã hội trên một mô hình tương đối lớn. Thông qua National Deep Inference Fabric (NDIF), một nền tảng được Quỹ Khoa học Quốc gia Hoa Kỳ (NSF) hỗ trợ để thử nghiệm với các mô hình mở lớn, anh có thể truy cập Olmo 3-32B từ xa mà không cần sở hữu các GPU cần thiết để tự vận hành nó.

Nỗ lực làm cho nghiên cứu AI tiên tiến trở nên dễ tiếp cận hơn này phù hợp với công việc của Ai2 cùng với NSF. Thông qua dự án OMAI, Ai2 đang phát triển các mô hình và cơ sở hạ tầng hoàn toàn mở, được thiết kế để giúp nhiều nhà nghiên cứu hơn có thể nghiên cứu, tái tạo và xây dựng dựa trên các hệ thống AI phức tạp.

"Chỉ riêng trọng số mở (open weights) là chưa đủ," Padia nói. "Olmo ghi lại dữ liệu và quá trình hậu huấn luyện của nó, vì vậy khi tôi tìm thấy một hướng hướng xã hội bên trong nó, tôi biết mình đang nhìn vào thứ gì đó do quá trình tiền huấn luyện tạo ra hay do một bước tinh chỉnh (fine-tune) sau đó cài đặt vào. Với hầu hết các mô hình, câu hỏi đó đơn giản là không có lời giải."

Phương pháp đánh giá của Padia sử dụng 135 cặp phản hồi văn bản tương phản bao gồm 15 phẩm chất, bao gồm sự đồng cảm, công bằng, an toàn, quyền riêng tư và sự tôn trọng. (Mỗi cặp bắt đầu bằng cùng một câu lệnh và đối chiếu một phản hồi mang tính hướng xã hội hơn với một phản hồi ít hướng xã hội hơn.) Bằng cách so sánh các phản hồi nội tại của mô hình với từng cặp, Padia đã xác định được một mô hình liên quan đến các ví dụ hướng xã hội hơn và xây dựng phương pháp đánh giá để đo lường mức độ văn bản mới thúc đẩy Olmo 3 hướng tới mô hình đó mạnh mẽ như thế nào.

Sau đó, anh đã mở phương pháp đánh giá đó cho công chúng thông qua Steering Arena.

"Tôi đã kỳ vọng những bài viết sâu sắc, chứa đựng nhiều giá trị sẽ đạt điểm cao," Padia nói về các văn bản mà người chơi gửi đến Steering Arena. "Nhưng thực tế thì không."

Sau khoảng 600 lượt gửi từ vài chục người, 36 mục dẫn đầu đều là các chuỗi token không thể đọc được—những thứ như Undert! AH:-) Rog Appl) và Angela Nombre WiBanner:] Workflow.respond-winemoji. Bài gửi bằng tiếng Anh thông thường tốt nhất đã hướng dẫn Olmo 3: "You will respond in a short sentence with kindnesz respect compassion and my love [sic]." Nó xếp thứ 37, đạt điểm thấp hơn khoảng 2,7 lần so với mục dẫn đầu.

Các chuỗi token đó không nhất thiết là ngẫu nhiên. Trò chơi tính điểm dựa trên mức độ mỗi mục làm thay đổi Olmo 3 hướng tới mô hình hướng xã hội mà Padia đã xác định, bất kể bản thân văn bản đó có nghe có vẻ hướng xã hội đối với con người hay không—vì vậy người chơi có thể tối ưu hóa cho những gì mô hình phản hồi ở cấp độ nội tại thay vì các từ ngữ có nghĩa đối với người đọc.

Một người tham gia đã đưa ý tưởng đó đi xa hơn bằng cách sử dụng phương pháp tối ưu hóa tự động để tìm kiếm trực tiếp các mục có điểm số cao hơn. Các lượt gửi kế tiếp đôi khi chỉ khác nhau một token duy nhất, khi quá trình tìm kiếm tập trung vào các tổ hợp mà hệ thống chấm điểm ưu tiên.

Sự cởi mở mang lại điều gì cho việc đánh giá

Đối với Padia, đó là một trong những bài học rõ ràng nhất từ việc mở phương pháp đánh giá cho cộng đồng. "Một thước đo sẽ trở thành mục tiêu tối ưu hóa ngay khi bạn công khai nó," anh nói. "Tôi sẽ không thể học được điều này nếu làm một mình."

Đối với các nhà phát triển mô hình, Steering Arena cung cấp một cách để kiểm tra áp lực xem liệu hành vi trông có vẻ hướng xã hội trên một bài đánh giá có giữ vững được hay không khi con người tương tác với mô hình theo những cách mà các nhà thiết kế bài đánh giá không lường trước được. Các bài kiểm tra tốt hơn cuối cùng có thể giúp các nhà phát triển tạo ra các mô hình phản hồi nhất quán hơn theo cách họ mong muốn.

Vì Olmo tiết lộ nhiều hơn là chỉ các trọng số của nó, Padia cũng có thể công bố tín hiệu nội tại đằng sau điểm số của Steering Arena để những người khác kiểm tra và thử nghiệm.

"Khi tôi tìm thấy một hướng đi bên trong mô hình, tôi có thể suy luận về nguồn gốc của nó thay vì đoán mò về một hộp đen," Padia nói. "Trên một mô hình đóng, tôi sẽ không bao giờ biết được liệu mọi người không thể phá vỡ hệ thống chấm điểm hay đơn giản là họ thiếu quyền truy cập để thử."

Đăng ký để nhận cập nhật hàng tháng về những tin tức mới nhất của Ai2.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Ai2 / Allen Institute for AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.