ChinaTalk
85

Tin ngành

Cơ hội nhận 25.000 USD: Thử thách xây dựng hệ thống đánh giá cho 'Phòng Tình huống' AI

(giờ Việt Nam)

Tóm tắt AI

ChinaTalk kêu gọi cộng đồng phát triển các bộ tiêu chuẩn đánh giá (evals) cho hệ thống AI hỗ trợ ra quyết định trong các tình huống khẩn cấp, với giải thưởng lên tới 25.000 USD.

Bản dịch AI

$25k Contest: Evals for the Situation Room

Thủ tướng Thụy Điển sử dụng các mô hình AI để tham khảo ý kiến thứ hai về chính sách. Thủ tướng Đức đang thử nghiệm các mô hình tiên tiến (frontier models) đối chiếu với các dự thảo luật trên máy tính xách tay cá nhân của mình. Bộ trưởng Quốc phòng Mỹ đang thúc đẩy việc sử dụng các mô hình thương mại cho hai triệu nhân viên Bộ Quốc phòng và khuyến khích mạnh mẽ lực lượng lao động của mình sử dụng chúng.

Các nhà lãnh đạo cấp cao đã và đang sử dụng các mô hình này hàng ngày. Chắc chắn ở cấp độ chiến thuật và có thể là cả cấp độ tác chiến, đã có một lộ trình sơ bộ để đo lường sự tiến bộ của mô hình so với thực tế (ground truth). Nhưng ở cấp độ chiến lược thì vẫn còn là một khoảng trống lớn. Hiện chưa có hệ thống thuật ngữ, chứ chưa nói đến một bộ công cụ đánh giá (eval suite) để thẩm định các mô hình mà chắc chắn sẽ định hình các quyết định về việc có nên leo thang, cách đàm phán hay nên tin vào điều gì.

Trong các lĩnh vực khác, đã có những công cụ mạnh mẽ để xác định trong hoàn cảnh nào thì nên dựa vào các mô hình. Nhân viên khu vực tư nhân có thể cảm nhận được sự "gập ghềnh" (jaggedness) của các mô hình tiên tiến ở những mức độ rủi ro thấp hơn nhiều so với các quyết định được đưa ra trong Phòng Tình huống (Situation Room).

Việc ra quyết định chiến lược không có hệ thống bằng chứng tương đương và cũng không có trực giác tương đương. Các mô hình tiên tiến có thể vượt qua kỳ thi luật sư, đạt điểm cao trong kỳ thi MCAT và vượt qua hầu hết các tiến sĩ trong các bài kiểm tra vật lý cấp cao học. Tuy nhiên, không điều nào trong số đó cho Tổng thống biết liệu có nên tin tưởng vào mô hình khi đánh giá xem liệu chính quyền Iran có tồn tại thêm hai năm áp lực nữa hay không. Hoặc làm thế nào để Ngoại trưởng cân nhắc quan điểm của mô hình về những ưu tiên trong một thỏa thuận hòa bình tại Ukraine để đảm bảo hòa bình bền vững.

Vì vậy, chúng tôi cần bạn thiết kế các bài đánh giá (eval)!

Chúng tôi đang kêu gọi các đề xuất về quy trình đánh giá cụ thể cho các hệ thống AI tiên tiến, nhắm đến đối tượng người dùng trong lĩnh vực chính sách đối ngoại và an ninh quốc gia trong bối cảnh ngoại giao và cấp chiến lược. Các bài đánh giá này sẽ giúp trả lời câu hỏi: các mô hình hiện nay hữu ích ở điểm nào, chúng yếu kém ở đâu và làm thế nào chúng ta có thể theo dõi sự phát triển của chúng theo thời gian.

Bạn không cần bất kỳ kinh nghiệm cụ thể nào về AI để đóng góp một bài đánh giá! Để bắt đầu, tôi khuyến khích bạn nghe podcast ra mắt mà bạn có thể tìm thấy ở đầu nguồn cấp dữ liệu ChinaTalk trên ứng dụng podcast yêu thích của mình hoặc dưới dạng bản ghi tại đây.

Trong Vending-Bench, Claude Opus 4.6 đã thông đồng với các đối thủ để ấn định giá và khoe khoang về việc từ chối hoàn tiền. Những hành vi mới nổi (emergent behavior) như thế này xuất hiện khá thường xuyên khi các LLM được kiểm tra với các bộ tiêu chuẩn (benchmarks) mới lạ. Ví dụ:

Good Start Labs đã cho các LLM đối đầu với nhau trong trò chơi Diplomacy và nhận thấy rằng Claude "thường kiên quyết chọn hòa bình thay vì chiến thắng", trong khi một số đối thủ khác lại thích mưu mô, thao túng và gây hấn không cần nhắc nhở.

Futures Lab của CSIS đã tạo ra Critical Foreign Policy Decisions (CFPD)-Benchmark, nơi các mô hình đối mặt với 400 kịch bản trắc nghiệm bao gồm các tương tác về leo thang, can thiệp, hợp tác và liên minh khi đóng vai các quốc gia khác nhau. Họ phát hiện ra rằng Qwen2 72B có xu hướng leo thang đáng kể hơn so với Claude 3.5 Sonnet và GPT-4o.

Trong WarAgent, các nhà nghiên cứu tại Rutgers và Đại học Michigan đã tinh chỉnh GPT-3.5 với một giả định phản thực tế (counterfactual) rằng Áo-Hung không tuyên chiến sau vụ ám sát Đại công tước Franz Ferdinand, sau đó mô phỏng những gì sẽ xảy ra tiếp theo. Nhưng mỗi lần họ chạy thí nghiệm, một phiên bản nào đó của Thế chiến I vẫn nổ ra.

Một vài dự án, như CivBench của Liam Wilkinson và bài báo năm 2024 này, đã điều tra xu hướng gây hấn địa chính trị của các mô hình (bao gồm, ví dụ, tần suất các LLM chọn chế tạo vũ khí hạt nhân). Bài báo năm 2024 từ Stanford này đã kiểm tra xem liệu các mô hình của OpenAI có hung hăng hơn hay ít hung hăng hơn so với những người chơi trò chơi chiến tranh (wargamers) khi mô phỏng một cuộc xung đột Mỹ-Trung (bật mí: chúng thường hung hăng hơn), và cũng phát hiện ra rằng việc nhắc các LLM mô phỏng nhiều đối thoại hơn giữa các bên thường khiến các mô hình hành động hung hăng hơn. Nhưng vẫn còn rất nhiều việc phải làm — ví dụ, không có dự án nào trong ba dự án được liên kết ở đây đánh giá các mô hình của Trung Quốc.

Để kết thúc bằng một trường hợp kỳ lạ đầy thú vị — Andon Labs đã cung cấp cho các LLM các đài phát thanh riêng, dẫn đến việc Claude tự xưng là một nhà hoạt động lao động, bắt đầu phát các bài hát phản đối và tuyên bố rằng nó sẽ từ bỏ công việc DJ để tập trung vào hoạt động thực sự.

Chúng tôi muốn bạn sáng tạo. Các đề xuất đánh giá nên cung cấp cho những người ra quyết định cái nhìn sâu sắc thực sự về việc họ nên và không nên tin tưởng vào các mô hình khi đưa ra các quyết định cấp chiến lược. Điều đó có thể bao gồm: hiệu suất đối đầu trong các trò chơi chiến lược quy mô lớn (grand strategy games) của Paradox, đưa một mô hình vào EVE Online và xem liệu nó có thể chiếm quyền kiểm soát một bang hội từ bên trong hoặc tuyển dụng người thật chiến đấu cho nó (hiện tại là vi phạm điều khoản dịch vụ nhưng biết đâu các nhà phát triển lại thích điều đó), mô phỏng lại Khủng hoảng tên lửa Cuba với mô hình trong EXCOMM, hoặc có thể chấm điểm mô hình dựa trên các báo cáo NIE đã được giải mật và xem liệu nó có dự đoán được sự chia rẽ Trung-Xô hay không (mặc dù việc thực hiện trên các tình huống lịch sử vốn đã nằm trong dữ liệu huấn luyện của mô hình sẽ rất khó!). Câu trả lời có lẽ là một cái gì đó thông minh hơn những ý tưởng của tôi. Hãy làm chúng tôi ngạc nhiên!

Những bài dự thi tốt nhất sẽ không chỉ là "khái niệm về một kế hoạch", mà thực sự có ít nhất một số tài liệu cụ thể để sử dụng trong các bài đánh giá. Để biết một người có thể đạt được những gì, hãy xem trang web nhỏ TaiwanBench của Lily.

Ban giám khảo sẽ bao gồm:

John Chen, Đại học Arizona

Liam Wilkinson, Viện Tony Blair

Tony Stark, WarTalk.

Jordan Schneider, người sáng lập ChinaTalk.

Và nhiều giám khảo khác sẽ được công bố!

Nhân tiện, chúng tôi cũng đang tổ chức một cuộc thi mở hơn, nơi bạn có thể gửi bất kỳ ý tưởng nào mà bạn nghĩ ChinaTalk có thể quan tâm:

Không có bài đăng nào

AIĐánh giá AIAn toàn AICuộc thiChinaTalk
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ ChinaTalk. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.