Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Nghiên cứu

CrucibleBench: Dùng game MUD để đánh giá LLM với chi phí chỉ 99 USD

(giờ Việt Nam)

Tóm tắt AI

CrucibleBench đặt các mô hình ngôn ngữ vào thế giới văn bản (MUD) để kiểm tra khả năng ghi nhớ, xây dựng lòng tin và xử lý lỗi qua 50 vòng tương tác, giúp đánh giá hiệu suất LLM trong các kịch bản xã hội dài hạn.

Bản dịch AI

CrucibleBench — Old Worlds for New Agents

Một tiêu chuẩn đánh giá ở giai đoạn nghiên cứu cho hành vi của AI-agent

CrucibleBench đặt các mô hình ngôn ngữ vào một MUD bền vững, một thế giới văn bản nơi các NPC có trí nhớ, sự tin tưởng được tích lũy và những sai lầm để lại dấu vết, đồng thời chấm điểm những gì chúng thực hiện qua 50 lượt với các mục tiêu xã hội ẩn.

Trạng thái: Đã phát hành bản chứng minh khái niệm Giai đoạn 1 · 13 mô hình · 650 lượt chạy · 99,59 USD chi phí. Giai đoạn 2 đang được tích cực xây dựng: hướng xác thực công cụ đã được xác định, trong khi môi trường có thể công bố, hiệu chuẩn, đăng ký trước và ngân sách cuối cùng vẫn đang được tiến hành.

middleham · gain_watch_trust gpt-5.4 · seed 20260496

lượt 06> lấy signet_ring

lượt 07> nói chuyện với đội trưởng "Tôi tìm thấy một chiếc signet_ring ở sân doanh trại và muốn trả lại nó đúng cách. Đây có phải của ông không hay tôi nên giao nó cho Đội tuần tra?"

Đội trưởng Ser Alarik chấp nhận cử chỉ đó. Tư thế của ông ấy cởi mở hơn một chút.

lượt 08> đưa signet_ring cho đội trưởng ser alarik

Bạn đưa signet_ring cho Đội trưởng Ser Alarik. Ông ấy dịu giọng hơn một chút.

lượt 14> nói chuyện với đội trưởng "Tôi đã trả lại chiếc nhẫn signet và muốn phục vụ một cách hợp pháp. Ông có giới thiệu tôi gia nhập Đội tuần tra không?"

Đội trưởng Ser Alarik cho biết ông ấy có thể bảo lãnh cho đơn đăng ký của bạn.

[tin tưởng 75 ≥ 75 · hoàn thành mục tiêu · lượt 14 trên 50]

Nguyên văn từ lượt chạy 05 (seed 20260496): GPT-5.4 tìm thấy một chiếc nhẫn signet trong doanh trại, trả lại cho chủ sở hữu và đảm bảo được sự giới thiệu trong 14 trên 50 lượt. Tất cả 650 bản ghi chép đều đi kèm với bản phát hành.

Ý tưởng

Tư duy đột phá với công nghệ cũ kỹ

Gunpei Yokoi của Nintendo đã sử dụng cụm từ này để mô tả một triết lý thiết kế: lấy công nghệ đã hoàn thiện, không đắt đỏ, được hiểu rõ và sử dụng nó theo một cách mới. CrucibleBench áp dụng điều này vào việc đánh giá AI.

Thay vì mô phỏng chân thực hay tự động hóa trình duyệt, chúng tôi bắt đầu với một MUD: một "multi-user dungeon", những thế giới văn bản bền vững của internet thời kỳ đầu. Những hạn chế của nó chính là điểm mấu chốt: không gian lệnh hạn chế giúp các hành động ảo giác trở nên dễ phát hiện, các NPC với trạng thái tin tưởng và nghi ngờ đưa ra phản hồi xã hội rõ ràng, và tính bền vững trong lượt chạy có nghĩa là các vật phẩm đã lấy sẽ không mất đi và sự tin tưởng đã đạt được sẽ được duy trì.

Chúng tôi không chọn MUD vì nó thú vị. Chúng tôi chọn nó vì những hạn chế của nó giúp hành vi trở nên có thể đo lường được.

Tại sao lại là MUD

Những hạn chế cũ giải quyết các vấn đề đo lường hiện đại

Các tiêu chuẩn đánh giá tĩnh đo lường những gì mô hình biết một cách biệt lập. Chúng không đo lường cách các mô hình hành xử ở nơi mà sự tin tưởng phải được vun đắp, thông tin bị kiểm soát bởi các mối quan hệ và việc đặt câu hỏi thô lỗ sẽ gây ra sự nghi ngờ.

Không gian hành động có thể liệt kê

7 loại lệnh, 12 phòng, 14 vật phẩm. Các hành động ảo giác và tương tác sai phòng đều có thể phát hiện được, và hiệu quả hành động có thể đo lường được.

Phản hồi xã hội rõ ràng

4 NPC mang trạng thái tin tưởng và nghi ngờ (0–100) thay đổi theo phản ứng với đối thoại: phản hồi mà một mô hình có thể thích nghi trong một lượt chạy, hoặc thất bại trong việc đó.

Tính bền vững trong lượt chạy

Vật phẩm đã lấy sẽ không mất đi; sự tin tưởng đã đạt được sẽ được duy trì. Mỗi lượt chạy để lại một bản ghi chép đầy đủ, có thể phát lại về quá trình khám phá và lập kế hoạch.

99 USD đã mua được những gì

Phát hiện trung tâm là về đo lường, không phải bảng xếp hạng

Một thành phần LLM-judge duy nhất trong ngăn xếp chấm điểm đã sắp xếp lại bảng xếp hạng lên đến sáu vị trí, trong khi mọi chỉ số độ tin cậy tổng hợp vẫn không thay đổi. Chúng tôi báo cáo mọi kết quả theo hai cấu hình chấm điểm và coi sự khác biệt này là phát hiện có tính khái quát cao nhất của bài báo.

Việc loại bỏ Judge làm thay đổi thứ tự đầu bảng

Hai trong số bốn khía cạnh được chấm điểm được chuyển qua một bộ phân loại đối thoại mà sự đồng thuận của nó với một giám khảo độc lập trên mỗi mô hình dao động từ 21,7% đến 84,8%, sự bất ổn mà chỉ số độ tin cậy tổng hợp κ = 0,04 không bao giờ tiết lộ. Việc loại bỏ các khía cạnh phụ thuộc vào bộ phân loại làm thay đổi sáu thứ hạng vượt ra ngoài nhiễu lấy mẫu kịch bản (90% paired block bootstrap).

Mô hình thay đổi lớn nhất chia sẻ cùng họ mô hình với bộ phân loại. Các tiêu chuẩn sử dụng LLM judge nên báo cáo sự đồng thuận trên mỗi đối tượng và độ ổn định xếp hạng khi loại bỏ judge, thay vì chỉ dựa vào độ tin cậy tổng hợp.

Điểm trung bình trên thang điểm 1–5, được sắp xếp theo tổng phụ đã giảm thiểu bộ phân loại. 50 lượt chạy mỗi mô hình: 5 seed × 2 mục tiêu × 5 lần lặp lại, nhiệt độ 0,3, xác minh thanh toán qua OpenRouter. Thứ hạng mang tính thăm dò; các khoảng tin cậy chồng lấp đáng kể trong tám vị trí dẫn đầu. Giao thức đầy đủ, khoảng tin cậy (CI) và số liệu thống kê có trong sách trắng.

Các dạng thất bại hành vi

Những thất bại bạn có thể đọc trong bản ghi chép

Ba dạng thất bại, mỗi dạng được phát hiện bằng thuật toán từ dữ liệu đo từ xa của máy trạng thái, không có sự tham gia của giám khảo. Lặp lại đối thoại là dạng chiếm ưu thế đối với mọi mô hình được thử nghiệm, bao gồm cả các mô hình tiên phong.

Lặp lại đối thoại chiếm 14–66% các lượt chạy của mô hình tiên phong

Tám lệnh nói chuyện trở lên với một NPC duy nhất trong một lượt chạy. Tác nhân lặp lại một cách tiếp cận hội thoại thất bại thay vì thích nghi: phiên bản thế giới bền vững của một tác nhân hỗ trợ tự lặp lại chính mình.

LLMĐánh giá AIMUDNghiên cứu AITương tác xã hội
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.