elsewhere:
75

Tin ngành

Đến tiệm net để 'quyết đấu' trực tiếp với mọi mô hình AI lớn

(giờ Việt Nam)

Tóm tắt AI

Một trải nghiệm độc đáo khi đưa các mô hình ngôn ngữ lớn ra khỏi không gian mạng, cho phép người dùng tương tác và so tài trực tiếp tại môi trường offline.

Bản dịch AI

Come to the Internet Cafe and Put Every LLM to the Real-World Test

"Ai cũng là một 'Hoàng đế Benchmark'"

Gần đây, Zang AI cùng những người bạn của chúng tôi là Zhong Jingwei và Zhengyang đã ra mắt một sản phẩm có tên là Dongmodi. Giờ đây, bất kỳ ai cũng có thể truy cập fuckai.md để khám phá đủ loại bộ tiêu chuẩn đánh giá (benchmark).

Chúng tôi xây dựng nền tảng này vì tin rằng việc đánh giá benchmark đang dần trở nên phổ biến.

Trước đây, khi đánh giá các mô hình, người ta chủ yếu nhìn vào các sự kiện ra mắt và bảng xếp hạng công khai.

Nhưng hiện tại, một bảng xếp hạng tổng quát lớn không còn đủ nữa. Mọi người quan tâm đến việc liệu một mô hình có thực sự phù hợp với các tác vụ cụ thể của họ hay không, nó xử lý tốt những tình huống nào và ở đâu thì nó thất bại.

Mỗi người đều có bối cảnh công việc và cuộc sống riêng — và trong lĩnh vực chuyên môn của mình, họ nắm quyền quyết định xem những năng lực nào mới là quan trọng.

Ngay cả người Trung Quốc cũng có thể bay ✈️

Vì vậy, chỉ có các công ty ứng dụng AI tham gia là chưa đủ. Chúng tôi muốn tìm kiếm thêm nhiều người có kỹ năng xây dựng benchmark và những người dùng Agent chuyên sâu để thực sự thử thách các công ty mô hình nền tảng này.

Thế là chúng tôi nghĩ đến sự kiện đặc trưng của Zang AI: hackathon tại tiệm net.

Tôi xin chính thức thông báo rằng Dongmodi Benchmark Hackathon đầu tiên sẽ được tổ chức tại một tiệm internet ở Bắc Kinh. Sự kiện này được đồng tổ chức bởi Qwen và Zang AI.

Vẫn là 30 giờ đồng hồ. Vẫn là mì tôm không giới hạn. Vẫn không được hút thuốc.

Điều đáng tiếc duy nhất là vì các tiệm internet cấm trẻ vị thành niên, chúng tôi có thể sẽ bỏ lỡ những thiên tài AI tuổi teen 😭

Hackathon này có hai bảng thi đấu:

Thứ nhất là Bảng Hữu dụng (Useful Track). Bạn có thể lấy những vấn đề gặp phải trong cuộc sống và công việc hàng ngày để làm bài kiểm tra cho các mô hình.

Đặc biệt là những tình huống mà các công ty "thổi phồng quá mức" nhưng thực tế lại hoàn toàn rác rưởi. Chúng tôi muốn các vấn đề càng khó đối với mô hình càng tốt.

Đó có thể là các tác vụ đời sống như lập kế hoạch lịch trình, sắp xếp việc cần làm, lên kế hoạch du lịch, tìm thuê căn hộ, tư vấn đầu tư chứng khoán; hoặc các tác vụ công việc như xây dựng bảng điều khiển (dashboard), phân tích dữ liệu, phân loại hóa đơn, v.v.

Chúng tôi đặc biệt hoan nghênh các vấn đề về phát triển game và chỉnh sửa video.

Và tất nhiên, nếu bạn thực sự yêu công việc của mình, bạn có thể tập trung vào việc kiểm tra năng lực chuyên môn của mô hình trong mảng Lập trình (sửa lỗi thực tế, khảo cổ và tái cấu trúc mã nguồn cũ, chuẩn bị một đống mã nguồn tồi tệ để xem mô hình nào có thể xử lý được) và Cộng tác (Cowork).

Thứ hai là Bảng Meme (Meme Track). Bạn có thể thỏa sức tưởng tượng và xây dựng những bộ đánh giá thú vị, bắt mắt để thăm dò các năng lực tiềm ẩn của mô hình.

Ví dụ như để một Agent đóng vai một thanh niên phiêu bạt ở Bắc Kinh đang cố gắng sinh tồn, chơi Civilization hoặc Dating Simulator, chơi Ma sói hoặc các giải đấu poker, hay cuộc thi tái hiện Raiden Shogun trong Minecraft.

Đóng vai một thanh niên phiêu bạt ở Bắc Kinh.

Để một Agent chơi Civilization.

Cuộc thi có hai giai đoạn:

Giai đoạn đầu là xây dựng benchmark. Một bộ benchmark bao gồm tập hợp các vấn đề, kèm theo giải thích tại sao nó hiệu quả, nó kiểm tra năng lực nào của mô hình và tiêu chí chấm điểm.

Đối với cuộc thi này, chất lượng quan trọng hơn số lượng — bạn thường không cần quá 15 vấn đề. Với loại hình và chất lượng phù hợp, ngay cả một vấn đề duy nhất cũng có thể đạt điểm rất cao.

Benchmark này có thể là một môi trường nơi Agent đóng vai CEO điều hành công ty, một công cụ cho một trận đấu game cụ thể, hoặc các vấn đề được chấm điểm tự động bằng chương trình và mô hình.

Giai đoạn thứ hai là chạy benchmark. Các thí sinh cần chạy bộ đánh giá của mình trên năm mô hình: Claude Opus5, GPT5.6 Sol, Qwen3.8 Max, K3 và DeepSeek V4 Pro, sau đó nộp kết quả đầu ra của mô hình, báo cáo phân tích và quy trình chấm điểm.

Chúng tôi sẽ cung cấp hướng dẫn vận hành chi tiết.

Như bạn có thể hình dung, cả hai giai đoạn sẽ tiêu tốn một lượng token khổng lồ, và chúng ta đang ở trong kỷ nguyên mà giá token tăng vọt.

Chưa kể đến giá gốc của Claude và GPT, ngay cả "Thánh Liang" của DeepSeek cũng đã biến thành "Tù nhân Liang" và bắt đầu thu phí. Xianyu hiện phải chi hai nghìn RMB chỉ để chạy một lần Zang AI Benchmark.

Tại đây, chúng tôi phải cảm ơn Qwen và Moonshot AI vì sự hỗ trợ tài trợ của họ.

Để xây dựng các kịch bản benchmark, chúng tôi khuyến khích sử dụng Qoder và Qwen Office làm công cụ chính, mặc dù bạn hoàn toàn có thể sử dụng các công cụ khác;

Đối với giai đoạn chạy benchmark, họ cũng cung cấp cho mỗi thí sinh đủ tín dụng API để kiểm tra các mô hình đã chỉ định.

Nếu bạn không biết cách xây dựng benchmark nhưng có một kịch bản công việc rõ ràng muốn đánh giá, bạn cũng rất được hoan nghênh tham gia hackathon của chúng tôi.

Evolvent AI là một công ty dữ liệu chuyên nghiệp về xây dựng benchmark. Họ sẽ có mặt tại sự kiện để hướng dẫn mọi người cách xây dựng một benchmark tốt từ con số không.

ZhenFund và chúng tôi đã chuẩn bị những phần thưởng thiết thực cho các thí sinh, bao gồm các sản phẩm từ Bambu Lab, DJI và Insta360, đồng thời đã mua một chiếc Mac mini làm giải thưởng lớn nhất.

AITrải nghiệmMô hình lớnCông nghệOffline
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.