elsewhere:
85

Thủ thuật

Các mô hình ẩn danh trên bảng xếp hạng AI: Liệu có phải chỉ là hàng loại hai?

(giờ Việt Nam)

Tóm tắt AI

Bài viết phân tích hiện tượng các mô hình AI ẩn danh chiếm lĩnh bảng xếp hạng, đặt ra nghi vấn về tính minh bạch và chất lượng thực sự của chúng so với các mô hình tên tuổi.

Bản dịch AI

Only second-rate models do anonymous benchmark bragging

"Bull's Coming, Guess Your Horse"

Không khó để hiểu tại sao tôi lại viết bài này — chủ yếu là vì tôi đã bị "bỏng tay" bởi mô hình "Bull's Coming".

Bắt đầu từ tối thứ Năm tuần trước, LLM "Bull's Coming" đã ra mắt với sự tung hô chấn động, khiến hàng loạt "dân chơi" thị trường thứ cấp nháo nhào đi tìm câu trả lời: công ty nào đứng sau mô hình Bull's Coming?

Thôi nào. Nếu bạn đang mua cổ phiếu của các công ty làm mô hình, bạn phải tin vào AGI chứ. Sao lại đi giao dịch dựa trên tin đồn? Dành cả ngày "nghe ngóng bên giường bệnh" — bạn chỉ đang bị các nhà tạo lập thị trường "vặt lông" mà thôi.

Lại đến thời điểm đó trong tháng: mùa đoán tên mô hình. Nghiêm túc đấy, sao các bạn cứ để mấy blogger thích hùa theo sự cường điệu về các mô hình ẩn danh dắt mũi thế? Tôi ghét nhất là mấy kẻ thích đố đố.

Thật khó tin là đã cuối tháng 8 năm 2026 rồi mà chúng ta vẫn còn trò tung mô hình ẩn danh lên bảng xếp hạng để mọi người đoán xem ai làm ra nó. Cả cái mô hình "Bull's Coming" này — đoán con 🐎 của bạn là sao?

Có gì mà phải đoán, người anh em? Nếu họ đặt tên là "Bull's Coming" (Bò tót đang đến), chắc chắn họ muốn thị trường chứng khoán tăng vọt. Vậy nên 99% là Zhipu AI, 1% còn lại dành cho trường hợp họ đột nhiên từ chối nhận vơ.

Và bạn phải thừa nhận là, "Zhipu Bull's Coming" — nghe thuận miệng thật, lại còn mang điềm lành, cứ như thể họ sinh ra là để dành cho nhau vậy.

Và giờ đây, khi không thể đứng đầu bảng xếp hạng so với Fable, họ bắt đầu tung chiêu kiểu "vượt qua Fable và GPT-5.6 trên các bài kiểm tra chọn lọc" — lúc nào cũng có cách để tự nhận mình thắng, nhỉ?

Nếu ai đó quên, thì Zhipu đã từng chơi trò tung mô hình ẩn danh lên bảng xếp hạng này khi họ ra mắt GLM-5 hồi đầu năm nay.

Họ tung một mô hình tên là "Pony Alpha" lên OpenRouter, cho dùng miễn phí, rồi gom một đám blogger trên Twitter Trung Quốc vào đoán xem đó là gì. Làm cho cả thiên hạ phải chơi cùng: liệu đó là DeepSeek-V4? Hay Grok 4.2?

Sau đó Zhipu tự tiết lộ đáp án, tạo ra cái khoảnh khắc "ôi vãi, khả năng lập trình của GLM-5 gần bằng Claude Opus 4.5" — cái mà Guancha.cn gọi là "khoảnh khắc hai bom một vệ tinh của AI Trung Quốc".

Vậy nên, tôi xin tuyên bố đây là "khoảnh khắc LLM Bull's Coming của Trung Quốc". Vẫn là chiêu cũ, nhưng lần nào cũng hiệu quả. Càng ngày càng đi sâu vào lối mòn của những kẻ cũ kỹ.

Điểm qua những người đam mê trò chơi bảng xếp hạng mô hình ẩn danh năm nay:

(Cứ tự nhiên bổ sung thêm nhé)

Kịch bản tạo hype về cơ bản là giống hệt nhau. Để tôi tóm tắt lộ trình phát hành ẩn danh kinh điển:

Phát hành mô hình ẩn danh, OpenRouter miễn phí trong thời gian giới hạn, đảm bảo vị trí top 3 — thuê vài người trên Twitter làm benchmark, trầm trồ rằng kết quả vượt qua Claude và GPT — truyền thông tự phát Trung Quốc đóng gói lại nội dung Twitter đó làm bằng chứng cho thấy mô hình này thật tuyệt vời — cuối cùng danh tính thật được tiết lộ, tận hưởng sự chú ý.

Hy vọng Zhipu sớm nhận vơ mô hình Bull's Coming 🌹

Thật lòng muốn gom hết mấy người làm LLM ẩn danh lại (dù Xianyu nói LongCat làm gì cũng được, cứ ủng hộ mô hình và chip nội địa), đúng là lãng phí sự chú ý của mọi người.

Điều đáng ghét nhất là họ còn cài cắm blogger để đoán đó là DeepSeek. Thôi nào, DeepSeek quá nghiêm túc để làm mấy trò này — chỉ có mấy công ty thích làm màu mới khoái trò đó thôi.

Tôi cũng đã suy nghĩ kỹ xem ngoài DeepSeek ra thì còn cửa hàng mô hình nào nghiêm túc, chưa từng làm mô hình ẩn danh.

Cái tên đầu tiên hiện ra: StepFun. Không biết sau khi IPO, StepFun có chơi trội hơn cả Zhipu không, không biết StepFun có đơn giản là không biết cách làm mô hình ẩn danh hay không, nhưng StepFun thực sự đang đều đặn tung ra các mô hình hạng hai.

Nghiêm túc đấy, lời khuyên của tôi: hãy coi bất kỳ công ty nào thích trò mô hình ẩn danh là cửa hàng mô hình hạng hai. Nếu một mô hình nội địa thực sự có sức mạnh như Qwen 3.8 Max hoặc hiệu năng tham số lớn cấp độ K3, tại sao phải ẩn danh? Họ chắc chắn sẽ vội vàng tung ra một "màn ra mắt gây sốc" trước cả khi quá trình hậu huấn luyện kết thúc. Những kẻ làm chậm, miễn phí một tuần, dần dần tạo hype — rõ ràng không phải là SOTA (công nghệ tiên tiến nhất).

Đúng vậy, tung mô hình ẩn danh lên bảng xếp hạng là tấm hộ chiếu của các mô hình hạng hai.

Tôi đã đăng trên Jike trước đây: kẻ tiếp theo chơi trò mô hình ẩn danh với mọi người, tôi sẽ "bắn tỉa". Bốn tháng sau, chúng ta lại ở đây.

Mong chờ nhà sản xuất tiếp theo vẫn còn yêu thích các mô hình ẩn danh ❤️

Tuyên bố miễn trừ trách nhiệm cuối cùng: không nói là mô hình "Bull's Coming" này có vấn đề gì, và theo tin đồn thì có vẻ nó là một mô hình nhỏ — nếu nó thực sự làm được như kỳ vọng thì chắc chắn là dùng được, dù sao thì miễn phí vẫn là miễn phí.

Nhưng nếu định công bố thì hãy công bố sớm hơn. Đưa nó vào kế hoạch lập trình của mọi người sớm hơn là thắng tất cả.

Ý tôi là, những mô hình tốt như Qwen 3.8 27B bỏ qua mấy trò bảng xếp hạng, công bố trực tiếp và thực sự mang lại "trí tuệ với giá rẻ như bèo" là rất hiếm. Đây mới là hình ảnh thực sự của "trí tuệ tiên phong thuộc về mọi người".

Nói vậy thôi, nếu mô hình Bull's Coming thực sự giúp cổ phiếu Zhipu tăng giá, có lẽ nên cân nhắc trả chút phí bản quyền cho đạo diễn phim Bull's Coming nhỉ?

(Ảnh bìa do ChatGPT tạo, nội dung hoàn toàn do con người viết)

⬇️

Đăng ký Substack của chúng tôi: funeralai.substack.com

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.