Thủ thuật
Khi AI chỉ biết chạy theo mô hình lớn: Đừng quên kỹ năng làm chủ công nghệ
(giờ Việt Nam)
Tóm tắt AI
Xu hướng hiện nay đang quá đề cao sức mạnh của các mô hình lớn mà quên mất tầm quan trọng của việc thấu hiểu và điều khiển chúng hiệu quả. Bài viết cảnh báo về sự mất cân bằng trong tư duy phát triển AI hiện nay.
Bản dịch AI


"Mô hình nào duyệt web tốt nhất?"
Xu hướng mới nhất trong giới AI là chủ nghĩa cơ bản về mô hình (model fundamentalism), và nó thể hiện qua hai khía cạnh:
Sáu tháng trước, các mô hình vẫn được coi là những tiện ích như nước, điện và gas — một cuộc cạnh tranh hàng hóa với biên lợi nhuận bằng không. Các đợt IPO của Zhipu AI và MiniMax từng bị xem là hành động bán phá giá trên thị trường. Giờ đây, mọi người đang tranh nhau hỏi khi nào mô hình mới của Zhipu ra mắt (bản thân Zhipu cũng đang tung ra các gợi ý một cách chiến lược), nóng lòng muốn bắt kịp làn sóng cường điệu này.
Một làn sóng các ứng dụng AI kỳ lạ như Macaron đã đổi thương hiệu thành Neo Lab, điên cuồng bám đuôi Zhipu bằng các tinh chỉnh hậu đào tạo (post-training). Một làn sóng khác lại chuyển hướng thành các công ty "mô hình thế giới" với vô vàn các từ bổ nghĩa — mô hình thế giới nhân quả, mô hình thế giới xã hội — như thể ngày tận thế sắp đến nơi.
Các ứng dụng AI đã sụp đổ quá nhanh, bỏ qua giá trị thực sự duy nhất của chúng: các kịch bản sử dụng.
Các công ty mô hình không hiểu về kịch bản. Họ dồn toàn lực vào lập trình, còn khả năng viết lách của họ ngày càng tệ, ngôn từ ngày càng khó hiểu — đến mức Doubao bắt đầu trông có vẻ lưu loát hơn khi so sánh.
Vì vậy, các mô hình chỉ là những con hổ giấy. Chúng trông có vẻ ấn tượng nhưng thực tế không thể triển khai vào các kịch bản thực tế.
Việc tối ưu hóa mô hình cần được đánh giá nhiều hơn dựa trên các kịch bản thực tế — và đó chính xác là thế mạnh của các công ty ứng dụng.
Vì vậy, Zang AI, cùng với những người bạn của chúng tôi là Zhong Jingwei và Zhengyang, đã xây dựng một sản phẩm: Dongmodi (, nghĩa đen là "Bậc thầy hiểu mô hình").
Mục đích cốt lõi của Dongmodi là thu thập các đánh giá theo kịch bản cụ thể mà các công ty ứng dụng thực hiện trên nhiều mô hình khác nhau.
Hiện tại, nền tảng này lưu trữ các bộ tiêu chuẩn đánh giá (benchmark) bao gồm Gamecraft Bench (đánh giá khả năng phát triển trò chơi), RSI Bench (kiểm tra khả năng đào tạo mô hình), CEO Bench (để một Agent điều hành một công ty AI SaaS) và Ego Bench (kiểm tra khả năng sử dụng trình duyệt), cùng nhiều bộ khác.
Hãy mở fuckai.md để duyệt qua — chỉ riêng cái tên đã thể hiện thái độ của chúng tôi đối với các mô hình:

Sứ mệnh của Dongmodi là dân chủ hóa các bộ tiêu chuẩn đánh giá, giúp nhiều người khám phá hơn các bộ đánh giá đa dạng, phù hợp với doanh nghiệp để xác định nên sử dụng mô hình nào — và cuối cùng là nên triển khai Agent, Skill và công cụ nào.
Nếu ai cũng có thể thực hiện hậu đào tạo (post-training), thì ai cũng trở thành một Bậc thầy hiểu mô hình. Khi đó, thế giới sẽ không bị thống trị bởi các công ty mô hình, và các công ty ứng dụng sẽ không bị chết!
Chủ đề đánh giá đầu tiên của chúng tôi: mô hình nào thực sự duyệt web tốt nhất?
Bộ tiêu chuẩn này được phát triển với sự hợp tác của Aute. Giới thiệu nhanh: Aute đang xây dựng một trình duyệt có tên là ego (lite), được thiết kế để người dùng và các Agent cùng sử dụng chung.
Sản phẩm này về cơ bản biến toàn bộ internet thành một API thân thiện với mô hình, vì vậy bạn có thể mang theo Codex, Pi hoặc thậm chí WorkBuddy của riêng mình để gọi nó.
Từ việc cào dữ liệu các trang web yêu cầu đăng nhập đến việc thao tác trên các bảng điều khiển backend phức tạp của các nhà cung cấp đám mây — nó xử lý tất cả. Tôi từng gợi ý họ nên dồn toàn lực để tận dụng sự cường điệu của WorkBuddy.
Về lý do tại sao nó được gọi là "lite" — Aute đã cho tôi xem bản ego đầy đủ chưa phát hành: Agent trực tuyến duy trì trên đám mây + trình duyệt + điều khiển cục bộ trên các thiết bị + ổ đĩa đám mây + phương thức nhập liệu. Về cơ bản, nó là một con quái vật Frankenstein.
Nhưng đó là chuyện ngoài lề của bài đánh giá hôm nay. Quay lại với bộ tiêu chuẩn.
Bộ tiêu chuẩn đầy đủ có 31 tác vụ — không phải là con số quá lớn, nhưng mỗi tác vụ đều nhằm mục đích mô phỏng các kịch bản thực tế bằng cách sử dụng các trang web thực.
Các tác vụ này bao gồm thống kê các bài đăng thịnh hành trên Hacker News, lọc phim khoa học viễn tưởng trên IMDb, nộp đơn xin việc tại OpenAI, tìm việc trên Reddit, điền vào biểu mẫu chuyến bay một chiều từ New York đến Miami, và so sánh hai khu vực để mở rộng bán lẻ bằng cách truy vấn số liệu việc làm và mức lương trung bình, cùng nhiều tác vụ khác.
Ngoài kết quả đạt/không đạt tổng thể, mỗi tác vụ đều có điểm số chi tiết cho các bước quan trọng. Chúng tôi đã thử nghiệm mười sáu mô hình.
Dưới đây là kết quả:
Hạng S: GPT-5.6, Claude Fable 5, Claude Opus 5
Hạng A: Qwen 3.8 Max Preview, Doubao Seed Evolving, DeepSeek V4 Flash
Hạng B: GLM-5.2, Kimi K3, Hunyuan Hy3
Hạng C: MiniMax M3, DeepSeek V4 Pro, Step 3.7 Flash
Hạng D: LongCat2.0
Hạng E: ERNIE Bot 5.1, MiMo V2.5 Pro

Ba mô hình dẫn đầu không gây ngạc nhiên — chúng được công nhận rộng rãi là những mô hình tốt nhất.
Trong số các mô hình nội địa, nói một cách chính xác thì DeepSeek V4 Flash chiếm vị trí đầu tiên. Với hiệu suất gần như tương đương, nó chỉ tốn vài Nhân dân tệ — rẻ nhất trong tất cả các mô hình được thử nghiệm.
Ngược lại, GLM-5.2, mô hình có hiệu suất thấp hơn DeepSeek, đã tiêu tốn tới 170 Nhân dân tệ.
Hạng thứ hai — GLM-5.2, Kimi K3, Hunyuan Hy3 — chủ yếu tụt hậu so với hạng đầu ở hiệu suất trong các tác vụ biến động.
Một lưu ý nhỏ: cho đến tận bây giờ, khi chạy Kimi K3, chúng tôi liên tục gặp phải tình trạng gián đoạn, cực kỳ chậm chạp và API không ổn định. Tám tác vụ đã bị chấm dứt sớm; chúng tôi đã chạy lại chúng, nhưng hiệu suất cuối cùng của K3 vẫn chỉ ở mức trung bình.
Theo những gì có thể thấy, tài nguyên tính toán và GPU vẫn là yếu tố quan trọng nhất. Tôi cho rằng NVIDIA vẫn còn dư địa để phát triển.
Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.