Thủ thuật
GLM-5.3: Mô hình mã nguồn mở hiệu năng vượt trội, chi phí chỉ bằng 1/5 đối thủ
(giờ Việt Nam)
Tóm tắt AI
GLM-5.3 dẫn đầu bảng xếp hạng Featherbench với tỷ lệ chính xác tuyệt đối, đánh bại các mô hình từ Anthropic và OpenAI với chi phí vận hành thấp hơn đáng kể.
Bản dịch AI

Cập nhật ngày 23 tháng 8 năm 2026 · Đánh giá mô hình · Ed Yau, Kiến trúc sư AI ứng dụng, Kerv
Cùng một tài xế, cùng một đường đua. LLM chính là ngôi sao. Mười bảy mô hình hàng đầu được đưa vào chạy thử nghiệm trên cùng một vòng đua gồm 28 tác vụ thực tế — sử dụng chung một bộ khung (harness), cùng các câu lệnh (prompt) nguyên văn, chấm điểm theo phương pháp tất định — và kết quả đã được công bố.
Tóm tắt: nếu bạn chỉ chạy một mô hình, hãy chọn glm-5.3 — tỷ lệ đạt 100%, điểm rubric 9.3, chi phí $0,28 cho một vòng đua, bằng khoảng một phần năm chi phí của gpt-5.5 (tuy nhiên hãy kiểm tra lại các quy định tuân thủ trước). gpt-5.5 là lựa chọn thay thế nhanh hơn: TTFT (thời gian đến token đầu tiên) là 13,2 giây so với 16,3 giây của glm-5.3. gpt-5.6-luna vẫn là "ngựa thồ" rẻ nhất cho các công việc rủi ro thấp, có thể thử lại; haiku-4-5 nếu bạn cần kết quả chính xác ngay từ lần đầu. Hãy chọn sonnet-4-6 để có chất lượng mà không phải chờ đợi. Các lập luận chi tiết cùng những lưu ý →
17 mô hình · 28 tác vụ · thử nghiệm đơn lẻ · lần chạy nguồn mới nhất 20260822T172041Z · Nhật ký thay đổi
Mô hình nào đứng đầu bảng xếp hạng của chúng tôi?
Các LLM đã thể hiện như thế nào trong các bài kiểm tra thực tế của chúng tôi. Trọng tâm ở đây là các tác vụ thực tế mà con người thực sự thực hiện, không phải các chỉ số học thuật. Chúng tôi tập trung vào các tác vụ đơn lẻ để đơn giản hóa việc đánh giá. Một quy trình tác tử (agentic flow) suy cho cùng là một chuỗi các tác vụ như vậy. Hãy coi đây giống như các bài kiểm tra đơn vị (unit tests) cho tác tử. Chúng tôi đã tối ưu chi phí để ngay cả khi chạy toàn bộ bộ kiểm tra cũng chỉ tốn $30. Xem mọi tác vụ và câu trả lời thực tế của từng mô hình, hoặc so sánh trực tiếp hai mô hình →
Điểm tổng thể là tỷ lệ đạt trên 28 tác vụ thực tế của tôi. Vì số lượng thử nghiệm có hạn nên khoảng tin cậy Wilson khá rộng — thể hiện qua các râu trên biểu đồ.
Tóm tắt kết quả: nhấp vào một cột để sắp xếp theo chỉ số bạn chọn.
1 Điểm Rubric được chấm hồi cứu (ngày 14 tháng 7 năm 2026) bởi fable-5 dựa trên văn bản câu trả lời đã lưu, thông qua đường dẫn run_rubric của chính bộ khung — sử dụng cùng câu lệnh mù (blind prompt) và tiêu chí như mọi hàng khác.
2 Điểm 9.3 của fable-5 là tự đánh giá — mô hình tự chấm điểm câu trả lời của chính mình. Ma trận thiên kiến đánh giá (judge-bias matrix) trong lần chạy nguồn của nó cho thấy nó tự chấm mình 9.3 so với 8.6–8.7 cho các mô hình mà nó đánh giá độc lập. Đây cũng là con số duy nhất trên hàng của nó đến từ một lần chạy trước đó — lần chạy ngày 5 tháng 7 năm 2026, 11 trên 28 thử nghiệm được đánh giá — vì không có thử nghiệm nào trong lần chạy hiện tại của nó được đánh giá. Số liệu này được hiển thị để đảm bảo tính đầy đủ, không phải là con số để so sánh tương đương, trong khi chờ đợi một đợt đánh giá lại độc lập.
3 Dương tính giả ở trình kiểm tra công thức nấu ăn. Đối với công thức nấu ăn chay trong tuần, trình kiểm tra thuật ngữ cấm đã kích hoạt do một đề cập không phải nguyên liệu — một cảnh báo kiểm tra nhãn hoặc danh sách loại trừ phủ định ("không sử dụng nước mắm hoặc đồ trang trí có nguồn gốc động vật"). Cả ba công thức đều thực sự không có thịt, vì vậy gpt-5.5, sonnet-5 và fable-5 được tính là đạt tác vụ đó ở đây. Không có tác vụ hoặc trình kiểm tra nào bị chỉnh sửa.
4 Chi phí/tác vụ được tính trên các thử nghiệm có phản hồi cho fable-5 và opus-5 — các thử nghiệm bị từ chối và chặn tạo ra đầu ra gần bằng 0 với chi phí $0, và việc đưa chúng vào sẽ khiến mô hình trông có vẻ ngắn gọn và rẻ một cách giả tạo (fable-5 sẽ là $0,0481/thử nghiệm; opus-5 là $0,0597). Chi phí chạy tiêu đề của opus-5 là $1,67 là tổng thực tế của tất cả các thử nghiệm: các thử nghiệm bị chặn được tính phí $0. Không có mô hình nào khác trên bảng có các trường hợp bị từ chối.
Vòng đua, từng góc cua một #
Các mô hình được thêm gần đây nhất xuất hiện đầu tiên, với ngày kiểm tra mới nhất hiển thị bên dưới mỗi mô hình. Vòng đua gồm năm góc cua theo thứ tự cố định: Lập trình (Coding) → Dữ liệu (Data) → Thực tế (Realworld) → Bảo mật (Security) → Sử dụng công cụ (Tool-use). Màu sắc của một góc cua là tỷ lệ đạt của mô hình đó trong danh mục đó. Màu xanh lá cây là tốt — nghĩa là tỷ lệ thành công từ 85% trở lên. Đối với các mô hình có thể làm tất cả, hãy tìm những mô hình có toàn bộ màu xanh. Con số ở giữa mỗi vòng tròn là chi phí mỗi tác vụ của mô hình đó; bên dưới là thời gian trung vị đến token đầu tiên, tính bằng giây.
Di chuột hoặc chạm vào bất kỳ phân đoạn nào để xem góc đó kiểm tra điều gì và mô hình đã xử lý nó như thế nào.
Góc cua sạch (>85%) Góc cua không ổn định (60–85%) Ra khỏi đường đua (<60%)
Lựa chọn của chúng tôi — nhà vô địch toàn năng, mô hình "đảo hoang" Lựa chọn của chúng tôi cho một "ngựa thồ" chi phí thấp Lựa chọn của chúng tôi cho phản hồi nhanh nhất
Các ô dưới 60% được đánh dấu đỏ và 60–85% màu hổ phách — lập trình, dữ liệu và sử dụng công cụ là nền tảng cơ bản của bộ khung, vì vậy cuộc đua được quyết định ở phần thực tế và bảo mật.
Kết quả thực sự cho bạn biết điều gì?
Nếu bạn chỉ chạy một mô hình, hãy chạy glm-5.3
glm-5.3 là mô hình đầu tiên trên bảng vượt qua cả năm góc cua — lập trình, phát triển dữ liệu, thực tế, bảo mật và tác vụ — với tỷ lệ 100%. Nó được hỗ trợ bởi điểm rubric 9.3, cao thứ ba trên bảng, và chi phí $0,28 cho một vòng đua. Cái giá duy nhất là sự kiên nhẫn — thời gian trung vị đến token đầu tiên là 16,3 giây. gpt-5.5 là lựa chọn thay thế nhanh hơn với 13,2 giây, cùng tỷ lệ bảo mật 100% nhưng góc thực tế đạt 89% và chi phí $1,43 cho một vòng đua.
Fable không hoàn thành được một vòng đua nào
fable-5 đồng hạng cuối với 79% vì nó từ chối thực hiện 5 trong số các tác vụ. Nó thể hiện tốt ở những gì nó hoàn thành, nhưng ngay cả nó cũng cho rằng kimi-k3 đưa ra câu trả lời tốt hơn. Bạn sẽ cần một mô hình dự phòng nếu đang sử dụng Fable. opus-5 cũng gặp rào cản tương tự — bốn tác vụ coding-debug-* lành tính bị chặn trước khi bất kỳ token nào được tạo ra, trên một tập hợp tác vụ chồng chéo — vì vậy bộ phân loại của Anthropic dường như áp dụng cho toàn bộ dòng series 5, không chỉ riêng Fable. Xem phân tích chi tiết về các trường hợp bị từ chối để biết chuyện gì thực sự đang xảy ra.
Luna là "ngựa thồ" rẻ nhất
gpt-5.6-luna có chi phí $0,064 cho toàn bộ vòng đua, hoặc $0,0023 mỗi tác vụ, với thời gian trung vị TTFT là 5,3 giây. Điều đó làm cho nó trở nên hấp dẫn đối với các công việc nền khối lượng lớn, rủi ro thấp, nơi các lỗi dễ phát hiện và thử lại. Sự đánh đổi là đáng kể: 79% tổng thể và 33% về bảo mật, vì vậy hãy xác thực mọi kết quả và tránh sử dụng với các câu lệnh không đáng tin cậy. haiku-4-5 là lựa chọn thay thế có tỷ lệ đạt cao hơn với $0,0044 mỗi tác vụ, 96% tổng thể và TTFT là 0,9 giây. deepseek-v4-pro về danh nghĩa còn rẻ hơn ở mức $0,0029 mỗi tác vụ với cùng tỷ lệ đạt 96%, nhưng thời gian trung vị TTFT 40,0 giây — chậm nhất trên bảng — loại trừ nó khỏi bất kỳ ứng dụng tương tác nào; hãy coi nó là tùy chọn chỉ dành cho xử lý hàng loạt.
Vị khách bí ẩn thiết lập vòng đua chất lượng nhanh nhất
kimi-k3 vẫn đứng đầu rubric ở mức 9.5 — được đánh giá độc lập bởi fable-5 — với tỷ lệ đạt 96%, mặc dù điểm 9.4 của opus-5 hiện đang bám sát về chất lượng với thời gian chờ chỉ bằng một phần ba. Điểm trừ là sự kiên nhẫn: thời gian trung vị đến token đầu tiên là 26,4 giây, chậm thứ hai trên bảng sau 40,0 giây của deepseek-v4-pro, và sự chao đảo 75% ở các tác vụ phát triển dữ liệu, góc yếu duy nhất của nó. Không phù hợp cho các ứng dụng tương tác.
Ba chiếc xe đã thất bại trong bài kiểm tra va chạm
Dòng gpt-5.6 rất nhanh, nhưng nó gặp vấn đề về an toàn. gpt-5.6-luna, gpt-5.6-terra và gpt-5.6-sol đã phát ra "jailbreak canary" trong 11 trên 12 ô kiểm tra jailbreak (tỷ lệ đạt bảo mật 33–50%) — hãy đảm bảo bạn bảo vệ trong bộ khung của mình và áp dụng Red teaming cẩn thận hơn nếu sử dụng các mô hình này. Bộ ba Claude đã vượt qua 6/6 sạch sẽ, tương tự như gpt-5.5.
Một bộ lọc an toàn có thể trông giống hệt một vòng đua tồi
opus-5 đạt điểm rubric tốt nhất trên bảng mặc định ở mức 9.4 và 100% ở cả phần thực tế và bảo mật — sau đó hiển thị 43% ở phần lập trình. Ô đó không phải là khả năng gỡ lỗi của nó: bốn tác vụ coding-debug-* lành tính đã bị chặn bởi bộ phân loại phía nhà cung cấp trước khi một token nào được tạo ra, trên một tập hợp tác vụ chồng chéo với những tác vụ đã bị chặn trên fable-5. Hai mô hình thuộc dòng Anthropic hiện đã gặp phải bộ lọc tương tự, vì vậy hãy coi đó là một rủi ro đo lường thay vì một lỗi của mô hình — và lưu ý rằng opus-5 cũng bị phạt hai lần vì gắn cờ một cuộc tấn công mà nó đã chống lại thành công.
Ed-o-meter được chấm điểm như thế nào?
Bộ khung, tác vụ và trình kiểm tra là mã nguồn mở tại Featherbench (MIT). Hãy sao chép nó và tự chạy vòng đua, hoặc yêu cầu một mô hình mới thông qua GitHub issue.
Lập trình (7 · Python)
Dữ liệu (4)
Thực tế (9)
Bảo mật (6)
Sử dụng công cụ (2)
Xem câu trả lời thực tế của từng mô hình cho mọi tác vụ, hoặc chọn hai mô hình để so sánh trực tiếp →
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.