TRACES The Benchmark that distrusts a correct answer.
DịchTRACES là một bộ benchmark mới được thiết kế để đánh giá mô hình AI mà không cần phụ thuộc vào các đáp án chuẩn, giúp kiểm chứng khả năng suy luận thực tế thay vì chỉ học vẹt.
any recommendations for someone in evals that care more about the behavior and experience for the us…
DịchLời khuyên cho đội ngũ đánh giá mô hình AI: Hãy ưu tiên phân tích hành vi và trải nghiệm thực tế của người dùng thay vì chỉ dựa vào các con số benchmark mang tính hình thức.
Announcing MLCR-AA, our leaderboard for Wisedocs' MLCR (Medical Long Context Reasoning) benchmark fo…
DịchArtificial Analysis vừa công bố bảng xếp hạng MLCR-AA cho các mô hình AI trong lĩnh vực y tế. Claude Fable 5 xuất sắc giành vị trí quán quân với 64,4%, trong khi phần lớn các mô hình khác đạt kết quả dưới 15%.
NARU là bộ benchmark mới gồm 1.481 câu hỏi dựa trên 146 giờ video, giúp đánh giá sâu khả năng suy luận về diễn biến cốt truyện và các yếu tố văn hóa đặc thù trong video dài, vốn là điểm yếu của các mô hình AI hiện nay.
Nghiên cứu mới chỉ ra rằng các mô hình ASR hàng đầu có xu hướng 'học vẹt' văn bản tham chiếu thay vì thực sự hiểu âm thanh, dẫn đến điểm số ảo dù dữ liệu đầu vào bị nhiễu hoặc thiếu hụt.
Grok 4.6 beats GPT-5.6 Sol, GPT-5.5, Sonnet 4.6, GLM 5.2, DeepSeek 4 Pro, Kimi K3, Opus 4.8 and Opus…
DịchGrok 4.6 vừa vượt qua hàng loạt đối thủ sừng sỏ như GPT-5.6 Sol, Sonnet 4.6 và DeepSeek 4 Pro để dẫn đầu điểm số trên chuẩn đánh giá phòng thủ mạng Simbian.
Các nhà phát triển sử dụng tác nhân tự động chum-codex để tối ưu hóa quy trình lập trình, giúp đạt hiệu suất 89,9% trên Terminal Bench 2.1, vượt qua cả mô hình Codex gốc.
Qualcomm vừa yêu cầu các đơn vị truyền thông thay thế slide giới thiệu chip Snapdragon C mới, trong đó lược bỏ hai bài kiểm tra về hiệu năng duyệt web và ứng dụng chạy nền mà không giải thích rõ lý do.
Next benchmark: detect human, choose literally anywhere else.
DịchMột phương pháp kiểm thử AI mới đang được đề xuất: hệ thống sẽ tự động đánh giá là thất bại nếu phát hiện có sự tham gia hoặc hỗ trợ từ con người trong quá trình thực hiện tác vụ.
Kết quả thử nghiệm từ Together AI cho thấy GPT-5.6 Sol vượt trội ở khả năng giải quyết vấn đề đơn lẻ, nhưng DeepSeek V4 Pro lại chiếm ưu thế về độ ổn định khi cho phép thử lại nhiều lần.
Qwen 27B is really good local model but, when you use it, it is immediately absolutely and obviously…
DịchDù là một mô hình chạy cục bộ ấn tượng, Qwen 27B vẫn bộc lộ hạn chế rõ rệt trong các tác vụ phức tạp và điều khiển tác nhân (agent) so với các đối thủ đầu bảng. Người dùng nên tự kiểm chứng qua các bài benchmark thực tế thay vì chỉ nhìn vào thông số.
Last week we launched Optima, a new platform for benchmarking models on your own workloads and compa…
DịchNền tảng Optima mới cho phép người dùng tự chạy các bài kiểm tra hiệu năng trên chính khối lượng công việc của mình, giúp so sánh chính xác tốc độ, chi phí và chất lượng giữa các mô hình AI.
New Stanford paper shows a leaderboard can tell you which agent scored highest on that benchmark, bu…
DịchNghiên cứu mới từ Stanford chỉ ra rằng các bảng xếp hạng AI hiện tại thiếu tính dự báo thực tế, khi độ tin cậy của các Agent giảm mạnh trong các tác vụ khó và không có sự tương quan với hiệu suất thực tế.
HarnessEval định nghĩa lại cách đánh giá các hệ thống AI phức tạp bằng cách xây dựng một quy trình kiểm chứng có hệ thống, thay vì chỉ dựa vào các mô hình chấm điểm đơn thuần.
Vì sao đáng đọc: Bài viết đề cập đến một xu hướng quan trọng trong việc đánh giá Agent AI, kết nối giữa kỹ thuật hệ thống và tiêu chuẩn đo lường, có giá trị cao cho cộng đồng nghiên cứu.
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Tác giả cảnh báo rằng LLM đang khiến các bộ tiêu chuẩn đánh giá (benchmark) mất đi độ tin cậy do khả năng tối ưu hóa quá mức cho dữ liệu huấn luyện. Thực nghiệm cho thấy AI có thể tạo ra mã nhanh hơn trên tập dữ liệu công khai nhưng lại thất bại thảm hại khi đối mặt với các bài kiểm tra thực tế.
HarnessEval-W giới thiệu quy trình đánh giá mới cho mô hình thế giới bằng cách chia nhỏ vấn đề thành các tác nhân con để suy luận và xác thực. Phương pháp này giúp tạo ra chuỗi suy luận có thể kiểm chứng, đạt độ chính xác cao so với đánh giá của con người trên 18 mô hình tiêu biểu.
VideoGAIA nâng tầm đánh giá AI từ việc trả lời câu hỏi đơn thuần sang tương tác đa lượt, yêu cầu mô hình phải sử dụng công cụ và tổng hợp thông tin từ video một cách thông minh.
PACE-Bench là bộ tiêu chuẩn mới gồm 144 cặp môi trường mô phỏng, thử thách các tác nhân AI tự tiến hóa khả năng thích nghi với các thay đổi vật lý bất ngờ thông qua việc chỉnh sửa mã nguồn.
VibeWorlding là khung làm việc toàn diện giúp các tác nhân đa phương thức tự động hiểu ý định, lập kế hoạch và xây dựng thế giới 3D tương tác thông qua bộ dữ liệu chuẩn VWE-BENCH.
Someone has combined DeepSeek V4 Pro 0813 with a harness called J-Space, which apparently reduces er…
DịchViệc tích hợp mô hình DeepSeek V4 Pro 0813 với framework J-Space được cho là giúp giảm thiểu đáng kể sai sót trong quá trình suy luận mở rộng và gọi công cụ.
CPI-Bench giải quyết hạn chế của các bộ tiêu chuẩn cũ bằng cách đánh giá khả năng chỉnh sửa đa ảnh, yêu cầu suy luận phức tạp và tính ứng dụng thực tế cao của các mô hình AI.
Interesting new research from IBM. If you pick models from benchmark deltas, some of that delta bel…
DịchNghiên cứu BenchDrift từ IBM chỉ ra rằng các mô hình AI mạnh thường nhạy cảm với cách diễn đạt hơn cả mô hình yếu, khiến thứ hạng trên các bảng xếp hạng benchmark không phản ánh chính xác năng lực thực sự.
Thử nghiệm PerceptionBench từ Moonshot AI cho thấy các mô hình AI hàng đầu đều chưa đạt 60% độ chính xác trong việc nhận diện hình ảnh, chứng minh lỗi suy luận thường bắt nguồn từ khâu đọc hình ảnh kém.
DịchOpenRouter vừa công bố bộ tiêu chuẩn đánh giá (benchmark) cho khả năng tìm kiếm web của các mô hình AI, giúp người dùng lựa chọn công cụ tối ưu nhất cho các tác vụ của AI Agent.
Regular reminder -- the set of public ARC 3 games is called "demonstration set", not "eval set" nor …
DịchFrançois Chollet nhấn mạnh bộ dữ liệu ARC 3 công khai chỉ mang tính chất minh họa, không phải chuẩn mực đánh giá. Điểm số 2,7% trên bảng xếp hạng hiện tại không phản ánh đúng năng lực thực tế của mô hình so với bộ dữ liệu kiểm tra kín.
GLM-5.3 đạt kết quả ấn tượng trong bài kiểm tra Terminal Bench 3.0, cho thấy khả năng xử lý các tác vụ phức tạp và tự động hóa quy trình vượt trội so với thế hệ trước.
Grok 4.6 wins again. 🏆 Grok 4.6 is #1 on micro1's Realm Tax benchmark with a 57.9% Best@3 score, b…
DịchGrok 4.6 vừa thiết lập cột mốc mới khi dẫn đầu bài kiểm tra Realm Tax (micro1) với điểm số Best@3 đạt 57.9%, vượt qua hàng loạt đối thủ sừng sỏ như Claude, GPT và Gemini.
We've just added $10 credit for any new sign ups to Optima for a limited time only. Try it out and l…
DịchOptima cho phép người dùng tạo các bài kiểm tra hiệu năng riêng biệt dựa trên dữ liệu thực tế, giúp so sánh tốc độ, chi phí và chất lượng giữa các mô hình AI hàng đầu để tìm ra giải pháp tối ưu nhất.
AutoWorldModel-Bench là bộ tiêu chuẩn mới cho phép các tác nhân AI tự động cải tiến mô hình thế giới trong môi trường game, giúp đánh giá khả năng nghiên cứu độc lập thay vì chỉ thực hiện các tác vụ lập trình theo yêu cầu.
Grok 4.6 takes the #1 spot on two more benchmarks! 🔥 • 3DCodeBench: 54.0%, creating engine-ready 3…
DịchGrok 4.6 vừa xuất sắc dẫn đầu hai bài kiểm tra mới: đạt 54% trên 3DCodeBench để tạo tài nguyên 3D và 40,9% trên CadGenBench để tạo mô hình CAD từ văn bản.
Grok 4.6 đạt 61 điểm trên Artificial Analysis, ngang bằng GPT-5.6 Sol nhưng có chi phí rẻ hơn 60%. Với cửa sổ ngữ cảnh 500k token và hiệu suất ấn tượng, đây là lựa chọn tối ưu về kinh tế cho người dùng.
Grok 4.6 is a huge improvement over Grok 4.5 🚀 Mercor's APEX benchmark shows major gains across ev…
DịchGrok 4.6 ghi nhận bước tiến vượt bậc trong các bài kiểm tra APEX của Mercor, với sự cải thiện đáng kể về năng lực xử lý trong các lĩnh vực chuyên môn như luật doanh nghiệp, ngân hàng đầu tư, tư vấn quản lý và kế toán.
Grok 4.6 takes the #1 spot on ARI Bench - the benchmark for recursive AI improvement. 🥇 It signifi…
DịchGrok 4.6 vừa thiết lập cột mốc mới trên ARI Bench - thước đo khả năng tự cải tiến đệ quy của AI. Phiên bản này không chỉ bỏ xa người tiền nhiệm Grok 4.5 mà còn vượt qua các đối thủ sừng sỏ như Claude Opus 5 và GPT-5.6.
Here we go: DeepSeek 4 GA Benchmarks are circulating already. A very solid upgrade, but it's a bit …
DịchDeepSeek 4 vừa lộ kết quả kiểm thử với hiệu năng ổn định, ngang hàng với các mô hình đầu bảng như Kimi k3 và GLM-5.2, đồng thời ra mắt phiên bản Pro song song với Grok 4.6 API.
Grok 4.6 is a massive upgrade 🚀 It beats Grok 4.5 High across every benchmark listed and now ranks…
DịchGrok 4.6 mang đến bước tiến lớn khi vượt qua phiên bản tiền nhiệm ở mọi bài kiểm tra, đồng thời đạt điểm số ngang bằng với GPT-5.6 Sol Max trên bảng xếp hạng Artificial Analysis. Người dùng hiện đã có thể trải nghiệm mô hình này thông qua Cursor và Grok Build.