Đánh giá & So sánh
Đo lường sức mạnh mô hình: Kết quả Benchmark tranh cãi, phương pháp đánh giá và biến động bảng xếp hạng.
1.009 bài thu thập73 tinh chọncập nhật đến 28/09 01:01
- Gary Marcus: The Road to AI We Can TrustT6 · 04/09 · 06:29
Gary Marcus đánh giá GPT-6 Astra: Bước tiến lớn nhưng vẫn lo ngại về độ tin cậy
Gary Marcus nhận định GPT-6 Astra là bước tiến thực sự khi OpenAI bắt đầu tích hợp mô hình thế giới biểu tượng, củng cố cho quan điểm mà ông theo đuổi suốt thập kỷ qua, dù vẫn còn hoài nghi về tính ổn định và khả năng kiểm soát.
- Sherwin WuT6 · 04/09 · 03:45
ARC-AGI-3 bị chinh phục chỉ sau 6 tháng, tốc độ phát triển AI vượt xa dự đoán
Benchmark ARC-AGI-3 đã bị mô hình Astra bão hòa chỉ sau nửa năm, nhanh gấp đôi so với dự đoán ban đầu của François Chollet. Sự kiện này cho thấy năng lực của các mô hình AI thế hệ mới đang tiến hóa với tốc độ chóng mặt, thách thức mọi quan điểm cũ về trí tuệ nhân tạo.
- Francois CholletT6 · 04/09 · 03:04
François Chollet đánh giá hiệu suất của GPT-6 Astra trên bộ đề ARC-AGI-3
François Chollet cho biết GPT-6 Astra đạt bước tiến lớn trong suy luận tương tác, ghi 66% trên ARC-AGI-3 và gần 100% khi kết hợp kỹ thuật tối ưu hóa, dù chi phí mỗi lượt lên tới 360 USD.
- Google AI: DEV tác giảT4 · 02/09 · 23:48
Google chia sẻ cách viết tiêu chí đánh giá chuẩn xác cho mô hình LLM-as-a-Judge
Google hướng dẫn cách xây dựng bộ tiêu chí đánh giá (rubric) cho LLM-as-a-Judge, giúp giảm thiểu sự mơ hồ và lãng phí token. Bài viết nhấn mạnh việc chia nhỏ câu hỏi, tập trung vào dữ kiện khách quan và sử dụng bộ dữ liệu chuẩn để hiệu chỉnh mô hình đạt độ chính xác tương đương con người.
- ARC Prize: Blog chính thứcT4 · 02/09 · 23:00
ARC Prize công bố kết quả đánh giá GPT-6 Astra trên bộ đề ARC-AGI-3
GPT-6 Astra của OpenAI thiết lập kỷ lục SOTA mới trên ARC-AGI-3 với điểm số ấn tượng, đạt 99.9% ở bài kiểm tra Provider Adapter với chi phí tối ưu.
- JiQiZhiXinT4 · 02/09 · 14:00
ClawBench: Khi các siêu AI 'bó tay' trước những tác vụ thực tế trên web
Nghiên cứu mới từ TIGER Lab cho thấy các mô hình hàng đầu như Claude, GPT và Gemini đều thất bại thảm hại khi thực hiện các tác vụ thực tế trên web, với tỷ lệ thành công chỉ đạt khoảng 33%.
- QbitAIT4 · 02/09 · 10:15
Claude ra mắt Fable 5.1: Đứng đầu 8 bảng xếp hạng, giảm giá 45% và tích hợp cơ chế chống chưng cất
Fable 5.1 nâng cấp toàn diện khả năng xử lý tác vụ phức tạp của Claude, đồng thời tối ưu hóa chi phí vận hành và bảo mật mô hình với cơ chế chống chưng cất dữ liệu mới.
- QwenT4 · 02/09 · 10:07
Qwen3.8-Max-0902 soán ngôi đầu Code Arena với mức giá cạnh tranh 5 USD/triệu token
Alibaba ra mắt Qwen3.8-Max-0902, mẫu AI lập trình dẫn đầu bảng xếp hạng Code Arena: WebDev với 1.691 điểm, đồng thời thiết lập chuẩn mực mới về hiệu năng trên chi phí.
- Hugging Face: BlogT7 · 29/08 · 04:26
Bảng xếp hạng Open ASR bổ sung ngôn ngữ Nam bán cầu đầu tiên: Tiếng Hindi và tiếng Anh Ấn Độ
Voice Arena và Hugging Face vừa tích hợp bộ dữ liệu Monsoon cho tiếng Hindi và tiếng Anh Ấn Độ vào bảng xếp hạng Open ASR, đánh dấu cột mốc ngôn ngữ phi châu Âu đầu tiên được đưa vào hệ thống đánh giá này.
- Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)T6 · 28/08 · 19:25
Terminal-Bench-Science 0.1: Bộ tiêu chuẩn mới đánh giá năng lực AI trong nghiên cứu khoa học
Các nhà nghiên cứu tại Stanford vừa ra mắt Terminal-Bench-Science 0.1, bộ benchmark gồm 70 tác vụ chuyên sâu thuộc nhiều lĩnh vực khoa học nhằm đo lường khả năng thực hiện quy trình nghiên cứu thực tế của các AI agent.
- Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)T6 · 28/08 · 15:55
Sổ tay kỹ sư AI: Xây dựng RAG, Agent và đánh giá mô hình trên Colab không cần framework
Bộ notebook thực hành giúp kỹ sư AI xây dựng hệ thống từ API gốc thay vì framework, bao gồm RAG, Agent và tinh chỉnh mô hình trên Groq miễn phí. Tài liệu cung cấp các case study thực tế, dễ dàng chuyển đổi sang OpenAI.
- Tang JieT5 · 27/08 · 12:58
GLM-5.3 Flash AA của Tang Jie thống trị bảng xếp hạng OpenRouter
Mô hình GLM-5.3 Flash AA đạt điểm 57 trên OpenRouter với chi phí chỉ bằng 1/100 so với các mô hình đầu bảng, đồng thời chiếm lĩnh 20% thị phần token hàng tuần nhờ sức mạnh từ chip nội địa Trung Quốc.
- JiQiZhiXinT4 · 26/08 · 13:30
AI có thể tự làm nghiên cứu khoa học? ASI-Bench ra đời để đo lường khả năng tự chủ của AI
ASI-Bench là bộ tiêu chuẩn đánh giá mới do các đại học hàng đầu thế giới phát triển, nhằm đo lường khả năng tự chủ của AI trong việc thực hiện các nghiên cứu khoa học thực thụ thay vì chỉ xử lý dữ liệu có sẵn.
- QbitAIT3 · 25/08 · 10:45
Mô hình robot DM0.5 của Force-Link thống trị bảng xếp hạng RoboDojo và mở mã nguồn hoàn toàn
DM0.5 thiết lập tiêu chuẩn mới (SOTA) cho bộ não robot với hiệu suất vượt trội, đồng thời công khai toàn bộ mã nguồn cho cộng đồng nghiên cứu.
- JiQiZhiXinT2 · 24/08 · 01:30
PlayWorld: Bước tiến mới trong đánh giá mô hình thế giới thông qua AI Agent
Nhóm nghiên cứu từ HKU và các đối tác giới thiệu PlayWorld, một chuẩn đánh giá mới cho phép AI Agent 'trải nghiệm' mô hình thế giới để kiểm chứng tính nhất quán hình học và logic tương tác thay vì chỉ dựa vào các chuỗi hành động cố định.
- JiQiZhiXinT7 · 22/08 · 03:15
GigaBrain-0.7 ra mắt: Mô hình robot đột phá với kiến trúc System-3 và hệ thống 'Tháp đôi' dẫn đầu bảng xếp hạng
GigaBrain-0.7 thiết lập chuẩn mực mới cho robot thông minh nhờ kiến trúc System-3 cho phép dự đoán hành động trước khi thực thi, đồng thời thống trị bảng xếp hạng RoboColiseum với mô hình 'Tháp đôi' dữ liệu và thuật toán.
- Hugging Face: BlogT6 · 21/08 · 21:06
Hugging Face vạch trần hiện tượng 'gian lận' điểm số trong các mô hình nhận dạng giọng nói (ASR)
Nghiên cứu mới từ Hugging Face chỉ ra nhiều mô hình ASR đạt điểm cao nhờ học thuộc lòng dữ liệu kiểm thử thay vì cải thiện khả năng nhận dạng thực tế, dẫn đến kết quả đánh giá bị thổi phồng.
- Hugging Face Daily PapersT6 · 21/08 · 19:30
Tư duy bằng ngôn ngữ ít tài nguyên: SFT xây dựng gì, RL sửa lỗi gì và những hạn chế của điểm số chính xác
Nghiên cứu chỉ ra rằng điểm số benchmark thường gây nhiễu, trong khi SFT thực sự giúp mô hình tư duy bằng ngôn ngữ mục tiêu thay vì chỉ dịch thuật ngầm, giúp việc kiểm chứng và sửa lỗi trở nên khả thi hơn.
- JiQiZhiXinT6 · 21/08 · 15:15
FireRedTTS3 từ Xiaohongshu: Mô hình AI 'đa năng' biết nói 24 ngôn ngữ, tự thiết kế giọng nói và chỉnh sửa âm thanh cực chuẩn
FireRedTTS3 tích hợp khả năng sao chép giọng nói zero-shot, thiết kế âm thanh qua mô tả văn bản và chỉnh sửa giọng nói chính xác trong một mô hình duy nhất, đạt hiệu suất dẫn đầu ngành trên nhiều bảng xếp hạng.
- PandailyT5 · 20/08 · 09:15
Xiaomi bứt phá: AI, chip tự phát triển và robot hình người định hình tương lai ngoài smartphone
Xiaomi đạt tăng trưởng ấn tượng trong Q2/2026 nhờ mô hình AI MiMo-V2.5 dẫn đầu bảng xếp hạng, chip Xuanjie vượt kiểm định và robot hình người ứng dụng thành công trong nhà máy.