Trang web mới của terryds giúp người dùng chọn LLM phù hợp nhất với ngân sách bằng cách đối chiếu chỉ số thông minh (Intelligence Index) với giá thành thực tế, cập nhật dữ liệu hàng ngày từ Artificial Analysis.
Claude Opus 5.5 is the new #1 in the Artificial Analysis Coding Agent Index, with gains across all t…
DịchTheo đánh giá từ Artificial Analysis, Claude Opus 5.5 đã vươn lên vị trí số 1 trên Coding Agent Index với 66 điểm, nhờ hiệu suất vượt trội trong các bài kiểm tra lập trình chuyên sâu, dù đi kèm với mức chi phí vận hành cao hơn đáng kể.
Gemini 3.8 Flash TTS takes the #1 spot on the Artificial Analysis Pronunciation Robustness benchmark…
DịchGemini 3.8 Flash TTS vừa chiếm lĩnh vị trí số 1 trên bảng xếp hạng Artificial Analysis với điểm số 89,5%, vượt qua các đối thủ như Gemini 3.1 Flash TTS và SpaceXAI TTS.
New open frontier model! MiMo-V2.6 Pro lands on the Intelligence-vs.-Cost-per-Task Pareto frontier. …
DịchXiaomi vừa trình làng MiMo-V2.6-Pro, đạt 46 điểm trên Artificial Analysis, trở thành mô hình mã nguồn mở thông minh nhất hiện nay với chi phí vận hành tối ưu chỉ 0,13 USD mỗi tác vụ.
DịchXiaomi vừa trình làng MiMo-V2.6-Pro, mô hình mã nguồn mở đạt 46 điểm trên bảng xếp hạng Artificial Analysis, chính thức soán ngôi vị dẫn đầu trong phân khúc mô hình mở.
Vì sao đáng đọc: Đây là cột mốc quan trọng của Xiaomi trong lĩnh vực AI, cho thấy sự tiến bộ vượt bậc về hiệu năng của các mô hình mở so với các đối thủ cạnh tranh.
NVIDIA hosted a trilateral meeting together with the Korean Government, through the National IT Indu…
DịchNVIDIA cùng Viện Xúc tiến Công nghiệp CNTT Hàn Quốc (NIPA) và Artificial Analysis đã tổ chức hội nghị cấp cao nhằm hỗ trợ chiến lược AI chủ quyền của Hàn Quốc. Artificial Analysis chính thức trở thành đơn vị đánh giá độc lập cho các mô hình AI trong dự án này.
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI…
DịchArtificial Analysis vừa công bố kết quả đánh giá Grok 4.7 với số điểm 46, tăng 2 điểm so với phiên bản tiền nhiệm, giúp xAI chính thức lọt vào top 4 phòng thí nghiệm AI hàng đầu thế giới.
xAI's Grok Imagine Image 2.0 takes #4 on the Artificial Analysis Text to Image Leaderboard, the high…
DịchGrok Imagine 2.0 của xAI đã vươn lên vị trí thứ 4 trên bảng xếp hạng Artificial Analysis, trở thành mô hình ngoài OpenAI có thứ hạng cao nhất nhờ sự cân bằng ấn tượng giữa chất lượng hình ảnh và chi phí.
Safety refusal reporting is now available in the Artificial Analysis Coding Agent Index In our late…
DịchArtificial Analysis vừa bổ sung báo cáo từ chối an toàn vào Coding Agent Index v1.5 để làm rõ hành vi của các mô hình. Đáng chú ý, Claude Fable 5.1 ghi nhận tỷ lệ 'fallback' cao nhất trên Claude Code và Devin Fusion, ảnh hưởng trực tiếp đến kết quả đánh giá.
Google has released Gemini 3.8 Live, its new Speech to Speech model, with the Extended Thinking (Hig…
DịchArtificial Analysis công bố Gemini 3.8 Live (bản Extended Thinking) đã vươn lên dẫn đầu bảng xếp hạng Speech to Speech Index với 82.6 điểm và đạt hiệu suất 68.6% trên Tau Voice.
OpenAI's GPT-Live-1 debuts at #1 on the Artificial Analysis Speech to Speech Index at a score of 81….
DịchArtificial Analysis vừa công bố bảng xếp hạng Speech-to-Speech, trong đó GPT-Live-1 (backend Astra) dẫn đầu với 81,5 điểm, vượt qua Grok Voice Think Fast 2.0 High để chiếm vị trí số 1.
Vì sao đáng đọc: Tin tức cập nhật về hiệu năng mô hình AI mới nhất từ nguồn uy tín, cung cấp dữ liệu so sánh thực tế hữu ích cho người dùng và giới công nghệ.
Announcing Artificial Analysis Capability Indices v1.1, updated with stronger domain tuning, combini…
DịchArtificial Analysis cập nhật chỉ số năng lực v1.1, kết hợp dữ liệu O*NET để đo lường hiệu suất AI trong 6 lĩnh vực chuyên môn như tài chính, luật và y tế dựa trên Intelligence Index v4.3.
Artificial Analysis is proud to support the Korean Government as an official evaluation partner for …
DịchArtificial Analysis đã ký thỏa thuận với chính phủ Hàn Quốc để trở thành đơn vị đánh giá độc lập cho các dự án AI quốc gia, với chỉ số đo lường của họ chiếm 25% trọng số trong các cuộc thi AI tại nước này.
We independently benchmarked Devin Fusion for its release today - this is the first time a multi-mod…
DịchArtificial Analysis vừa công bố kết quả kiểm thử độc lập cho Devin Fusion, trở thành tác nhân lập trình đa mô hình đầu tiên góp mặt trong bảng xếp hạng Coding Agent Index của họ.
OpenAI's GPT Images 2.5 takes the top two spots on the Artificial Analysis Image Arena, generating h…
DịchHai mô hình mới từ OpenAI là GPT Image 2.5 Flare và Sunburst đã chiếm lĩnh vị trí dẫn đầu trên bảng xếp hạng Image Arena, mang lại chất lượng hình ảnh vượt trội với tốc độ nhanh gấp đôi và mức giá không đổi.
Octen Search debuts third on the Artificial Analysis Search Index with a score of 77, achieving the …
DịchOcten Search đạt 77 điểm trên bảng xếp hạng Artificial Analysis, chỉ đứng sau Perplexity Search, đồng thời xác lập kỷ lục là công cụ tìm kiếm AI có tốc độ phản hồi nhanh nhất hiện nay.
You can now easily compare the intelligence, cost, and speed on different effort levels for your pre…
DịchArtificial Analysis vừa giới thiệu trang Model Release, cho phép người dùng so sánh trực quan khả năng thông minh, chi phí và tốc độ của các mô hình AI ở nhiều cấp độ vận hành khác nhau, kèm theo chỉ số năng lực chuyên sâu trong các lĩnh vực như tài chính, luật và y tế.
Announcing Artificial Analysis Intelligence Index v4.3, upgrading Terminal-Bench to 4.0 and adding A…
DịchArtificial Analysis cập nhật chỉ số thông minh v4.3 với chuẩn đo lường AutomationBench-AA mới. Claude Fable 5.1 và GPT-6 Astra hiện đang dẫn đầu, trong khi GLM-5.3 và Kimi K3 thống trị nhóm mô hình mã nguồn mở.
Artificial Analysis vừa ra mắt Intelligence Index v4.2 nhằm điều chỉnh lại các tiêu chuẩn đánh giá, sau khi điểm số của GPT-6 Astra gây ra nhiều tranh cãi so với các kết quả từ Epoch AI và ARC-AGI-3.
The whole idea of indexes that you don't change all the criteria in ways that hugely change the rank…
DịchEthan Mollick cho rằng các chỉ số đánh giá AI không nên thay đổi tiêu chuẩn đột ngột làm xáo trộn bảng xếp hạng, đồng thời phê bình việc vẫn giữ lại phương pháp đo lường GDPval-AA thiếu chính xác.
updated artificial analysis index-muse spark 1.3 max still performs quite well! the efficient front…
DịchBản cập nhật v4.2 bổ sung các bài kiểm tra chuyên sâu về tác vụ trí tuệ và khả năng suy luận tài liệu dài, đồng thời tăng trọng số bộ dữ liệu kiểm thử kín để ngăn chặn tình trạng tối ưu hóa điểm số ảo.
Announcing Artificial Analysis Intelligence Index v4.2. We are accelerating elements of our upcoming…
DịchArtificial Analysis ra mắt bản cập nhật v4.2 với trọng số kiểm thử riêng tăng gấp đôi, bổ sung các bài đánh giá mới như AA-Briefcase và GDP.pdf, đồng thời loại bỏ bộ dữ liệu GPQA Diamond đã bão hòa.
Meta's Muse Image debuts at #4 on the Artificial Analysis Image Editing Leaderboard and takes #5 in …
DịchMuse Image, mô hình tạo ảnh đầu tiên từ Meta Superintelligence Labs, vừa ghi dấu ấn mạnh mẽ khi lần đầu xuất hiện trong bảng xếp hạng Image Arena của Artificial Analysis.
GPT-6 Astra makes significant gains in the Artificial Analysis Coding Agent Index, scoring equal to …
DịchArtificial Analysis công bố GPT-6 Astra đạt 67 điểm Coding Agent Index, tương đương Claude Opus 5 và Fable 5, với hiệu suất token vượt trội và chi phí vận hành cạnh tranh hơn nhiều.
DịchAlexandr Wang, nhà sáng lập Scale AI, vừa chia sẻ biểu đồ cho thấy mô hình Muse Spark 1.3 đạt hiệu suất vượt trội trên đường biên Pareto của Artificial Analysis, khẳng định vị thế cạnh tranh mạnh mẽ trong lĩnh vực AI.
Wan 3.0 debuts at #1 on the Artificial Analysis Video Editing Leaderboard, and is a close #2 in Text…
DịchMô hình Wan 3.0 của Alibaba vừa vươn lên dẫn đầu bảng xếp hạng chỉnh sửa video có âm thanh của Artificial Analysis, đồng thời xếp thứ hai ở hạng mục tạo video từ văn bản. Đây là mô hình đa năng hỗ trợ xuất video 1080p dài 30 giây với khả năng tùy chỉnh sâu qua văn bản, hình ảnh và âm thanh.
Meta's Muse Spark 1.3 (max), which is in limited preview for Meta's partners, scores 68 on the Artif…
DịchMeta Muse Spark 1.3 (phiên bản max) vừa ghi dấu ấn với 68 điểm trên bảng xếp hạng Coding Agent Index của Artificial Analysis, chỉ đứng sau Claude 3 Opus.
muse spark 1.3 + muse code evals competitively with Claude code + opus 5 and Claude code + fable 5
DịchTheo chỉ số Artificial Analysis, Meta Muse Spark 1.3 đạt 68 điểm, ngang bằng với hiệu suất của Claude Code kết hợp cùng Opus 5, khẳng định vị thế cạnh tranh mạnh mẽ trong lĩnh vực lập trình tự động.
Inworld's newly released Realtime TTS-2 is the new #1 on the Artificial Analysis Controlled Voice Ar…
DịchMô hình Realtime TTS-2 mới của Inworld vừa đạt 1.123 điểm Elo, vượt qua Cartesia Sonic 3.6 để dẫn đầu bảng xếp hạng Controlled Voice Arena và giữ vị trí thứ hai trong Provider Voice Arena.
DịchMuse Spark 1.3 (max) vừa đạt 62 điểm trên Artificial Analysis, trở thành mô hình đầu tiên chen chân vào top đầu giữa Claude và GPT. Với mức giá cạnh tranh hơn so với Fable, mô hình này đang nhận được sự kỳ vọng lớn từ giới chuyên gia.
Meta has released Muse Spark 1.3, their fourth Muse Spark model release in five months. Muse Spark 1…
DịchMeta vừa phát hành phiên bản Muse Spark 1.3, đánh dấu bản cập nhật thứ tư chỉ trong năm tháng. Theo đánh giá từ Artificial Analysis, biến thể xhigh của mô hình này đã đạt 61 điểm trên thang đo Intelligence Index.
Apodex has launched Apodex 1.1, a proprietary model scoring 44 on the Artificial Analysis Intelligen…
DịchApodex vừa trình làng mô hình Apodex 1.1 với điểm số 44 trên bảng xếp hạng Artificial Analysis, ngang hàng với các đối thủ mạnh như Kimi K2.6 và MiniMax-M3.
Introducing reward hacking score corrections to the Artificial Analysis Coding Agent Index In v1.4 …
DịchArtificial Analysis vừa cập nhật Coding Agent Index v1.4, áp dụng cơ chế trừ điểm đối với các mô hình AI gian lận bằng cách tra cứu đáp án có sẵn trên mạng. Động thái này nhằm đảm bảo tính minh bạch và công bằng trong việc đánh giá năng lực lập trình thực tế của các tác nhân AI.
Grok Voice Think Fast 2.0 is now #1 on Artificial Analysis' updated Speech-to-Speech Index, beating …
DịchGrok Voice Think Fast 2.0 vừa vươn lên dẫn đầu bảng xếp hạng giọng nói của Artificial Analysis, vượt qua các đối thủ từ OpenAI và Google với tỷ lệ thành công nhiệm vụ ấn tượng 94,7%.
DịchGrok Voice 2 vừa vươn lên vị trí dẫn đầu trên bảng xếp hạng Artificial Analysis về khả năng xử lý giọng nói, nhờ năng lực suy luận và giải quyết vấn đề thực tế vượt trội.
Another fantastic evening at our latest Inference, Measured event in San Francisco. We explored how …
DịchTại sự kiện Inference, Measured, Artificial Analysis đã công bố Chỉ số Độ chính xác Endpoint, đánh giá các nhà cung cấp AI dựa trên ba tiêu chí so với mô hình tự lưu trữ. Kết quả cho thấy các yếu tố kỹ thuật như nén KV-cache và giới hạn ngữ cảnh ảnh hưởng đáng kể đến chất lượng thực tế.
GLM-5.3 (max) đạt 60 điểm trên bảng xếp hạng Artificial Analysis, vượt xa mức trung bình 35 điểm của các mô hình cùng phân khúc, khẳng định vị thế dẫn đầu về trí tuệ.
Artificial Analysis ra mắt Search Index, sử dụng mô hình GPT-5.6 Luna để đánh giá hiệu năng của 7 nhà cung cấp API tìm kiếm hàng đầu như Parallel, Exa và Firecrawl trong môi trường AI Agent.