16/08

Chủ Nhật · 5 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 42/100

Nghiên cứu của IBM: Điểm số benchmark AI phụ thuộc nhiều vào cách đặt câu hỏi hơn là năng lực thực tế

Interesting new research from IBM. If you pick models from benchmark deltas, some of that delta bel…

DịchNghiên cứu BenchDrift từ IBM chỉ ra rằng các mô hình AI mạnh thường nhạy cảm với cách diễn đạt hơn cả mô hình yếu, khiến thứ hạng trên các bảng xếp hạng benchmark không phản ánh chính xác năng lực thực sự.

15/08

Thứ Bảy · 1 tin
Epoch AI@EpochAIResearch
Hướng dẫnĐiểm AI 24/100

Lãnh đạo Epoch AI chia sẻ về các vấn đề cốt lõi và định hướng đánh giá năng lực AI

What are the big questions about AI capabilities that govern the impact AI will have on the world? I…

DịchGreg H. Burnham từ Epoch AI phân tích những thách thức then chốt quyết định tác động của AI đối với thế giới, đồng thời làm rõ cách các bộ tiêu chuẩn đánh giá của họ giúp giải quyết những vấn đề này.

14/08

Thứ Sáu · 4 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 46/100

Meta công bố khung Wiggle: LLM dễ bị 'thao túng' và thay đổi quyết định khi làm giám khảo

Brilliant new paper from Meta. LLM judges get validated on accuracy against golden data. That says …

DịchNghiên cứu từ Meta cho thấy các mô hình ngôn ngữ lớn (LLM) dễ dàng thay đổi phán quyết khi bị gây áp lực hoặc phản biện, làm giảm đáng kể độ chính xác của kết quả đánh giá.

Francois Chollet@fchollet
Hướng dẫnĐiểm AI 48/100

François Chollet cảnh báo: Đừng dùng bộ dữ liệu ARC 3 công khai để đánh giá AI

Regular reminder -- the set of public ARC 3 games is called "demonstration set", not "eval set" nor …

DịchFrançois Chollet nhấn mạnh bộ dữ liệu ARC 3 công khai chỉ mang tính chất minh họa, không phải chuẩn mực đánh giá. Điểm số 2,7% trên bảng xếp hạng hiện tại không phản ánh đúng năng lực thực tế của mô hình so với bộ dữ liệu kiểm tra kín.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 47/100

Tại sao trải nghiệm sử dụng Opus 5 lại gây thất vọng?

Dù đạt điểm benchmark cao, Opus 5 lại gây khó chịu vì xu hướng tự ý suy diễn thay vì đặt câu hỏi làm rõ, khiến người dùng phải giám sát thủ công nhiều hơn. Tác giả cho rằng áp lực điểm số đã vô tình ưu tiên các mô hình 'liều lĩnh' thay vì sự cẩn trọng cần thiết trong lập trình.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

PlayWorld: Đánh giá mô hình thế giới thông qua AI Agent với mục tiêu dài hạn

Nhóm nghiên cứu từ ĐH Hồng Kông và Kuaishou giới thiệu PlayWorld, bộ tiêu chuẩn sử dụng AI Agent để đánh giá khả năng tương tác và duy trì tính nhất quán của các mô hình thế giới trong các kịch bản phức tạp.

13/08

Thứ Năm · 3 tin
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 60/100

Artificial Analysis ra mắt Optima: Nền tảng tùy chỉnh đánh giá hiệu năng AI

We're launching Optima. Now anyone can create a custom benchmark for their use case, leveraging Arti…

DịchOptima cho phép người dùng xây dựng bộ tiêu chuẩn đánh giá riêng dựa trên dữ liệu cá nhân hoặc HuggingFace, giúp so sánh chính xác chi phí, tốc độ và hiệu suất giữa các mô hình AI hàng đầu để tối ưu hóa lựa chọn.

Thêm 1 nguồn khác đưa tinThe Decoder: AI News

12/08

Thứ Tư · 4 tin
The Decoder: AI News
Hướng dẫnĐiểm AI 56/100

Công cụ AI tầm soát ung thư vú chưa đáp ứng kỳ vọng của các bác sĩ chẩn đoán hình ảnh

Khảo sát từ 215 chuyên gia cho thấy các công cụ AI được FDA phê duyệt hiện chưa đạt hiệu quả như kỳ vọng trong việc giảm tỷ lệ gọi lại, giảm sinh thiết không cần thiết hay giảm áp lực công việc cho bác sĩ.

Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 62/100

Artificial Analysis ra mắt bộ tiêu chuẩn AA-AnalystAgent: Claude 3.5 Opus dẫn đầu

Announcing AA-AnalystAgent, our new agentic benchmark for quantitative analysis on real-world spread…

DịchArtificial Analysis vừa công bố bộ tiêu chuẩn AA-AnalystAgent để đánh giá khả năng phân tích dữ liệu thực tế. Claude 3.5 Opus (bản max) hiện đang dẫn đầu với 54%, vượt qua GPT-5.5 và Kimi K3 trong các tác vụ xử lý bảng tính và tài liệu.

Tổng 14 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (25 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Đánh giá AI” — Trang 9 | AIHOT.vn