26/09

Thứ Bảy · 2 tin
SemiAnalysis@SemiAnalysis_
NgànhĐiểm AI 26/100

SemiAnalysis đánh giá độ tin cậy của ClusterMAX 3.0

In our testing for ClusterMAX 3.0, one of the biggest things that we tested was reliability. we buil…

DịchSemiAnalysis thực hiện kiểm thử độ tin cậy cho ClusterMAX 3.0, tập trung vào khả năng nhận diện và phục hồi sau sự cố để đảm bảo hiệu suất thông lượng ổn định từ các nhà cung cấp.

24/09

Thứ Năm · 1 tin

21/09

Thứ Hai · 1 tin

17/09

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnXConf: Nâng cao độ tin cậy của mô hình ngôn ngữ thông qua kinh nghiệm thực tế

XConf là phương pháp ước tính độ tin cậy mới, không chỉ dựa vào suy luận hiện tại mà còn truy xuất các bài học từ những trải nghiệm giải quyết vấn đề trong quá khứ để đánh giá chính xác hơn khả năng thành công của mô hình.


Vì sao đáng đọc: Đây là hướng tiếp cận mới mẻ và thực tiễn trong việc giải quyết bài toán 'ảo tưởng' của AI, giúp các hệ thống tự động hóa đưa ra quyết định tin cậy hơn.

10/09

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Điểm số không chứng minh được khám phá: Giao thức chứng nhận DCP để kiểm định các tác nhân AI nghiên cứu

Giao thức DCP thiết lập quy trình kiểm chứng nghiêm ngặt nhằm xác minh tính xác thực của các kết quả nghiên cứu từ AI, ngăn chặn việc gian lận dữ liệu thông qua các bài kiểm tra phục hồi và phản hồi độc lập.

04/09

Thứ Sáu · 1 tin
Kim@kimmonismus
Nghiên cứuĐiểm AI 53/100

Martian ra mắt bảng xếp hạng độ tin cậy AI: Giảm lỗi định tuyến mô hình tới 54%

A model can look strong on average and still be unpredictable on the same prompt. Martian's new AI …

DịchMartian công bố bảng xếp hạng AI Frontier, đánh giá độ tin cậy qua 16 tiêu chuẩn khắt khe. Kết quả cho thấy Qwen3.7 Max dẫn đầu với 96,1%, vượt qua Claude Opus 4.6 và GPT-5.5.

01/09

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 60/100

Nghiên cứu mới: Thứ hạng LLM trên bảng xếp hạng phụ thuộc lớn vào cách thiết lập đánh giá

LLM rankings can be created by evaluation choices as much as model differences, so one setup should …

DịchMột nghiên cứu cho thấy chỉ cần thay đổi định dạng prompt hoặc cách chấm điểm, điểm số của cùng một mô hình (như Gemma-2-27b) có thể dao động từ 31% đến 89%, làm lung lay tính khách quan của các bảng xếp hạng LLM hiện nay.

31/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Người mù sờ voi: Giải mã sự hạn chế tri thức của LLM đối với các dữ liệu hiếm và gây tranh cãi

Nghiên cứu giới thiệu ElephantBench, bộ dữ liệu gồm 1.094 câu hỏi để kiểm tra khả năng của LLM trong việc ghi nhớ các quan điểm trái chiều về những sự kiện ít phổ biến. Kết quả cho thấy ngay cả các mô hình mạnh nhất cũng thường bỏ sót các luồng thông tin khác nhau, cho thấy lỗ hổng trong tri thức của AI.

29/08

Thứ Bảy · 1 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 35/100

Độ tin cậy của AI tác tử dài hạn vẫn thấp: WeaveBench cho thấy tỷ lệ thành công chỉ đạt 41,2%

Long-horizon agent reliability has not arrived yet with better models. On WeaveBench's 114 hybrid …

DịchDù các mô hình AI ngày càng mạnh, khả năng thực hiện nhiệm vụ dài hạn vẫn hạn chế với tỷ lệ thành công chỉ 41,2% trên WeaveBench. Nghiên cứu chỉ ra rằng độ tin cậy phụ thuộc nhiều vào hệ thống kiểm soát ngoại vi (harness) hơn là bản thân mô hình.

26/08

Thứ Tư · 2 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 47/100

Điểm chuẩn AI không đáng tin: Thay đổi cấu hình nhỏ khiến thứ hạng mô hình đảo lộn

// There Is No Neutral Harness // Great work discussing some of the issues in harness evaluation. …

DịchNghiên cứu chỉ ra rằng chỉ cần thay đổi thứ tự đáp án hoặc cách diễn đạt câu lệnh, điểm số của các mô hình AI có thể dao động cực lớn, khiến bảng xếp hạng hiện nay trở nên thiếu khách quan.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 44/100

Đánh giá AI không hề khách quan: Điểm số một mô hình có thể dao động từ 31% đến 89%

Great paper on agent harnesses.

DịchNghiên cứu mới chỉ ra rằng cách thiết lập bộ khung đánh giá ảnh hưởng cực lớn đến kết quả của AI. Chỉ cần thay đổi thứ tự đáp án hay cách đặt câu hỏi, thứ hạng của các mô hình có thể bị đảo lộn hoàn toàn, cho thấy các bài kiểm tra hiện nay còn nhiều lỗ hổng.

22/08

Thứ Bảy · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 37/100

Nghiên cứu cảnh báo: Dữ liệu khảo sát tổng hợp từ LLM chưa thể thay thế con người

LLMs can reproduce the broad direction of human survey results, but not the actual human response di…

DịchMột nghiên cứu tâm lý học cho thấy LLM chỉ mô phỏng được xu hướng chung chứ không tái hiện chính xác phân phối câu trả lời của con người. Các mô hình huấn luyện bằng dữ liệu AI có hiệu suất dự báo kém, cho thấy LLM chỉ phù hợp cho các khảo sát thử nghiệm chi phí thấp.

19/08

Thứ Tư · 1 tin

16/08

Chủ Nhật · 1 tin
cb_doge@cb_doge
Hướng dẫnĐiểm AI 30/100

Grok 4.6 dẫn đầu bảng xếp hạng độ tin cậy tin tức của RuntimeWire

Grok 4.6 ranks #1 on RuntimeWire's Newsroom Reliability v0.2 benchmark with a score of 0.79, beating…

DịchGrok 4.6 vừa xuất sắc giành vị trí quán quân trong bài kiểm tra Newsroom Reliability v0.2 của RuntimeWire với số điểm 0.79, vượt qua các đối thủ sừng sỏ như GPT-5.6 Sol, Claude Opus 4.8, Gemini và DeepSeek.

Thêm 1 nguồn khác đưa tinX: Elon Musk (@elonmusk, xAI)
Tổng 15 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (21 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Độ tin cậy” | AIHOT.vn