Sản phẩm
DeepSeek V4 Flash tự kiểm chứng: Vượt mặt Claude Fable 5 với chi phí rẻ hơn 11 lần
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu Stanford sử dụng DeepSeek V4 Flash để tự đánh giá kết quả, giúp tăng độ chính xác trên Terminal-Bench 2.1 từ 79% lên 88%, vượt qua Claude Fable 5 với chi phí chỉ bằng 1/11. Phương pháp này chứng minh tiềm năng của việc mở rộng quy mô thời gian suy luận (test-time scaling).

Bài viết được AI dịch và tổng hợp tự động từ X: AI Notes (@AYi_AInotes). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.