Nghiên cứu
Real-SWE: Ra mắt bộ tiêu chuẩn đánh giá mô hình lập trình trên mã nguồn thực tế của doanh nghiệp
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu Specific vừa công bố Real-SWE, bộ tiêu chuẩn sử dụng các kho mã nguồn thực tế từ doanh nghiệp để đánh giá khả năng giải quyết vấn đề của 8 mô hình lập trình hàng đầu hiện nay.
Bản dịch AI
Tháng 9 năm 2026
Giới thiệu Real-SWE
Đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư.
01 Giới thiệu
Hôm nay, chúng tôi ra mắt Real-SWE, một bộ tiêu chuẩn đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư. Mỗi tác vụ đều bắt nguồn từ một cơ sở mã nguồn sản xuất thực tế mà chúng tôi đã cấp phép từ các công ty thực. Đây là những vấn đề mà các kỹ sư của họ đang thực hiện, đi kèm với toàn bộ bối cảnh và sự phức tạp vốn có của một sản phẩm đang vận hành.
Liệu một tác nhân lập trình (coding agent) có thực sự đảm đương được công việc của một kỹ sư phần mềm trong thế giới thực?
Fable 5.1
Claude Code
Tỷ lệ giải quyết: 38,8%
GPT-6 Astra
Codex CLI
Tỷ lệ giải quyết: 33,8%
Gemini 3.8 Flash
Gemini CLI
Tỷ lệ giải quyết: 31,2%
GLM 5.3
Claude Code
Tỷ lệ giải quyết: 28,8%
=5
Grok 4.6
Grok Build
Tỷ lệ giải quyết: 23,8%
=5
Muse Spark 1.3
Muse Code
Tỷ lệ giải quyết: 23,8%
Kimi K3
Kimi Code
Tỷ lệ giải quyết: 18,8%
GPT-5.6 Sol
Codex CLI
Tỷ lệ giải quyết: 16,2%
38,8%
33,8%
31,2%
28,8%
23,8%
23,8%
18,8%
16,2%
Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.