Hacker News: AI bài nổi bật
88

Nghiên cứu

Real-SWE: Ra mắt bộ tiêu chuẩn đánh giá mô hình lập trình trên mã nguồn thực tế của doanh nghiệp

(giờ Việt Nam)

Tóm tắt AI

Nhóm nghiên cứu Specific vừa công bố Real-SWE, bộ tiêu chuẩn sử dụng các kho mã nguồn thực tế từ doanh nghiệp để đánh giá khả năng giải quyết vấn đề của 8 mô hình lập trình hàng đầu hiện nay.

Bản dịch AI

Tháng 9 năm 2026

Giới thiệu Real-SWE

Đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư.

01 Giới thiệu

Hôm nay, chúng tôi ra mắt Real-SWE, một bộ tiêu chuẩn đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư. Mỗi tác vụ đều bắt nguồn từ một cơ sở mã nguồn sản xuất thực tế mà chúng tôi đã cấp phép từ các công ty thực. Đây là những vấn đề mà các kỹ sư của họ đang thực hiện, đi kèm với toàn bộ bối cảnh và sự phức tạp vốn có của một sản phẩm đang vận hành.

Liệu một tác nhân lập trình (coding agent) có thực sự đảm đương được công việc của một kỹ sư phần mềm trong thế giới thực?

Fable 5.1

Claude Code

Tỷ lệ giải quyết: 38,8%

GPT-6 Astra

Codex CLI

Tỷ lệ giải quyết: 33,8%

Gemini 3.8 Flash

Gemini CLI

Tỷ lệ giải quyết: 31,2%

GLM 5.3

Claude Code

Tỷ lệ giải quyết: 28,8%

=5

Grok 4.6

Grok Build

Tỷ lệ giải quyết: 23,8%

=5

Muse Spark 1.3

Muse Code

Tỷ lệ giải quyết: 23,8%

Kimi K3

Kimi Code

Tỷ lệ giải quyết: 18,8%

GPT-5.6 Sol

Codex CLI

Tỷ lệ giải quyết: 16,2%

38,8%

33,8%

31,2%

28,8%

23,8%

23,8%

18,8%

16,2%

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.