Nghiên cứu
SWE-bench Science: Liệu AI lập trình có thể giải quyết các bài toán kỹ thuật trong khoa học?
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu ra mắt SWE-bench Science, bộ tiêu chuẩn đánh giá khả năng giải quyết 119 tác vụ phần mềm khoa học. Kết quả cho thấy ngay cả mô hình mạnh nhất cũng chưa đạt 50% độ chính xác, đồng thời chỉ ra rằng kiến thức khoa học không phải lúc nào cũng giúp AI tối ưu hóa hiệu suất.
Bản dịch AI
Xem PDF
DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)
Lịch sử gửi bài
Từ: Yuxin Wang [xem email] [v1] Thứ Năm, 20 tháng 8 năm 2026 08:53:15 UTC (837 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (Nổi bậtBài nghiên cứu). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.