21/09

Thứ Hai · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 54/100

FrogNano: Mô hình lập trình 4B đạt 61.5% trên SWE-bench Verified nhờ huấn luyện tổng hợp tác vụ

A 4B coding agent reached 61.5% on SWE-bench Verified without frontier-model distillation by combini…

DịchFrogNano là mô hình AI chuyên biệt cho lập trình với kích thước nhỏ gọn 4 tỷ tham số, gây ấn tượng mạnh khi đạt hiệu suất 61.5% trên bộ kiểm chuẩn SWE-bench Verified thông qua phương pháp huấn luyện tổng hợp tác vụ trực tuyến.

14/09

Thứ Hai · 1 tin

10/09

Thứ Năm · 1 tin

03/09

Thứ Năm · 1 tin

02/09

Thứ Tư · 2 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 57/100

Huawei ra mắt openJiuwen: Công cụ đánh giá AI lập trình đạt kỷ lục 82.6% trên SWE-bench

Nice paper showing just how far you can push an agent harness. In most setups, the default coding a…

DịchHuawei giới thiệu openJiuwen, bộ công cụ đánh giá (harness) mã nguồn mở cho AI lập trình, đạt hiệu suất vượt trội với 82.6% trên SWE-bench Verified và 87.19% trên Terminal-Bench, thiết lập chuẩn mực mới cho khả năng giải quyết vấn đề thực tế của AI.

Thêm 1 nguồn khác đưa tinX: DAIR.AI (@dair_ai)
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 50/100

OpenJiuwen: AI lập trình đột phá với hiệu suất 82.6% trên SWE-bench Verified

How far can you push an agent harness? Great paper providing some insights.

DịchNhóm nghiên cứu từ Huawei giới thiệu openJiuwen, một framework AI lập trình đạt kết quả ấn tượng 82.6% trên SWE-bench Verified và 87.19% trên Terminal-Bench, thiết lập kỷ lục mới vượt xa các tiêu chuẩn hiện tại.

31/08

Thứ Hai · 1 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 57/100

Tối ưu hóa khung làm việc: Bí quyết giúp AI lập trình vượt qua giới hạn ngữ cảnh

Keep the model fixed, change the harness, and coding-agent results can move a lot when context gets …

DịchNghiên cứu cho thấy việc tinh chỉnh khung làm việc thay vì thay đổi mô hình giúp các AI lập trình (như Qwen, Devstral) cải thiện đáng kể hiệu suất khi xử lý ngữ cảnh dài, với tỷ lệ giải quyết tác vụ thực tế tăng vọt trên SWE-bench.

27/08

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

SWE Refactor Bench: Đánh giá khả năng tự động di chuyển mã nguồn toàn hệ thống của AI

Nghiên cứu giới thiệu bộ tiêu chuẩn SWE Refactor Bench nhằm kiểm tra khả năng thực hiện các đợt di chuyển mã nguồn phức tạp của AI, khắc phục tình trạng các mô hình chỉ 'gian lận' để vượt qua bài kiểm tra mà không thực sự thay đổi cấu trúc hệ thống.

26/08

Thứ Tư · 1 tin
Kim@kimmonismus
Nghiên cứuĐiểm AI 37/100

SWE Refactor Bench: Tỷ lệ thành công của AI khi tái cấu trúc toàn bộ mã nguồn chỉ đạt 5,4%

Coding agents can pass tests and still miss the task. In SWE Refactor Bench, 340 of 520 runs comple…

DịchEinsia ra mắt SWE Refactor Bench để kiểm tra khả năng chuyển đổi hệ thống (như C sang Rust) của AI. Kết quả cho thấy AI vẫn gặp khó khăn lớn với các tác vụ tái cấu trúc phức tạp, khi chỉ 5,4% thử nghiệm vượt qua được các tiêu chuẩn đánh giá khắt khe.

25/08

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

SWE-bench Science: Thách thức mới cho AI trong việc giải quyết các lỗi logic khoa học

Coding agents fix the symptom you show them far more often than the defect underneath. Agents are g…

DịchSWE-bench Science cho thấy các AI lập trình hiện nay dù giỏi sửa lỗi kỹ thuật nhưng vẫn yếu trong việc khôi phục logic khoa học cốt lõi. Điểm nghẽn nằm ở khả năng kiểm chứng thực tế thay vì chỉ dựa vào kiến thức lý thuyết.

21/08

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 55/100

SWE-bench Science: Liệu AI lập trình có thể giải quyết các bài toán kỹ thuật trong khoa học?

Nhóm nghiên cứu ra mắt SWE-bench Science, bộ tiêu chuẩn đánh giá khả năng giải quyết 119 tác vụ phần mềm khoa học. Kết quả cho thấy ngay cả mô hình mạnh nhất cũng chưa đạt 50% độ chính xác, đồng thời chỉ ra rằng kiến thức khoa học không phải lúc nào cũng giúp AI tối ưu hóa hiệu suất.

Tổng 11 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (27 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “SWE-bench” | AIHOT.vn