26/09

Thứ Bảy · 1 tin
Hacker News: AI bài nổi bật
Sản phẩmĐiểm AI 66/100

Ra mắt jevmem v0.5: Công cụ tự động lưu trữ bộ nhớ dự án cho Claude Code

jevmem v0.5 giúp Claude Code tự động ghi lại các quyết định, lỗi và việc cần làm vào file JEVMEM.md. Công cụ này giữ lại các kết luận cũ dưới dạng 'superseded' để duy trì ngữ cảnh cho các phiên làm việc sau, đồng thời hỗ trợ cả Cursor và Codex.

25/09

Thứ Sáu · 2 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 58/100

Microsoft giới thiệu CASD: Tối ưu hóa Prompt bằng Coding Agent, cải thiện hiệu suất 16.6 điểm

Banger paper from Microsoft on prompt optimization. (bookmark it) The claim that a coding agent re…

DịchNghiên cứu mới từ Microsoft đề xuất phương pháp CASD, cho phép các Coding Agent tự phân tích nhật ký hoạt động để tìm lỗi và viết lại prompt tối ưu mà không cần truy cập môi trường thực tế.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

Nghiên cứu: Đánh giá khả năng của Coding Agent trong giải quyết các bài toán lập kế hoạch hành động và nhiệm vụ tổng quát

Bài báo trên arXiv nghiên cứu khả năng của các Coding Agent trong việc tự động tạo ra mã nguồn có khả năng khái quát hóa qua nhiều tình huống, nhằm giải quyết các bài toán lập kế hoạch nhiệm vụ và chuyển động (TAMP) phức tạp.

24/09

Thứ Năm · 1 tin
Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 68/100

Đã có đại diệnClaude Opus 5.5 dẫn đầu bảng xếp hạng Coding Agent, nhưng chi phí mỗi tác vụ tăng lên 13,04 USD

Claude Opus 5.5 is the new #1 in the Artificial Analysis Coding Agent Index, with gains across all t…

DịchTheo đánh giá từ Artificial Analysis, Claude Opus 5.5 đã vươn lên vị trí số 1 trên Coding Agent Index với 66 điểm, nhờ hiệu suất vượt trội trong các bài kiểm tra lập trình chuyên sâu, dù đi kèm với mức chi phí vận hành cao hơn đáng kể.

Cùng sự kiện, tinh chọn hiển thị «Anthropic giải mã lý do Claude Opus 5.5 là lựa chọn tối ưu cho lập trình với ngữ cảnh dài»

22/09

Thứ Ba · 1 tin

19/09

Thứ Bảy · 1 tin
Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 41/100

Artificial Analysis cập nhật chỉ số Coding Agent: Bổ sung báo cáo từ chối an toàn

Safety refusal reporting is now available in the Artificial Analysis Coding Agent Index In our late…

DịchArtificial Analysis vừa bổ sung báo cáo từ chối an toàn vào Coding Agent Index v1.5 để làm rõ hành vi của các mô hình. Đáng chú ý, Claude Fable 5.1 ghi nhận tỷ lệ 'fallback' cao nhất trên Claude Code và Devin Fusion, ảnh hưởng trực tiếp đến kết quả đánh giá.

15/09

Thứ Ba · 2 tin
Xiaobei@frxiaobei
Hướng dẫnĐiểm AI 64/100

Anthropic chia sẻ bài học xương máu: Khi Coding Agent làm tăng gấp 8 lần lượng code, hệ thống CI 'gục ngã'

Anthropic tiết lộ thách thức khi áp dụng Coding Agent: khối lượng code tăng gấp 8 lần (80% do Claude viết) khiến số lượng kiểm thử tăng vọt, buộc hệ thống CI phải cải tổ toàn diện sau khi tải trọng tăng 25 lần chỉ trong nửa năm.

karminski@karminski3
Hướng dẫnĐiểm AI 61/100

Trải nghiệm Coding Agent chạy hoàn toàn trên trình duyệt với MiniCPM5-2B

Karminski giới thiệu dự án MiniCPM5-2B-WebGPU-Pi cho phép chạy Coding Agent trực tiếp trên trình duyệt bằng WebGPU. Với mô hình 4bit chỉ dưới 2GB, người dùng có thể sử dụng terminal ảo, trình chỉnh sửa file và gọi công cụ mà không cần cài đặt Docker hay Node.js.

14/09

Thứ Hai · 2 tin
Dex Horthy (HumanLayer)@dexhorthy
NgànhĐiểm AI 15/100

Dex Horthy (HumanLayer) tổ chức buổi gặp mặt cộng đồng AI tại London tối nay

I'm in London tonight - calling all fans of RPI software factories slopcodebench show-me solving…

DịchDex Horthy từ HumanLayer tổ chức buổi giao lưu thân mật tại London dành cho những người quan tâm đến coding agent và các dự án liên quan. Sự kiện không có tài trợ, khách mời tự chi trả đồ uống và có thể liên hệ trực tiếp để biết thêm chi tiết.

12/09

Thứ Bảy · 1 tin
Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 64/100

Đánh giá độc lập Devin Fusion: Cấu hình Fable đạt 62 điểm, Astra tối ưu tốc độ và chi phí

We independently benchmarked Devin Fusion for its release today - this is the first time a multi-mod…

DịchArtificial Analysis vừa công bố kết quả kiểm thử độc lập cho Devin Fusion, trở thành tác nhân lập trình đa mô hình đầu tiên góp mặt trong bảng xếp hạng Coding Agent Index của họ.

09/09

Thứ Tư · 1 tin
IT Home
Hướng dẫnĐiểm AI 51/100

CEO Maimai: Năm tới các công ty công nghệ có thể chỉ tuyển nhân sự AI, Coding Agent sẽ thay thế phần lớn công việc văn phòng

CEO Lâm Phàm dự báo các công ty công nghệ sẽ ưu tiên tuyển dụng nhân sự AI trong năm tới, khi Coding Agent có khả năng đảm nhận hầu hết công việc văn phòng. Hiện nay, nhu cầu tuyển dụng nhân sự AI đang bùng nổ với mức lương cho sinh viên mới tốt nghiệp có thể lên tới hàng triệu nhân dân tệ.

07/09

Thứ Hai · 1 tin

05/09

Thứ Bảy · 1 tin
AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 72/100

Kiến trúc sư OpenAI Codex: Cách tối ưu Coding Agent bằng cách tinh giản AGENTS.md và Skill

Kiến trúc sư OpenAI Codex cảnh báo việc lạm dụng prompt dài và tài liệu cồng kềnh đang làm lãng phí token. Bài viết đề xuất 5 quy tắc tối ưu hóa giúp Coding Agent hoạt động hiệu quả hơn, kèm theo prompt kiểm tra kho lưu trữ và mẫu ủy quyền thực thi.

04/09

Thứ Sáu · 2 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnĐại học Tây Hồ ra mắt Code World Model: Khi mã nguồn định hình sự tiến hóa của thế giới ảo

Nhóm nghiên cứu tại Đại học Tây Hồ giới thiệu Code World Model, mô hình kết hợp Coding Agent để quản lý logic thế giới và mô hình video để hiển thị hình ảnh, giúp thế giới ảo duy trì tính nhất quán và logic dài hạn thay vì chỉ tạo ra các khung hình đơn lẻ.


Vì sao đáng đọc: Đột phá trong cách tiếp cận mô hình thế giới bằng cách tách biệt logic (code) và hình ảnh (video), giải quyết bài toán khó về tính nhất quán trong các môi trường mở.

02/09

Thứ Tư · 2 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 48/100

Harness-of-Harness: Khung phát triển phần mềm tự chủ đa ngày với hiệu suất tăng 52,25%

Meta harnesses are fascinating. Pay attention if you are an AI engineer. A different problem set, bu…

DịchCác nhà nghiên cứu tại Thượng Hải giới thiệu Harness-of-Harness (HoH), khung làm việc cho phép các tác nhân AI tự động lập kế hoạch, viết mã và kiểm thử lặp đi lặp lại để phát triển phần mềm mà không cần sự can thiệp của con người.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 50/100

OpenJiuwen: AI lập trình đột phá với hiệu suất 82.6% trên SWE-bench Verified

How far can you push an agent harness? Great paper providing some insights.

DịchNhóm nghiên cứu từ Huawei giới thiệu openJiuwen, một framework AI lập trình đạt kết quả ấn tượng 82.6% trên SWE-bench Verified và 87.19% trên Terminal-Bench, thiết lập kỷ lục mới vượt xa các tiêu chuẩn hiện tại.

22/08

Thứ Bảy · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 85/100

LoopsBench: Đánh giá thế hệ Coding Agent mới trong các tác vụ lập trình dài hạn

LoopsBench là bộ tiêu chuẩn mới từ Microsoft và ĐH Nam Kinh, tập trung đánh giá khả năng duy trì kế hoạch và quản lý quy trình làm việc phức tạp của các Coding Agent trong các dự án phần mềm dài hạn thay vì chỉ giải quyết các tác vụ đơn lẻ.

Tổng 19 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (31 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Coding Agent” | AIHOT.vn