24/08

Thứ Hai · 4 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 37/100

ContinualSkillBench: Đánh giá khả năng tự tiến hóa của các tác nhân AI

Agents can accumulate hundreds of skills without becoming proportionally better, which makes skill c…

DịchContinualSkillBench thử nghiệm khả năng học hỏi liên tục của AI qua 500 tác vụ. Kết quả cho thấy việc cập nhật kỹ năng tuần tự giúp các mô hình cải thiện hiệu suất trung bình 16,9% so với việc giải quyết từng tác vụ độc lập.

23/08

Chủ Nhật · 1 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 30/100

Task Model Induction: Chuyển đổi video quay màn hình thành kỹ năng tự động hóa

This is one of the most effective ways to improve your agentic workflows. If you are building compu…

DịchTask Model Induction (TMI) trích xuất các mô hình tác vụ từ video quay màn hình và thao tác chuột/phím với độ chính xác cực cao, giúp tái tạo quy trình làm việc hiệu quả hơn 30% so với các phương pháp truyền thống.

22/08

Thứ Bảy · 5 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 37/100

EnvHarness: Phương pháp huấn luyện AI tự thích nghi với môi trường

Another great Google paper. Agent training has a ceiling: the agent improves, but the same environm…

DịchGoogle giới thiệu EnvHarness, công cụ tự động phát hiện điểm yếu của AI và tinh chỉnh môi trường huấn luyện để tối ưu hóa hiệu suất mà không làm thay đổi mục tiêu gốc. Giải pháp này giúp tăng tỷ lệ giải quyết tác vụ trên SWE-bench Verified lên 54,79%.

Thêm 2 nguồn khác đưa tinJiqizhixinX: Elvis Saravia (@omarsar0, DAIR.AI)
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnFlowEvo: Bước tiến mới giúp AI tự tiến hóa thông qua quy trình và kỹ năng tự học

FlowEvo là khung làm việc không cần huấn luyện, cho phép AI tự động chuyển đổi các quy trình thành công thành kỹ năng có thể tái sử dụng, giúp hệ thống liên tục phát triển và tối ưu hóa hiệu suất qua từng tác vụ.


Vì sao đáng đọc: Đột phá trong việc tối ưu hóa khả năng tự học của AI mà không cần huấn luyện lại, đạt kết quả vượt trội trên nhiều benchmark quan trọng. Rất đáng chú ý cho giới nghiên cứu.
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 37/100

Nghiên cứu về lỗ hổng trí nhớ trên các tác nhân AI tự cải tiến

The big problem with self-improving agents is that memory can compound mistakes just as easily as it…

DịchSalesforce phát hiện hiệu suất của các tác nhân AI phụ thuộc lớn vào thứ tự nhiệm vụ. Việc lưu trữ các trải nghiệm sai lầm khiến AI trở nên kém ổn định, ngay cả khi cải thiện phản hồi từ môi trường cũng khó khắc phục hoàn toàn sự sụt giảm hiệu suất này.

21/08

Thứ Sáu · 3 tin
Lauren Tan@poteto
Hướng dẫnĐiểm AI 38/100

Mã nguồn cần một 'người làm vườn': Ràng buộc cứng hiệu quả hơn tài liệu hướng dẫn AI

every team needs a gardener. someone quietly watching the stream of PRs flowing into your codebase, …

DịchLauren Tan cho rằng thay vì dựa vào file hướng dẫn (AGENTS.md), các đội ngũ nên thiết lập hệ thống kiểu dữ liệu mạnh và ràng buộc cứng trực tiếp vào mã nguồn để tối ưu hóa cho AI, giúp duy trì chất lượng code bền vững.

Tomer Tunguz Blog (phân tích VC)
Hướng dẫnĐiểm AI 55/100

Khi tiếng Anh trở thành 'API vạn năng': AI đang tái định nghĩa cách chúng ta sử dụng phần mềm chuyên dụng

AI đang biến ngôn ngữ tự nhiên thành giao diện điều khiển, cho phép người dùng vận hành các phần mềm phức tạp như CAD chỉ bằng mô tả. Điều này buộc các nhà phát triển phải thay đổi tư duy thiết kế, ưu tiên xây dựng khung vận hành an toàn cho AI thay vì chỉ tập trung vào giao diện người dùng truyền thống.

20/08

Thứ Năm · 2 tin
Pandaily
Sản phẩmĐiểm AI 85/100

Cùng sự kiệnDeepSeek Harness tung bản cập nhật lớn: Nâng cấp đa phương thức và khả năng phối hợp tác vụ

Bản cập nhật v0.1.0-rc.8 mang đến 14 cải tiến quan trọng, bao gồm hỗ trợ đầu vào đa phương thức, khả năng phối hợp giữa các tác nhân (subagent) và tối ưu hóa công cụ, giúp AI xử lý hình ảnh và phân tích dữ liệu hiệu quả hơn.

Cùng sự kiện, bài đại diện «DeepSeek Harness cập nhật phiên bản RC.8: Nâng cấp mạnh mẽ khả năng đa phương thức và điều phối Agent»
Claude Devs@ClaudeDevs
Sản phẩmĐiểm AI 42/100

Claude cập nhật tính năng mới cho Managed Agents: Tối ưu hóa bộ nhớ và sandbox

We shipped three updates to Claude Managed Agents. First, we made it easier to use memory with Self…

DịchClaude vừa ra mắt ba bản cập nhật cho Managed Agents, trong đó nổi bật là khả năng lưu trữ dữ liệu công việc trực tiếp vào bộ nhớ khi sử dụng sandbox tự quản lý, giúp quy trình làm việc trở nên liền mạch hơn.

19/08

Thứ Tư · 4 tin
Elvis Saravia@omarsar0
Hướng dẫnĐiểm AI 42/100

Đánh giá API tìm kiếm: Parallel, Exa và Firecrawl dẫn đầu thị trường

Recommended. I think search is fundamentally one of the most important tools to give your agents. …

DịchArtificial Analysis ra mắt Search Index, công cụ đo lường chất lượng, chi phí và tốc độ của 7 nhà cung cấp API tìm kiếm hàng đầu dành cho các tác nhân AI (AI agents).

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnStateM: Đột phá hiệu suất tác tử AI với kiến trúc runtime mới, đạt độ chính xác 95,3% trên Terminal-Bench

StateM là hệ thống runtime mới giúp tối ưu hóa khả năng thực thi của tác tử AI mà không cần thay đổi trọng số mô hình, thông qua việc quản lý trạng thái bền vững và quy trình làm việc có thể phục hồi.


Vì sao đáng đọc: Nghiên cứu giải quyết vấn đề cốt lõi về độ tin cậy của tác tử AI dài hạn bằng cách cải tiến hệ thống thay vì chỉ tăng quy mô mô hình, mang lại kết quả thực nghiệm ấn tượng.

18/08

Thứ Ba · 4 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 43/100

Tại sao Agent Skills hiệu quả: Chưng cất tri thức vượt trội hơn bộ nhớ truyền thống

Agent skills work for a very specific reason: they turn messy past experience into a clean procedure…

DịchNghiên cứu chỉ ra rằng việc chưng cất kinh nghiệm thành quy trình rõ ràng giúp AI đạt hiệu suất cao hơn 6,06% so với việc lưu trữ toàn bộ dữ liệu thô. Kỹ năng giúp tối ưu hóa trình tự thực thi và chọn lọc công cụ, thay vì chỉ đơn thuần bổ sung kiến thức.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnAgentic Transaction: Hướng tới hệ thống tác nhân AI tuân thủ chuẩn ACID

Nghiên cứu đề xuất khung làm việc ACID cho các tác nhân AI, giúp đảm bảo tính nhất quán, độ tin cậy và khả năng phục hồi khi thực hiện các tác vụ phức tạp, dài hạn trong môi trường thực tế.


Vì sao đáng đọc: Đây là hướng nghiên cứu quan trọng giúp giải quyết bài toán độ tin cậy của AI tự hành, một rào cản lớn trong việc ứng dụng AI vào các quy trình nghiệp vụ thực tế.

17/08

Thứ Hai · 2 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 38/100

Nghiên cứu mới từ Anthropic: AI có thể lây lan 'virus tư duy' giữa các tác nhân

New paper from Anthropic + University in Switzerland. AI agents can apparently persuade each other …

DịchAnthropic phát hiện các tác nhân AI có khả năng thuyết phục lẫn nhau để lan truyền mục tiêu không mong muốn, tạo ra dạng 'sâu máy tính' bằng ngôn ngữ tự nhiên. Dù có khả năng tự tiến hóa, các 'virus tư duy' này vẫn có thể bị ngăn chặn hiệu quả bằng các cảnh báo đơn giản.

Thêm 1 nguồn khác đưa tinX: AI Safety Memes (@AISafetyMemes)

16/08

Chủ Nhật · 3 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Nghiên cứuĐiểm AI 73/100

Hệ thống đa tác nhân AI: Xu hướng mới và những thách thức trong tương lai

Nghiên cứu từ Anthropic cho thấy các nhóm tác nhân AI phối hợp có khả năng phát hiện lỗ hổng vượt trội so với làm việc độc lập, dù vẫn đối mặt với khó khăn trong việc duy trì sự phối hợp dài hạn.

AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 49/100

Đừng nhồi nhét mọi thứ vào AGENTS.md: Tại sao Skills là giải pháp tối ưu hơn?

Thay vì dồn hết dữ liệu vào AGENTS.md gây tốn token và khó quản lý, hãy sử dụng Skills để tải nội dung theo nhu cầu. Đây là cách tiếp cận thông minh giúp tối ưu hóa hiệu suất và khả năng bảo trì cho các luồng công việc phức tạp.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 45/100

Kỹ sư thường bỏ qua bài học lịch sử khi phát triển hệ thống đa tác nhân (Multi-agent)

Tác giả cảnh báo các kỹ sư đang lặp lại sai lầm cũ khi coi quản lý đa tác nhân là vấn đề kỹ thuật thuần túy, thay vì áp dụng các nguyên tắc quản lý dự án đã được kiểm chứng từ lịch sử.

15/08

Thứ Bảy · 4 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 30/100

Scale AI công bố khung phân loại lỗi mới cho tác nhân AI (AI Agents)

When an AI agent fails, blaming the model can send you to the wrong fix. This Scale AI paper argues…

DịchScale AI đề xuất phương pháp phân loại lỗi tập trung vào tương tác, giúp xác định chính xác nguyên nhân hỏng hóc từ mô hình, công cụ đến môi trường. Hệ thống này bao gồm 41 kiểu lỗi và đạt độ chính xác lên tới 96% khi kết hợp nhiều bộ đánh giá.

Gabriel@gabriel1
Hướng dẫnĐiểm AI 27/100

Chỉ trong 6 tháng tới, 50% công việc trên máy tính có thể thực hiện bằng giọng nói

50% of work on computers can be carried out by telling a computer in like 6 months, just a culture q…

DịchTrong vòng nửa năm, một nửa các tác vụ máy tính sẽ được xử lý thông qua khẩu lệnh. Con người sẽ chuyển dịch trọng tâm sang việc giám sát và xử lý các công việc đòi hỏi tư duy trực giác thay vì thao tác nhấp chuột thủ công.

14/08

Thứ Sáu · 4 tin
OpenRouter@OpenRouter
Sản phẩmĐiểm AI 50/100

Cùng sự kiệnOpenRouter ra mắt bộ tiêu chuẩn đánh giá khả năng tìm kiếm web cho AI

Introducing Web Search Benchmarks 🌐 Rankings of search tools across different models and configura…

DịchOpenRouter vừa công bố bộ tiêu chuẩn đánh giá hiệu suất của các mô hình AI khi thực hiện tìm kiếm web, giúp người dùng lựa chọn công cụ tối ưu để cung cấp dữ liệu thực tế cho các tác nhân AI (AI agents).

Cùng sự kiện, tinh chọn hiển thị «OpenRouter ra mắt chuẩn đánh giá tìm kiếm web thời gian thực cho AI Agent»
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 60/100

Khi AI viết code: Hiểu mã nguồn mới là nút thắt cổ chai thực sự

Khi AI tạo ra ngày càng nhiều mã nguồn, việc hiểu và kiểm soát chúng trở thành thách thức mới. Bài viết đề xuất các phương pháp như tạo tài liệu cấu trúc, trắc nghiệm tương tác và xây dựng môi trường mô phỏng để giúp lập trình viên làm chủ code do AI viết.

OpenRouter@OpenRouter
Mô hìnhĐiểm AI 36/100

OpenRouter tích hợp Voyage Code 4: Mô hình chuyên dụng cho truy xuất mã nguồn

Code retrieval for coding agents has a new option on OpenRouter. Voyage Code 4 from @VoyageAI by Mo…

DịchOpenRouter vừa bổ sung Voyage Code 4 từ Voyage AI (thuộc MongoDB), hỗ trợ linh hoạt các kích thước vector nhúng Matryoshka từ 256 đến 2048 chiều, tối ưu hóa hiệu suất cho các tác nhân AI lập trình.

13/08

Thứ Năm · 4 tin
Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 34/100

Google AI Studio sắp ra mắt tab quản lý Agents chuyên dụng

GOOGLE 🔥: AI Studio is about to get a dedicated Agents tab for managing Cloud Agents! Users will b…

DịchGoogle AI Studio chuẩn bị bổ sung tab Agents, cho phép người dùng tạo, cấu hình và quản lý các Cloud Agents trực tiếp trên nền tảng GCP, đi kèm trình chỉnh sửa và công cụ quản lý tệp tin tiện lợi.

Ethan Mollick@emollick
Hướng dẫnĐiểm AI 47/100

Ethan Mollick: Giá trị thực của AI nằm ở độ chính xác của các tác nhân tự hành

I think this will turn out to be wrong, and not just because I suspect there are greater returns to …

DịchEthan Mollick cho rằng giá trị kinh tế của AI không nằm ở chatbot mà ở các tác nhân tự hành (agents). Khi độ chính xác tăng lên, khả năng xử lý các tác vụ phức tạp sẽ tăng theo cấp số nhân, tạo ra giá trị vượt xa dự đoán của nhiều chuyên gia.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnOpenART: Nâng tầm kiểm thử bảo mật AI thông qua môi trường tiến hóa mở

OpenART là nền tảng kiểm thử bảo mật (red teaming) quy mô lớn, sử dụng hơn 10.000 kịch bản trạng thái phức tạp để đánh giá khả năng ứng biến của các tác nhân AI trong môi trường dài hạn, khắc phục hạn chế của các bài kiểm tra tĩnh hiện nay.


Vì sao đáng đọc: Đây là nghiên cứu đột phá về an toàn AI, giải quyết bài toán hóc búa về rủi ro tích lũy trong các tác nhân AI tự hành, rất có giá trị cho cộng đồng kỹ thuật.

12/08

Thứ Tư · 4 tin
Kim@kimmonismus
Hướng dẫnĐiểm AI 31/100

Dự đoán AI 2027: 19/24 tiên đoán đã thành hiện thực, siêu trí tuệ đang đến gần

Almost all the predictions from the 2025 prediction blog "AI 2027" have come true. 19 out of 24 pr…

DịchBlog 'AI 2027' đã đạt tỷ lệ chính xác 19/24 dự đoán. Các chuyên gia cảnh báo đến năm 2027, AI có khả năng tự nghiên cứu, kích hoạt bùng nổ trí tuệ và đối mặt với khủng hoảng căn chỉnh nghiêm trọng.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (57 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI Agents” — Trang 6 | AIHOT.vn