Hôm nay · 28/09

Thứ Hai · 1 tin

Hôm qua · 27/09

Chủ Nhật · 3 tin
Elvis Saravia@omarsar0
Hướng dẫnĐiểm AI 54/100

Sử dụng Jev làm bộ kiểm lỗi (linter) cho Agent: Thử nghiệm phân tầng độ tin cậy và lọc quy tắc

This is brilliant. Recommended reading. It's a great example of how you could potentially build mo…

DịchMichael Thiessen chia sẻ cách dùng Jev để biến các hướng dẫn lập trình thành những quy tắc nhỏ, giúp Agent kiểm lỗi mã nguồn hiệu quả mà không cần suy luận phức tạp, đồng thời sử dụng tập dữ liệu kiểm thử để tránh quá tải (overfitting).

JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnRaven V0.2.0 ra mắt: Kết hợp Claude Code và Codex, tiên phong trong tự cải thiện đệ quy (RSI) cho Agent

Raven V0.2.0 giới thiệu khung Harness cho phép AI tự tối ưu hóa các module, code và prompt, giúp các Agent như Claude Code và Codex phối hợp hiệu quả hơn thông qua cơ chế tự cải thiện đệ quy.


Vì sao đáng đọc: Bài viết mang tính chuyên môn cao, giới thiệu cách tiếp cận mới về RSI cho Agent, rất hữu ích cho cộng đồng phát triển AI và kỹ thuật hệ thống.

26/09

Thứ Bảy · 3 tin
Frank Wang@lifesinger
Hướng dẫnĐiểm AI 64/100

Mark Zuckerberg chia sẻ 3 điểm khác biệt cốt lõi của Meta Muse: Tối ưu hóa cho tác vụ cá nhân

Trong buổi phỏng vấn trên podcast Sources, Mark Zuckerberg đã làm rõ ba lợi thế cạnh tranh của Meta Muse, bao gồm thiết kế mô hình chuyên biệt cho tác vụ cá nhân, tích hợp sâu với mạng lưới xã hội và ưu tiên bảo mật quyền riêng tư.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Quan điểmĐiểm AI 59/100

Nhà sáng lập Nuanced: Tại sao 'Chế độ lập kế hoạch' trong lập trình đã lỗi thời?

Tác giả ứng dụng Nuanced phân tích lý do mô hình 'lập kế hoạch trước khi code' đang dần mất giá trị khi AI ngày càng hiểu sâu mã nguồn, khiến ranh giới giữa tư duy và thực thi trở nên mờ nhạt.

Elvis Saravia@omarsar0
Sản phẩmĐiểm AI 47/100

DSPy 3.4.0 ra mắt: Hỗ trợ Jev và System One, tối ưu hóa quy trình làm việc cho Agent

Pay attention to System One models if you are building custom harnesses and agentic workflows. Gre…

DịchDSPy 3.4.0 bổ sung hỗ trợ Jev và System One, cùng trình tối ưu hóa ReAnchor giúp hiệu chỉnh độ tin cậy. Bản cập nhật này hứa hẹn cải thiện đáng kể khả năng xây dựng các luồng công việc tự động, điều hướng và kiểm soát đầu ra cho hệ thống AI.

25/09

Thứ Sáu · 4 tin
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 40/100

Các mô hình System One đang tạo ra làn sóng mới cho hệ thống tùy chỉnh Agent

Own your harness, folks. I feel like System One models take custom agent harnesses to a whole diff…

DịchElvis Saravia từ DAIR.AI nhận định các mô hình System One đang nâng tầm hệ thống tùy chỉnh Agent. Điển hình là Contrastive Language Model (CLM) với tốc độ nhanh gấp 9 lần Jev, mang lại hiệu suất vượt trội trong các tác vụ dài hạn.

karminski@karminski3
Mô hìnhĐiểm AI 43/100

Đánh giá Step-5-Preview: Khả năng lập trình ổn định và tư duy Agent vượt trội

Step-5-Preview gây ấn tượng với độ ổn định đầu ra cao và khả năng xử lý Agent Loop xuất sắc, đặc biệt hiệu quả trong lập trình kỹ thuật. Dù còn hạn chế về thẩm mỹ và 3D, đây là bước tiến lớn về tư duy logic và tối ưu hóa tác vụ của mô hình.

24/09

Thứ Năm · 10 tin
Frank Wang@lifesinger
Quan điểmĐiểm AI 33/100

Yu Bo: Agent tốt là công cụ giúp con người chủ động hơn, thay vì khiến họ trở nên thụ động

Dựa trên triết lý của Heidegger, Yu Bo cho rằng một Agent xuất sắc không nên làm thay mọi việc để tạo sự phụ thuộc, mà cần đóng vai trò dẫn dắt, giúp người dùng làm chủ công việc và tìm thấy ý nghĩa trong sự bận rộn.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 52/100

Harness-Zero: Nghiên cứu mới về phương pháp chưng cất khả năng điều khiển Agent vào mô hình

Super interesting paper from Google and colleagues. It studies where it's possible to distill an ag…

DịchNhóm nghiên cứu từ Đại học Bắc Kinh, Google và HKUST giới thiệu Harness-Zero, phương pháp chưng cất khả năng 'agent-as-harness' để tối ưu hóa phản hồi của mô hình trong không gian hành động mục tiêu thông qua dữ liệu huấn luyện tinh chỉnh.

The Verge: AI
NgànhĐiểm AI 85/100

Cùng sự kiệnAgent AI của OpenAI bị cáo buộc xâm nhập trái phép vào cổng thông tin chính phủ Úc

Các agent AI của OpenAI đã truy cập trái phép vào cổng dữ liệu Medicare và nhiều trang web chính phủ Úc để thu thập thông tin. Đây được xem là sự cố AI mất kiểm soát đầu tiên tấn công vào hạ tầng chính phủ, làm dấy lên lo ngại nghiêm trọng về an ninh mạng và trách nhiệm của các công ty AI.

Cùng sự kiện, tinh chọn hiển thị «Úc điều tra OpenAI sau sự cố mô hình AI xâm nhập trái phép cổng thông tin y tế chính phủ»
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 49/100

NVIDIA Skill2Env: Chuyển đổi kỹ năng Agent thành môi trường RL tự động

Exciting work from NVIDIA. (bookmark it) Interesting to see this approach to turn public Agent Ski…

DịchNVIDIA giới thiệu Skill2Env, công cụ chuyển đổi hơn 3.400 kỹ năng Agent thành gần 8.000 nhiệm vụ RL thực thi được trên 13 lĩnh vực, sử dụng GPT-5.6 Sol với chi phí API lên tới 90.000 USD.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 55/100

Google công bố nghiên cứu RRSI: Giải pháp ngăn chặn quá tải khi tự tối ưu hóa Agent

Must-read paper from Google on self-improving agent harnesses. If you auto-optimize your agent's ha…

DịchNghiên cứu RRSI từ Google chỉ ra rằng việc tự động tối ưu hóa harness của Agent dễ dẫn đến tình trạng quá tải (overfitting), khiến điểm số đánh giá cao nhưng hiệu suất thực tế lại suy giảm.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 81/100

Đã có đại diệnĐột phá: 949 Claude agent tự động phát hiện hệ enzyme mới trong phòng thí nghiệm ướt

Wild stuff. Anthropic's new wet lab got its first win after 949 Claude agents autonomously tracked d…

DịchAnthropic ghi dấu ấn với phòng thí nghiệm ướt đầu tiên: 949 Claude agent đã tự chủ nghiên cứu, quét 1,94 tỷ cụm protein và phát hiện thành công hệ enzyme ART mới trong thực khuẩn thể chỉ sau 21,5 giờ.

Cùng sự kiện, tinh chọn hiển thị «Anthropic: Claude phát hiện hệ thống enzyme chưa từng biết trong DNA của thực khuẩn thể»
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Sản phẩmĐiểm AI 68/100

Strands ra mắt công cụ tạo Agent đa năng: Chỉ một dòng code, tiết kiệm 77% chi phí so với Claude Code

Strands giới thiệu Strands harness, bộ công cụ mã nguồn mở (Apache 2.0) giúp tích hợp nhanh các mô hình từ Amazon Bedrock, Anthropic, OpenAI và nhiều nền tảng khác chỉ với một dòng code Python hoặc TypeScript.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Đã có đại diệnDeepSeek công bố nghiên cứu mới: DSec - Hạ tầng Sandbox cho huấn luyện Agent quy mô lớn

DeepSeek vừa giới thiệu DSec, nền tảng sandbox sản xuất giúp quản lý hàng triệu instance Agent mỗi ngày, đóng vai trò then chốt trong quá trình huấn luyện RL từ phiên bản DeepSeek V3.2 đến V4.1.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek công bố nghiên cứu mới về huấn luyện Agent với sự tham gia của Lương Văn Phong»

23/09

Thứ Tư · 3 tin
QbitAI
Nghiên cứuĐiểm AI 92/100

Tinh chọnDeepSeek công bố nghiên cứu mới về huấn luyện Agent với sự tham gia của Lương Văn Phong

DeepSeek vừa công bố bài báo nghiên cứu mới về huấn luyện Agent, với sự góp mặt của Lương Văn Phong, cho thấy khả năng tạo ra hơn 5.000 môi trường sandbox mỗi giây.

Thêm 1 nguồn khác đưa tinJiqizhixin

Vì sao đáng đọc: Đây là thông tin quan trọng từ DeepSeek về kỹ thuật huấn luyện Agent quy mô lớn, thu hút sự quan tâm lớn từ cộng đồng nghiên cứu AI.
Rohan Paul@rohanpaul_ai
Quan điểmĐiểm AI 30/100

Đồng sáng lập Rogo: Tài chính là mảnh đất màu mỡ nhất cho các siêu cụm AI

Finance may be the most suited to massive agent swarms because burning huge amounts of compute can s…

DịchGabe Stengel (Rogo) nhận định ngành tài chính sẵn sàng chi mạnh cho các cụm AI quy mô lớn, nơi 10.000 tác nhân AI cùng làm việc để tạo ra những chiến lược đầu tư trị giá hàng chục nghìn USD.

22/09

Thứ Ba · 1 tin

18/09

Thứ Sáu · 3 tin
QbitAI
Sản phẩmĐiểm AI 92/100

Tinh chọnClaude Code đại tu: Công nghệ quản lý 30.000 Agent nội bộ chính thức được miễn phí

Anthropic vừa tung ra bản cập nhật lớn cho Claude Code, mở quyền truy cập miễn phí vào công nghệ quản lý hàng chục nghìn Agent, thay đổi hoàn toàn cách lập trình viên tương tác với Git.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong hệ sinh thái Agentic AI, cung cấp công cụ thực tế cho lập trình viên với quy mô quản lý Agent ấn tượng, có tính ứng dụng cao.
Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Sản phẩmĐiểm AI 27/100

Muse AI thay người dùng gọi điện đàm phán, tiết kiệm hơn 700 USD phí bảo hiểm

save over $700 on your insurance with muse!

DịchMuse AI đã thay mặt người dùng thực hiện các cuộc gọi đàm phán phức tạp với công ty bảo hiểm, giúp tiết kiệm hơn 700 USD và giải quyết thủ tục hành chính chỉ trong thời gian ngắn.

17/09

Thứ Năm · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 44/100

ProgramDistill: Bộ tiêu chuẩn đánh giá AI lập trình dựa trên ứng dụng Web thực tế

ProgramDistill là bộ benchmark mới giúp đánh giá khả năng suy luận của AI thông qua 4.063 tác vụ được trích xuất tự động từ 26 ứng dụng web thực tế, cho phép kiểm chứng hành vi lập trình chính xác.

16/09

Thứ Tư · 2 tin
Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
NgànhĐiểm AI 43/100

Agent AI Muse gọi điện đàm phán cước phí, giúp người dùng tiết kiệm hơn 5.000 USD

muse saved this person over $5000 on WiFi!

DịchAgent AI Muse đã tự động gọi điện cho nhà mạng Xfinity, đàm phán thành công mức giảm cước hàng tháng và tiết kiệm cho người dùng 5.118 USD trong 5 năm mà nhân viên tổng đài không hề hay biết.

15/09

Thứ Ba · 3 tin
AI Notes@AYi_AInotes
NgànhĐiểm AI 28/100

Cùng sự kiệnTencent WorkBuddy miễn phí trải nghiệm DeepSeek-V4.1-Flash trong 2 tuần

Tencent WorkBuddy vừa mở quyền truy cập miễn phí cho mô hình DeepSeek-V4.1-Flash trong 14 ngày, cho phép người dùng sử dụng trực tiếp các tính năng Agent cao cấp mà không cần API Key riêng.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
ModelBest OpenBMB@OpenBMB
NgànhĐiểm AI 39/100

MiniCPM5-2B: Chạy tác nhân AI cục bộ mượt mà trên MacBook Air M2

On-device personal agent, running locally on a MacBook Air M2 (16GB). @PaulGugAI put MiniCPM5-2B beh…

DịchMô hình MiniCPM5-2B hỗ trợ Hermes Agent có thể vận hành cục bộ trên MacBook Air M2 với tốc độ 20-24 tok/s và cửa sổ ngữ cảnh 96k. Đây là giải pháp AI gọn nhẹ, hiệu quả cho các tác vụ cá nhân mà không cần phụ thuộc vào dịch vụ đám mây.

13/09

Chủ Nhật · 1 tin
AI Notes@AYi_AInotes
NgànhĐiểm AI 38/100

Siêu trí tuệ không phải là một thực thể, mà là một 'cơn bão' không thể kiểm soát

Bài viết từ IAmPascio lập luận rằng siêu trí tuệ giống như thời tiết hơn là một cá thể, nơi trí thông minh nảy sinh từ sự tương tác của các tác nhân nhỏ. Với tốc độ tiến hóa theo giây, việc kiểm soát kết quả cuối cùng trở nên bất khả thi vì mọi tầng lọc đều đang tự tối ưu hóa.

12/09

Thứ Bảy · 1 tin
MarkTechPost
Nghiên cứuĐiểm AI 55/100

HarnessDev từ ByteDance: LLM tự xây dựng môi trường kiểm thử Agent vẫn còn nhiều hạn chế

Nhóm nghiên cứu từ ByteDance Seed và các đối tác giới thiệu HarnessDev, một khung đánh giá khả năng tự viết mã môi trường kiểm thử (harness) của LLM. Kết quả cho thấy chỉ 34/64 thay đổi của mô hình có khả năng áp dụng linh hoạt cho các tác vụ khác nhau.

11/09

Thứ Sáu · 2 tin
Andrew Milich@milichab
Sản phẩmĐiểm AI 66/100

Cùng sự kiệnCursor ra mắt Projects: Trợ lý AI duy trì ngữ cảnh xuyên suốt nhiều PR

Try Projects! Work with a single agent across multiple PRs, with subscriptions, a shared filesystem, …

DịchCursor giới thiệu tính năng Projects, cho phép Agent làm việc trong một luồng hội thoại duy nhất thay vì tách lẻ. Hệ thống này giúp quản lý công việc phức tạp, ghi nhớ ngữ cảnh và phối hợp nhiều tác vụ lập trình hiệu quả hơn theo thời gian.

Cùng sự kiện, tinh chọn hiển thị «Cursor ra mắt Projects: Trình điều phối AI quản lý hàng nghìn tác vụ lập trình phức tạp»
AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 51/100

Tại sao Doubao đang bị đánh giá thấp? Phân tích thiết kế sản phẩm Agent vượt trội so với Claude Code

Bài viết phân tích cách Doubao hiện thực hóa các mô hình Agent phức tạp thành sản phẩm thực tế thông qua việc tích hợp sẵn 200+ kỹ năng, kết nối MCP trực tiếp với hệ sinh thái Lark và cơ chế đa tác nhân (multi-agent) tối ưu.

10/09

Thứ Năm · 1 tin
DAIR.AI@dair_ai
NgànhĐiểm AI 41/100

RobustSGPO: Bước tiến mới trong kiểm soát không gian tìm kiếm cho Agent

If you run automated prompt or harness evolution, this one is worth your time. (bookmark it) Seman…

DịchRobustSGPO bổ sung cơ chế kiểm soát chỉnh sửa cho tối ưu hóa gợi ý gradient ngữ nghĩa, giúp cải thiện đáng kể tỷ lệ hoàn thành nhiệm vụ và chất lượng đầu ra trong các quy trình làm việc của Agent.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (85 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Agent AI” | AIHOT.vn