04/09

Thứ Sáu · 18 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 45/100

Google DeepMind giới thiệu Declarative Attention: Tối ưu hóa bộ nhớ KV cache cho mô hình ngôn ngữ

Great weekend read. https://x.com/omarsar0/status/2095612805496164801?s=20

DịchCác nhà nghiên cứu từ KAIST và Google DeepMind đề xuất phương pháp Declarative Attention, cho phép mô hình tự kiểm soát cơ chế chú ý để giảm tải việc đọc KV cache, giúp tăng hiệu suất xử lý.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Sử dụng mô hình ngôn ngữ nhỏ làm giám khảo cho học tăng cường dựa trên tiêu chí

Nghiên cứu đánh giá khả năng thay thế các mô hình lớn bằng các mô hình ngôn ngữ nhỏ (như Qwen3-1.7B) để làm giám khảo chấm điểm trong học tăng cường, giúp giảm chi phí tính toán mà vẫn đảm bảo độ chính xác.

03/09

Thứ Năm · 16 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 71/100

Meta giới thiệu CORAL: Tối ưu hóa hệ thống gợi ý bằng tác nhân LLM tự vận hành

Massive paper from Meta. I like this one because it shows the use of agent harnesses for production…

DịchMeta ra mắt CORAL, một hệ thống tác nhân LLM giúp tự động tinh chỉnh các tham số của hệ thống gợi ý trong môi trường thực tế mà không cần huấn luyện lại, giúp tối ưu hiệu suất liên tục thông qua vòng lặp phản hồi.

Thêm 1 nguồn khác đưa tinX: DAIR.AI (@dair_ai)
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 60/100

Cùng sự kiệnMeta ra mắt CORAL: Khung tác tử AI tối ưu hóa hệ thống gợi ý quy mô lớn

Great paper from Meta. This is a really good example of an agent harness for a production-grade appl…

DịchMeta giới thiệu CORAL, khung tác tử AI giúp tự động tối ưu hóa các hệ thống gợi ý hàng tỷ người dùng thông qua cơ chế vòng lặp khép kín, cho phép cải thiện hiệu suất mà không cần cập nhật tham số mô hình.

Cùng sự kiện, bài đại diện «Meta giới thiệu CORAL: Tối ưu hóa hệ thống gợi ý bằng tác nhân LLM tự vận hành»
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnApple đột phá với IVT: Tư duy thị giác nội tại giúp tăng tốc suy luận video gấp 5 lần

Apple giới thiệu khung huấn luyện IVT, cho phép mô hình học cách dự đoán tương lai thông qua biểu diễn ẩn thay vì phải tạo ảnh trực tiếp, giúp tăng tốc độ suy luận video gấp 5 lần mà vẫn giữ được độ chính xác.


Vì sao đáng đọc: Nghiên cứu quan trọng từ Apple giải quyết bài toán tối ưu hóa suy luận video thời gian thực, có tính ứng dụng cao trong robot và trợ lý ảo.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

Debias-SparseGPT: Phương pháp cắt tỉa mô hình ngôn ngữ lớn giúp giảm thiểu định kiến

Debias-SparseGPT là kỹ thuật cắt tỉa hậu huấn luyện giúp giảm định kiến xã hội trong các mô hình ngôn ngữ lớn mà vẫn duy trì độ chính xác và hiệu suất, ngay cả ở cấu trúc nén 2:4 khắt khe.

Ma Dongxi NLP@dongxi_nlp
Mô hìnhĐiểm AI 56/100

Ra mắt Video Delta Net (VDN): Mô hình tạo video từ văn bản thời gian thực với chất lượng gần như không suy giảm

Video Delta Net (VDN) đạt tốc độ tạo video vượt thời gian thực nhờ cơ chế Hybrid Attention, giúp tăng tốc Minimax-H3 lên tới 90 lần. Dự án đã mã nguồn mở toàn bộ checkpoint và mã nguồn, cho phép tạo video 768p dài 14 giây chỉ trong 11 giây trên 8 GPU B200.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

Declarative Attention: Bước tiến mới giúp mô hình ngôn ngữ tự kiểm soát cơ chế chú ý

Nghiên cứu giới thiệu giao thức Declarative Attention (DA), cho phép mô hình tự chỉ định vùng ngữ cảnh cần tập trung trong quá trình suy luận. Điều này giúp tối ưu hóa hiệu suất bằng cách lược bỏ các thao tác đọc KV cache không cần thiết.

MiniMax@MiniMax_AI
Sản phẩmĐiểm AI 44/100

fal ra mắt MiniMax H3 Max Turbo: Tốc độ gấp đôi, chi phí giảm một nửa

Thank you to our partner @fal for pushing the Pareto tier of MiniMax H3 - delivering 2x the speed at…

Dịchfal vừa giới thiệu bản xem trước của MiniMax H3 Max Turbo với hiệu suất vượt trội: tốc độ nhanh gấp đôi và chi phí chỉ bằng một nửa so với bản gốc, trong khi vẫn duy trì chất lượng hình ảnh hàng đầu.

OpenAI Developers@OpenAIDevs
Hướng dẫnĐiểm AI 23/100

OpenAI giới thiệu GPT-5.6 Sol: Trợ thủ đắc lực cho các chiến dịch marketing phức tạp

GPT-5.6 Sol helps @bryantchou's team at @ployai orchestrate complex marketing campaigns as they expe…

DịchOpenAI chia sẻ cách đội ngũ Ployai ứng dụng GPT-5.6 Sol và các tác nhân phụ (subagents) để tối ưu hóa quy trình, tiết kiệm thời gian và chi phí cho các chiến dịch marketing.

Emad Mostaque@EMostaque
Hướng dẫnĐiểm AI 27/100

Emad Mostaque: Khi AI đã đủ thông minh, tốc độ và chi phí mới là ưu tiên hàng đầu

This is known as satisficing At a certain speed they go faster than our ability to guide them Then…

DịchEmad Mostaque cho rằng khi AI vượt ngưỡng trí tuệ con người, cuộc đua quy mô sẽ nhường chỗ cho tối ưu hóa tốc độ và chi phí, đặt ra câu hỏi về giới hạn cải tiến tiếp theo.

02/09

Thứ Tư · 15 tin
Elvis Saravia@omarsar0
Hướng dẫnĐiểm AI 31/100

Elvis Saravia: Kỹ sư AI nên tự xây dựng 'harness' tối giản để làm chủ kỹ thuật ngữ cảnh

Not all harnesses are created equal. And there is no one-size-fits-all. A good harness should solv…

DịchElvis Saravia khuyên các kỹ sư nên tự xây dựng một bộ khung (harness) tối giản với vòng lặp agent và công cụ để hiểu sâu về cách tối ưu hóa prompt, bộ nhớ đệm và luồng điều khiển trước khi chuyển sang các hệ thống sản xuất phức tạp.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

Nghiên cứu mới: Hợp nhất 200+ ứng dụng nội bộ vào một LLM tự lưu trữ bằng dữ liệu thực tế

Bài báo đề xuất phương pháp hậu huấn luyện dựa trên lưu lượng truy cập thực tế, giúp tối ưu hóa hiệu suất LLM tự lưu trữ trên các tác vụ phức tạp như gọi hàm và tuân thủ chỉ dẫn, đảm bảo bảo mật dữ liệu doanh nghiệp.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 47/100

Nghiên cứu từ Microsoft: Sliding-window vượt trội hơn các biến thể Linear Attention trong suy luận tiết kiệm bộ nhớ

So happy to see this new Microsoft paper. If lower inference memory is the goal, this paper finds t…

DịchNghiên cứu chỉ ra rằng Sliding-window attention (SWA) hiệu quả hơn hầu hết các phương pháp Linear attention khi tối ưu bộ nhớ suy luận, chỉ cần kết hợp cửa sổ nhỏ và 4 token 'sink' đầu tiên.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 36/100

Kỹ sư Baseten giải mã 'Biên hiệu quả' trong suy luận LLM và các kỹ thuật tối ưu hóa

Bài viết phân tích khung 'Biên hiệu quả' của LLM, chia các kỹ thuật tối ưu thành hai nhóm: cân bằng giữa độ trễ và thông lượng, hoặc đẩy xa giới hạn hiệu suất để đạt hiệu quả tổng thể cao hơn.

Alibaba Cloud@alibaba_cloud
Hướng dẫnĐiểm AI 33/100

Hướng dẫn sử dụng OpenTelemetry để theo dõi hiệu suất DeepSeek Harness

Coding agents log what happened, but not where the time and tokens went. Here's how to get real Ope…

DịchAlibaba Cloud chia sẻ cách dùng OpenTelemetry để truy vết chi tiết thời gian và mức tiêu thụ token của các AI agent, giúp tối ưu hóa DeepSeek Harness thông qua Jaeger hoặc Langfuse.

Lauren Tan@poteto
Sản phẩmĐiểm AI 32/100

Dr Eggbot v0.2.0: Tối ưu hóa tự động cho Grok bot với tính năng kiểm tra sức khỏe routine

new in Dr Eggbot (v0.2.0): • eggbot can do a health check on all your routines for unused or expens…

DịchBản cập nhật v0.2.0 của Dr Eggbot bổ sung tính năng kiểm tra sức khỏe routine định kỳ và quét các lỗi giao tiếp trong hội thoại để tự động đề xuất cải thiện cấu hình cho Grok bot.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 51/100

Nghiên cứu mới: Nén quỹ đạo LLM Agent thành máy trạng thái hữu hạn để dự đoán hành động và lỗi

Different LLMs may behave more similarly inside an agent harness than their raw traces suggest. LLM…

DịchMột nghiên cứu mới đề xuất phương pháp nén chuỗi hành động của LLM Agent thành các máy trạng thái hữu hạn (FSM) nhỏ gọn, giúp dự đoán bước tiếp theo và phát hiện sớm các lỗi vận hành.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 45/100

Meta ra mắt mô hình AI dự đoán tiềm năng nghiên cứu, tối ưu hóa tài nguyên thử nghiệm

Super interesting paper from Meta. Long-horizon research agents are coming. But one common problem…

DịchMeta giới thiệu mô hình AI Research Preference Models giúp các tác nhân AI đánh giá và chọn lọc các hướng thử nghiệm hứa hẹn nhất trước khi thực thi, giải quyết bài toán hạn chế về GPU và khả năng tư duy sáng tạo trong nghiên cứu.

Logan Kilpatrick@OfficialLoganK
Sản phẩmĐiểm AI 56/100

Gemini API ra mắt Agentic Video: Xử lý video dài, tiết kiệm tới 88% token

Introducing Agentic Video in the Gemini API, a new way to process long videos which reduces token co…

DịchGoogle vừa giới thiệu tính năng Agentic Video trên Gemini API, giúp tối ưu hóa việc xử lý video dài với hiệu suất cao hơn, giảm tới 88% lượng token tiêu thụ và cải thiện độ chính xác đáng kể.

Google DeepMind@GoogleDeepMind
Sản phẩmĐiểm AI 53/100

Cùng sự kiệnGoogle DeepMind nâng cấp Gemini: Khả năng hiểu video thông minh, tiết kiệm 88% tài nguyên

We're bringing agentic video understanding to our latest Gemini models. They can now analyze videos…

DịchGoogle DeepMind vừa cập nhật khả năng phân tích video cho dòng mô hình Gemini mới, giúp tăng độ chính xác đáng kể trong khi giảm tới 88% lượng token tiêu thụ.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt tính năng hiểu video thông minh cho Gemini»

01/09

Thứ Ba · 15 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 43/100

SkillZip Pro: Giải pháp nén động thông minh cho các Agent Skill

If you build agent skills in production, check out this great paper from Alibaba. You can think of …

DịchNghiên cứu từ Alibaba và ĐH Chiết Giang giới thiệu SkillZip Pro, phương pháp nén dữ liệu cho các thư viện Agent Skill bằng cách loại bỏ các thành phần dư thừa nhưng vẫn đảm bảo khả năng truy cập và thực thi linh hoạt qua 4 chế độ vận hành.

JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnGiải mã bí ẩn 'đỉnh' và 'nền' trong mô hình ngôn ngữ lớn lai: Cách Full Attention định hình lại tính toán

Nghiên cứu từ StartLux và các đại học danh tiếng đã khám phá cách các lớp Full Attention ảnh hưởng đến mô hình lai, xác định hai trạng thái kích hoạt đặc trưng là 'đỉnh trước chú ý' và 'nền giữa các đỉnh', giúp tối ưu hóa hiệu năng cho các kiến trúc LLM thế hệ mới.


Vì sao đáng đọc: Nghiên cứu chuyên sâu về kiến trúc mô hình lai (Hybrid Linear Attention) đang là xu hướng quan trọng để cân bằng hiệu suất và tốc độ, có giá trị cao cho giới kỹ thuật và nghiên cứu AI.
WeChat: Xiaohongshu Tech (dots.llm)
Hướng dẫnĐiểm AI 42/100

Tiểu Hồng Thư hợp tác cùng NVIDIA ra mắt GR-Inference: Tối ưu hóa công cụ suy luận cho Generative Retrieval

Tiểu Hồng Thư và NVIDIA cùng phát triển GR-Inference, công cụ suy luận chuyên dụng giúp tối ưu hóa các tác vụ truy xuất tạo sinh (Generative Retrieval) thông qua các kỹ thuật như xử lý batch liên tục và tối ưu hóa bộ nhớ KV.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (56 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Tối ưu hóa” — Trang 8 | AIHOT.vn