18/09

Thứ Sáu · 10 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Mô hìnhĐiểm AI 69/100

PrismML ra mắt Ternary Bonsai 2 27B: Nén mô hình gấp 9 lần nhưng vẫn giữ 98,2% hiệu năng

Dựa trên Qwen 27B, Ternary Bonsai 2 sử dụng kỹ thuật trọng số tam phân để giảm dung lượng xuống chỉ còn 5,9GB, giúp tối ưu hóa đáng kể khả năng chạy mô hình lớn trên phần cứng hạn chế.

Thêm 2 nguồn khác đưa tinIT HomeMarkTechPost
TechCrunch: AI
Mô hìnhĐiểm AI 59/100

PrismML ra mắt Bonsai 2 27B: Nén mô hình Qwen 27B xuống còn 5.9GB, chạy mượt trên PC

PrismML vừa trình làng Bonsai 2 27B, phiên bản tối ưu hóa từ Qwen 27B với dung lượng chỉ 5.9GB. Bước tiến này giúp giảm 10 lần bộ nhớ, cho phép chạy các mô hình AI mạnh mẽ ngay trên PC và smartphone cao cấp.

Thêm 2 nguồn khác đưa tinX: Emad Mostaque (@EMostaque)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)

17/09

Thứ Năm · 6 tin
JiQiZhiXin
Sản phẩmĐiểm AI 92/100

Tinh chọnCựu chuyên gia OpenAI ra mắt Jev: Mô hình AI 'câm lặng' giúp tăng tốc xử lý dữ liệu gấp 200 lần

Thay vì tạo văn bản như ChatGPT, mô hình Jev của cựu kỹ sư OpenAI tập trung vào việc đưa ra các quyết định có cấu trúc với tốc độ cực nhanh và chi phí tối ưu, mở ra hướng đi mới cho tự động hóa phần mềm.


Vì sao đáng đọc: Chủ đề thú vị về sự thay đổi tư duy trong phát triển AI, từ tạo nội dung sang tối ưu hóa hiệu suất hệ thống, có tính ứng dụng thực tế cao cho doanh nghiệp.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Fathom: Tối ưu hóa tốc độ giải mã cho KV Cache dung lượng lớn thông qua kỹ thuật đọc chọn lọc

Fathom giới thiệu phương pháp đọc KV cache linh hoạt dựa trên ngân sách bit cho từng truy vấn, giúp tăng tốc độ giải mã lên 1,67 lần ở quy mô 1 triệu token mà vẫn duy trì độ chính xác cao hơn so với các kỹ thuật hiện có.

Tang Jie@jietang
Hướng dẫnĐiểm AI 63/100

Cùng sự kiệnTang Jie: Infra Agent giúp tối ưu hóa hiệu suất suy luận GLM-5.3-Flash gấp 3.2 lần chỉ trong 2 tuần

Two weeks. That's how long it took to go from GLM-5.3-Flash's first run on domestic accelerators to…

DịchGiáo sư Tang Jie chia sẻ cách Infra Agent hỗ trợ triển khai GLM-5.3-Flash trên chip nội địa, giúp tăng lưu lượng xử lý đầu cuối lên 3.2 lần chỉ sau 14 ngày.

Cùng sự kiện, bài đại diện «Zhipu AI tối ưu hóa hạ tầng suy luận cho GLM-5.3, tăng gấp 3 lần lưu lượng xử lý»
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 74/100

Giải mã DeepSeek-V4.1-Flash: Công nghệ nén KV Cache đột phá chỉ với 890 byte mỗi token

Bài viết phân tích kỹ thuật chuyên sâu về DeepSeek-V4.1-Flash, làm rõ cách thức CED và CSA2 tối ưu hóa bộ nhớ KV Cache, đồng thời đánh giá đây là bước nhảy vọt về kiến trúc tương đương thế hệ V5.

karminski@karminski3
Quan điểmĐiểm AI 19/100

Giả thuyết: Mô hình AI có thể thông minh và chính xác hơn khi xử lý đơn lẻ?

Một giả thuyết mới cho rằng khi chạy ở chế độ đơn luồng (concurrency=1), việc sử dụng GEMV thay vì GEMM trong quá trình lượng tử hóa cực hạn có thể giúp giảm thiểu sai số và cải thiện hiệu suất mô hình. Đây hiện chỉ là suy đoán cá nhân và chưa có dữ liệu thực nghiệm kiểm chứng.

16/09

Thứ Tư · 6 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnĐừng để AI Agent 'tự biên tự diễn': Bí quyết cân bằng giữa tư duy nội tại và công cụ ngoại vi

Tổng hợp từ 600 nghiên cứu, bài viết đề xuất khung lý thuyết 'Theory of Agent' giúp tối ưu hóa việc phân bổ năng lực cho AI Agent, tránh tình trạng lạm dụng công cụ hoặc suy diễn sai lệch.


Vì sao đáng đọc: Bài viết mang tính học thuật cao, giải quyết vấn đề thực tế trong phát triển Agent, có giá trị tham khảo lớn cho các kỹ sư và nhà nghiên cứu AI.
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 56/100

Nghiên cứu: Chỉ cần cung cấp công cụ không cần thiết cũng khiến tỷ lệ trả lời của LLM giảm từ 98,2% xuống 63,5%

Giving an assistant extra tools seems harmless. Surprisingly, this paper shows it can make the assi…

DịchMột nghiên cứu mới chỉ ra rằng việc tích hợp các công cụ không cần thiết khiến các mô hình ngôn ngữ lớn (LLM) dễ bỏ qua các câu hỏi đơn giản, dù công cụ không được sử dụng. Việc bổ sung hướng dẫn cụ thể trong system prompt có thể giúp cải thiện đáng kể tỷ lệ phản hồi này.

Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 33/100

Cùng sự kiệnTypeSafe AI ra mắt mô hình quyết định Jev: Tốc độ nhanh gấp 200 lần LLM truyền thống

Another brilliant launch for developers: and its 20-200x faster than LLMs because it skips token-by-…

DịchTypeSafe AI vừa giới thiệu Jev, mô hình AI đột phá bỏ qua cơ chế tạo token tuần tự, giúp tăng tốc độ phản hồi lên gấp 200 lần và giảm chi phí vận hành tới 400 lần so với các LLM hiện nay.

Cùng sự kiện, bài đại diện «Jev ra mắt: Mô hình ra quyết định nhanh gấp 200 lần và rẻ gấp 400 lần LLM»

15/09

Thứ Ba · 1 tin
QbitAI
Nghiên cứuĐiểm AI 88/100

Tinh chọnNghiên cứu mới từ Meta: Chưng cất mô hình Byte giúp phá vỡ giới hạn hiệu năng

Meta vừa công bố phương pháp chưng cất mô hình mới giúp các mô hình Byte vượt qua giới hạn hiệu suất truyền thống, mở ra hướng đi đột phá cho việc tối ưu hóa AI.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong lĩnh vực nén và tối ưu hóa mô hình ngôn ngữ, có tính ứng dụng cao cho cộng đồng nghiên cứu AI.

14/09

Thứ Hai · 1 tin

13/09

Chủ Nhật · 1 tin
JiQiZhiXin
NgànhĐiểm AI 92/100

Tinh chọnKhi nào AI sẽ ngừng 'suy nghĩ quá mức'?

Bài viết phân tích vấn đề LLM tiêu tốn tài nguyên do suy nghĩ quá mức, đồng thời đề xuất các giải pháp tối ưu hóa chi phí và hiệu suất suy luận thông qua cơ chế tự điều chỉnh.


Vì sao đáng đọc: Chủ đề cực kỳ thời sự về tối ưu hóa chi phí vận hành LLM, đánh trúng nỗi đau của doanh nghiệp khi triển khai AI quy mô lớn.

12/09

Thứ Bảy · 3 tin
Emad Mostaque@EMostaque
NgànhĐiểm AI 13/100

Trải nghiệm thực tế Fable 5.1 trong lĩnh vực Toán - Lý

Those using Fable 5.1 for math / physics Does it only give good results in Max / Ultracode or do yo…

DịchNgười dùng thảo luận về hiệu suất của Fable 5.1 khi giải quyết các bài toán vật lý, liệu mô hình chỉ đạt hiệu quả tối ưu ở cấu hình Max/Ultracode hay có thể vận hành tốt ở các thiết lập thấp hơn.

Alibaba Cloud@alibaba_cloud
NgànhĐiểm AI 33/100

Alibaba Cloud hợp tác cùng FireworksAI tối ưu hóa hiệu năng cho mô hình Qwen 3.8 Max

Developers need speed and uncompromising production quality. 🚀 We've partnered with @FireworksAI_HQ…

DịchAlibaba Cloud bắt tay với FireworksAI nhằm tăng tốc độ xử lý và đảm bảo chất lượng sản xuất cho mô hình Qwen 3.8 Max, giúp các nhà phát triển xây dựng ứng dụng nhanh chóng và mở rộng quy mô dễ dàng hơn.

11/09

Thứ Sáu · 5 tin
Elvis Saravia@omarsar0
NgànhĐiểm AI 47/100

Sakana AI ra mắt Fugu Max và Fugu Ultra v2: Đột phá mới trong tối ưu hóa mô hình AI

I am extremely bullish on the Pareto frontier of collective intelligence. While everyone works on …

DịchSakana AI giới thiệu Fugu Max và Fugu Ultra v2, hai giải pháp tối ưu hóa giúp đạt hiệu suất đỉnh cao trong các tác vụ phức tạp với chi phí token cực thấp mà không cần phụ thuộc vào các mô hình ngoại lai.

JiQiZhiXin
Sản phẩmĐiểm AI 88/100

Tinh chọnopenJiuwen ra mắt khung RSI: AI tự tối ưu hóa, nâng tầm hiệu suất cho tác vụ văn phòng

Khung RSI của openJiuwen cho phép các tác nhân AI tự học hỏi và cải tiến quy trình làm việc thông qua phản hồi thực tế, giúp tối ưu hóa cả phương pháp lẫn kết quả đầu ra với chi phí tính toán tối ưu.


Vì sao đáng đọc: Bài viết giới thiệu bước tiến quan trọng trong khả năng tự học của AI Agent, giải quyết bài toán thực tế về hiệu suất và chi phí trong môi trường văn phòng, rất có giá trị với người dùng chuyên nghiệp.
QbitAI
Mô hìnhĐiểm AI 92/100

Tinh chọnĐỉnh cao mã nguồn mở: RunningHub giúp MiniMax H3 tăng tốc gấp 12 lần, chạy mượt ngay trên máy cá nhân

RunningHub tối ưu hóa hiệu suất vượt trội, cho phép tạo video 15 giây chỉ trong 50 giây trên MiniMax H3, giúp việc triển khai cục bộ trở nên cực kỳ nhanh chóng.


Vì sao đáng đọc: Tin tức mang tính đột phá về kỹ thuật tối ưu hóa mô hình AI, giải quyết trực tiếp nỗi đau về tốc độ cho người dùng cá nhân và cộng đồng mã nguồn mở.

10/09

Thứ Năm · 5 tin
Ma Dongxi NLP@dongxi_nlp
NgànhĐiểm AI 36/100

Cùng sự kiệnDeepSeek-V4.1-Flash: Đột phá tối ưu hóa nén KV Cache

DeepSeek-V4.1-Flash giới thiệu kiến trúc Causal Encoder-Decoder mới, cho phép tạo KV Cache toàn cục trực tiếp từ đầu ra của encoder. Cải tiến này giúp lược bỏ việc xử lý prompt qua toàn bộ các lớp decoder, từ đó tối ưu hóa đáng kể tốc độ tiền xử lý (prefill) cho mô hình.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 43/100

Tại sao xử lý video vẫn quá đắt đỏ? Tổng quan về cơ chế tối ưu hiệu năng suy luận cho Video LLM

Bài tổng quan hệ thống hóa các phương pháp tối ưu hóa suy luận cho Video LLM qua bốn giai đoạn: lấy mẫu khung hình, mã hóa đa phương thức, nén token và xử lý LLM, đồng thời chỉ ra những khoảng trống trong tiêu chuẩn đánh giá hiệu năng hiện nay.

Kim@kimmonismus
Mô hìnhĐiểm AI 79/100

Cùng sự kiệnDeepSeek ra mắt V4.1-Flash: Kiến trúc Causal Encoder-Decoder mới với khả năng hiểu thị giác

DeepSeek just released V4.1-Flash with a new architecture, six weeks after its July V4-Flash update….

DịchDeepSeek giới thiệu V4.1-Flash, mô hình MoE 552B tham số tối ưu hóa hiệu suất với kiến trúc mới, giúp giảm đáng kể yêu cầu bộ nhớ KV cache và chi phí API trong khi vẫn hỗ trợ xử lý hình ảnh trực tiếp.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
MarkTechPost
Mô hìnhĐiểm AI 87/100

Tinh chọnDeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh

DeepSeek-V4.1-Flash là mô hình MoE đa phương thức mới với 748B tham số, nổi bật nhờ khả năng xử lý 1 triệu token và giảm dung lượng KV Cache xuống chỉ còn 890 byte mỗi token, tối ưu hiệu suất vượt trội so với các thế hệ trước.

Diễn biến sự kiện · 32 bài →Thêm 27 nguồn khác đưa tinHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: AI Notes (@AYi_AInotes)X: Alibaba Cloud (@alibaba_cloud)X: Ma Dongxi NLP (@dongxi_nlp)Fireworks AI (Web)X: Hongming (@hongming731)Latent SpaceX: SemiAnalysis (@SemiAnalysis_)Baseten Blog kỹ thuật (Web)X: OpenRouter (@OpenRouter)WeChat: Carl AI WattsX: Artificial Analysis (@ArtificialAnlys)X: Yuchen Jin (@Yuchenj_UW)X: Tencent WorkBuddy (@WorkBuddy_AI)The Decoder: AI NewsIT HomeX: Thomas Wolf (Hugging Face đồng sáng lập/CSO) (@Thom_Wolf)X: X.PIN (@thexpin)X: Kim (@kimmonismus)X: Testing Catalog (@testingcatalog)X: Elvis Saravia (@omarsar0, DAIR.AI)X: Aravind Srinivas (Perplexity CEO) (@AravSrinivas)TechNodePandailyX: DeepSeek (@deepseek_ai)X: opencode (@opencode)X: Tianyi Cui (@tianyi)

Vì sao đáng đọc: Đây là bước tiến lớn về kỹ thuật tối ưu hóa bộ nhớ và hiệu suất suy luận cho mô hình ngôn ngữ lớn, thông tin cực kỳ quan trọng với cộng đồng AI.

09/09

Thứ Tư · 3 tin
smol.ai AI News
Mô hìnhĐiểm AI 85/100

DeepSeek ra mắt V4.1-Flash: Mô hình mã nguồn mở tối ưu chi phí với 763 tỷ tham số

DeepSeek vừa trình làng V4.1-Flash, mô hình flagship mới với kiến trúc encoder-decoder đột phá, hỗ trợ cửa sổ ngữ cảnh 1 triệu token và tối ưu hóa mạnh mẽ hiệu suất suy luận ở mức chi phí thấp.

Thêm 1 nguồn khác đưa tinX: Tianyi Cui (@tianyi)
Elvis Saravia@omarsar0
NgànhĐiểm AI 47/100

KVMem: Giải pháp ảo hóa không gian làm việc cho AI Agent với dung lượng triệu token

Nice paper to improve inference efficiency. It's been a while we haven't seen good work on efficien…

DịchKVMem tối ưu hóa bộ nhớ cho AI Agent bằng cách phân trang và lưu trữ trạng thái KV trên GPU, RAM và NVMe. Hệ thống sử dụng cơ chế chỉ mục chú ý để truy xuất thông tin lịch sử liên quan, giúp xử lý ngữ cảnh siêu dài một cách hiệu quả.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
NgànhĐiểm AI 39/100

Chạy mô hình Kimi K3 (2.8T) trên MacBook Pro: Tốc độ 1 token/giây nhờ streaming từ 4 ổ SSD

Dự án ARGODRIVE Deltafin đã tối ưu hóa việc chạy mô hình Kimi K3 (2.8T) nguyên bản trên MacBook Pro M5 Max, đạt tốc độ 1 token/giây bằng cách truyền tải dữ liệu trực tiếp từ 4 ổ SSD, nhanh gấp 3.5 lần so với các phương pháp trước đây.

08/09

Thứ Ba · 4 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Tối ưu hóa khả năng chỉnh sửa tài liệu của LLM: Giải pháp tính toán hiệu quả khi hội thoại

Nghiên cứu này giải quyết thách thức khi LLM phải tự động cập nhật các phần phụ thuộc trong tài liệu khi người dùng yêu cầu chỉnh sửa cục bộ. Nhóm tác giả đề xuất bộ tiêu chuẩn đánh giá mới và các phương pháp tính toán tiết kiệm chi phí để cải thiện độ chính xác khi lan truyền thay đổi.

Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 50/100

Kỹ năng quan trọng hơn bộ nhớ quy trình: Chìa khóa nằm ở việc chắt lọc kinh nghiệm

Agent skills work for a very specific reason: they turn messy past experience into a clean procedure…

DịchNghiên cứu cho thấy việc chắt lọc kinh nghiệm thành các kỹ năng (SKILL.md) giúp AI đạt hiệu suất cao hơn 6,06% so với việc lưu trữ chi tiết quy trình. Thay vì mở rộng bộ nhớ, các tác nhân AI tự cải tiến cần tập trung vào khả năng đúc kết và áp dụng kinh nghiệm hiệu quả hơn.

ModelBest OpenBMB@OpenBMB
Mô hìnhĐiểm AI 55/100

OpenBMB ra mắt MiniCPM5-2B, hỗ trợ triển khai tức thì qua SGLang

Big thanks to @sgl_project for the day-0 support! MiniCPM5-2B is ready to deploy with SGLang today.

DịchOpenBMB vừa giới thiệu MiniCPM5-2B với khả năng triển khai ngay lập tức qua SGLang. Trên card RTX 5090, mô hình đạt tốc độ giải mã ấn tượng hơn 250 tok/s, tối ưu hóa hiệu suất cho các tác vụ lập trình.

07/09

Thứ Hai · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ShallowStream: Tối ưu hóa xử lý video trực tuyến bằng cách phân tầng độ sâu mô hình

ShallowStream là khung làm việc mới giúp giảm chi phí tính toán khi xử lý video trực tuyến bằng cách kết hợp xử lý nông (shallow) cho các khung hình đầu vào và chỉ đi sâu (deep) khi cần thiết, giúp tối ưu hóa bộ nhớ KV cache.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (53 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Tối ưu hóa AI” — Trang 2 | AIHOT.vn