Kỹ thuật triển khai
Vận hành mô hình trong thực tế: Tối ưu hóa suy luận, vRAM và chi phí, hạ tầng Serving (vLLM, Ollama).
2.718 bài thu thập170 tinh chọncập nhật đến 28/09 03:21
- GitHub BlogT5 · 03/09 · 01:29
GitHub Copilot tối ưu chi phí vận hành AI mà không làm giảm chất lượng code
Kỹ sư GitHub chia sẻ 4 chiến lược tối ưu hóa, từ việc nén dữ liệu đầu vào đến tinh chỉnh quy trình xử lý tác vụ, giúp giảm đáng kể chi phí suy luận mà vẫn đảm bảo hiệu suất lập trình.
- Hugging Face Daily PapersT5 · 03/09 · 01:00
Tối ưu hóa chi phí cho AI Agent thông qua cấu trúc dữ liệu thích ứng
Nghiên cứu đề xuất phương pháp cấu trúc hóa dữ liệu linh hoạt giúp AI Agent truy xuất thông tin hiệu quả hơn, giảm chi phí token lên đến 28 lần so với cách xử lý tài liệu thô truyền thống.
- Latent SpaceT4 · 02/09 · 15:00
Claude Fable/Mythos 5.1: Mô hình SOTA mới, giảm 75% phí cache và tăng 70% giới hạn token đầu ra
Anthropic vừa ra mắt bộ đôi mô hình Claude 5.1 với hiệu năng vượt trội, đồng thời tối ưu hóa chi phí vận hành và mở rộng đáng kể dung lượng xử lý token đầu ra cho người dùng.
- Google DeepMind: BlogT4 · 02/09 · 00:30
Google DeepMind ra mắt tính năng hiểu video thông minh cho Gemini
Google DeepMind cập nhật khả năng xử lý video thông minh cho dòng Gemini Flash, giúp mô hình tự động quét các phân đoạn quan trọng. Công nghệ này giúp giảm 88% lượng token, tiết kiệm 66% chi phí và tăng 7% độ chính xác so với phương pháp xử lý khung hình cố định truyền thống.
- IT HomeT3 · 01/09 · 20:29
Reuters: Các trung tâm dữ liệu AI tại Mỹ đang gây ra tình trạng 'nhu cầu điện ảo' tràn lan
Theo Reuters, các yêu cầu cung cấp điện cho trung tâm dữ liệu tại Mỹ đã vượt quá 700 GW, gấp 10 lần nhu cầu thực tế. Nhiều bang đang phải siết chặt quy định vì nghi ngờ đây là các yêu cầu trùng lặp hoặc thiếu khả năng tài chính.
- JiQiZhiXinT3 · 01/09 · 18:00
OpenAI thử nghiệm mô hình thu phí mới: Chỉ tính tiền khi AI hoàn thành công việc
OpenAI đang âm thầm triển khai phương thức thanh toán dựa trên kết quả thực tế thay vì số lượng token, đánh dấu bước chuyển mình quan trọng trong mô hình kinh doanh phần mềm thời đại AI.
- JiQiZhiXinT3 · 01/09 · 18:00
Giải mã bí ẩn 'đỉnh' và 'nền' trong mô hình ngôn ngữ lớn lai: Cách Full Attention định hình lại tính toán
Nghiên cứu từ StartLux và các đại học danh tiếng đã khám phá cách các lớp Full Attention ảnh hưởng đến mô hình lai, xác định hai trạng thái kích hoạt đặc trưng là 'đỉnh trước chú ý' và 'nền giữa các đỉnh', giúp tối ưu hóa hiệu năng cho các kiến trúc LLM thế hệ mới.
- Hugging Face Daily PapersT2 · 31/08 · 13:15
Puro-2B: Đột phá huấn luyện mô hình ngôn ngữ từ đầu với chi phí cực thấp trên RTX 5090
Nhóm nghiên cứu Poor Lab giới thiệu quy trình huấn luyện Puro-2B từ đầu với chi phí dưới 6.900 USD trên GPU RTX 5090, đạt hiệu suất tiệm cận Qwen2.5-1.5B, giúp dân chủ hóa việc huấn luyện AI cho cộng đồng.
- JiQiZhiXinCN · 30/08 · 20:00
Portable Computer: Giải pháp AI chạy cục bộ với Qwen 2.8-27B giúp tối ưu chi phí suy luận
Perplexity giới thiệu Portable Computer, khung làm việc cho phép chạy các mô hình như Qwen 2.8-27B ngay trên thiết bị cá nhân, giúp bảo mật dữ liệu và loại bỏ chi phí API cho các tác vụ AI thông thường.
- JiQiZhiXinCN · 30/08 · 20:00
Khi AI tự thiết kế 'bộ khung nhận thức' cho nhau: Không cần huấn luyện, vẫn giúp mô hình nhỏ mạnh gấp bội
Thay vì tốn kém huấn luyện lại mô hình, các nhà nghiên cứu đang thử nghiệm phương pháp 'Strong-to-Weak Scaffolding', nơi AI mạnh thiết kế quy trình làm việc tối ưu để nâng cấp năng lực cho AI yếu hơn, mở ra kỷ nguyên AI4AI đầy tiềm năng.
- JiQiZhiXinCN · 30/08 · 16:00
Đột phá mới: Mô hình Khám phá Lớn (LDM) giúp AI tự thiết kế thí nghiệm khoa học
Nhóm nghiên cứu từ UCL giới thiệu Large Discovery Models (LDM), kiến trúc kết hợp mô hình nền tảng với quy trình Bayes để tối ưu hóa việc thiết kế thí nghiệm, giúp AI tự động tìm kiếm và đưa ra các quyết định khoa học hiệu quả hơn.
- JiQiZhiXinT7 · 29/08 · 23:45
Recuris: Bước đột phá mới về bộ nhớ cho AI Agent, giúp nâng cấp hiệu suất từ mô hình 3B đến Claude Opus 5
Recuris là kiến trúc AI Agent đầu tiên áp dụng cơ chế tự cải tiến đệ quy vào tầng kiểm soát bộ nhớ, giúp giải quyết vấn đề nhiễu thông tin và tối ưu hóa khả năng thực hiện các tác vụ dài hạn mà không cần đào tạo lại.
- QbitAIT7 · 29/08 · 21:00
Claude tự huấn luyện chính mình: Chi phí chỉ 4 USD/giờ, vượt xa hiệu suất chuyên gia con người
Anthropic đạt bước tiến mới khi để Claude tự tối ưu hóa mô hình với chi phí cực thấp, đánh dấu cột mốc quan trọng trong kỷ nguyên AI tự tiến hóa.
- Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)T7 · 29/08 · 14:26
Trải nghiệm chạy cục bộ Qwen 2.5 27B trên Mac Studio: Hiệu năng thực tế
Đánh giá khả năng vận hành mô hình Qwen 2.5 27B trên Mac Studio M3 Ultra thông qua Ollama. Với định dạng lượng tử hóa Q4_K_M, mô hình đạt tốc độ phản hồi ấn tượng khoảng 14 tokens/giây.
- LMSYS: Blog (nhóm Chatbot Arena)T6 · 28/08 · 00:57
MiniMax-H3 trên 8x H200: Tăng tốc không mất dữ liệu lên tới 1,95 lần
Nhóm SGLang Diffusion thử nghiệm MiniMax-H3 trên 8 GPU NVIDIA H200, đạt tốc độ nhanh gấp 1,95 lần so với Diffusers mà không làm giảm chất lượng hình ảnh.
- IT HomeT5 · 27/08 · 16:25
Lượng gọi Token tại Trung Quốc vượt 500 nghìn tỷ/ngày, khẳng định vị thế dẫn đầu về AI
Tính đến tháng 6/2026, lưu lượng gọi Token tại Trung Quốc đạt mốc 500 nghìn tỷ mỗi ngày, cho thấy sự bùng nổ về nhu cầu tính toán suy luận. Các mô hình nội địa đang chuyển dịch trọng tâm sang phát triển hệ sinh thái và ứng dụng thực tế.
- Zhipu AI: Nghiên cứu (Dữ liệu nhúng trên web)T5 · 27/08 · 14:10
Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp
Zhipu vừa phát hành GLM-5.3-Flash, mô hình đa phương thức đầu tiên trong dòng GLM-5 với hiệu suất ngang ngửa Claude Opus 4.8 nhưng giá thành chỉ bằng 1/40, đồng thời đánh dấu bước tiến lớn khi vận hành trên hạ tầng chip nội địa.
- IT HomeT5 · 27/08 · 07:25
Nvidia dự báo doanh thu 2028 tăng 70%, CEO Jensen Huang khẳng định nhu cầu thực tế vượt xa nguồn cung
Nvidia dự kiến doanh thu năm 2028 tăng 70% và cam kết cung cấp thêm 2 triệu GPU cho AWS. CEO Jensen Huang cho biết tốc độ tăng trưởng hiện bị kìm hãm bởi năng lực sản xuất, trong khi nhu cầu thị trường vẫn đang cực kỳ lớn.
- Tomer Tunguz Blog (phân tích VC)T5 · 27/08 · 07:00
Chiến lược 'Nhà máy AI': Cách Anthropic tối ưu hóa lợi nhuận từ suy luận để tái đầu tư huấn luyện
Anthropic dự kiến chuyển mình từ mức lỗ nặng năm 2024 sang biên lợi nhuận 40-50% vào năm 2026, đạt lợi nhuận quý đầu tiên với doanh thu 10,9 tỷ USD nhờ tối ưu hóa chi phí tính toán trên mỗi megawatt.
- TechCrunch: AIT5 · 27/08 · 06:58
Amazon tăng gấp ba đơn hàng chip Nvidia, bổ sung 2 triệu GPU cho hạ tầng AI
Amazon vừa nâng cấp thỏa thuận với Nvidia để bổ sung 2 triệu GPU thế hệ mới cho AWS vào năm 2028, khẳng định nhu cầu hạ tầng AI đang tăng trưởng vượt kỳ vọng.