Kỹ thuật triển khai
Vận hành mô hình trong thực tế: Tối ưu hóa suy luận, vRAM và chi phí, hạ tầng Serving (vLLM, Ollama).
2.718 bài thu thập170 tinh chọncập nhật đến 28/09 02:09
- PandailyT2 · 17/08 · 16:15
Đại học Bắc Kinh và StepFun ra mắt TensorCast: Giải pháp tăng tốc phản hồi LLM lên tới 93,2%
TensorCast là lớp quản lý tensor lập trình được giúp tối ưu hóa hạ tầng mô hình lớn, giảm đáng kể thời gian phản hồi token đầu tiên và tăng tốc khởi tạo mô hình trong các tác vụ AI đa nhiệm.
- JiQiZhiXinT2 · 17/08 · 15:00
Đại học Bắc Kinh và StepFun ra mắt TensorCast: Giải pháp quản lý tensor thống nhất, giảm 93.2% độ trễ TTFT
TensorCast là lớp trừu tượng mới giúp quản lý vòng đời tensor (trọng số, KV Cache) một cách thống nhất, giải quyết tình trạng phân mảnh trong hạ tầng LLM hiện nay. Công nghệ này cho phép tối ưu hóa hiệu suất vượt trội, đặc biệt giảm tới 93.2% độ trễ phản hồi đầu tiên (TTFT) cho các tác nhân AI.
- VietnamPlus Công nghệT2 · 17/08 · 14:45
Phố Wall bắt tay Nvidia huy động 500 tỷ USD phát triển hạ tầng AI
Nvidia hợp tác cùng 6 tập đoàn tài chính hàng đầu Phố Wall nhằm thiết lập các quỹ đầu tư quy mô lớn, tập trung xây dựng hạ tầng điện toán phục vụ cơn sốt AI toàn cầu.
- Hugging Face Daily PapersT2 · 17/08 · 09:45
Intern-S2-Mobius: Mô hình nền tảng với kiến trúc tách biệt tri thức và suy luận
Intern-S2-Mobius giới thiệu kiến trúc Mobius-v0, tách biệt bộ nhớ tri thức và bộ suy luận để tối ưu hóa khả năng nén dữ liệu và tăng tốc độ suy luận gấp 4 lần so với các mô hình truyền thống.
- Hugging Face Daily PapersT6 · 14/08 · 10:00
DarwinX: Tiến hóa hệ thống tác nhân AI thông qua chọn lọc tự nhiên
DarwinX tối ưu hóa khả năng của tác nhân AI bằng cách áp dụng cơ chế chọn lọc tự nhiên lên các thành phần như prompt và công cụ, giúp cải thiện hiệu suất mà không cần thay đổi trọng số mô hình.
- Hugging Face Daily PapersT6 · 14/08 · 09:30
Full-bandwidth Transformer: Đột phá mới trong kiến trúc mô hình ngôn ngữ
Full-bandwidth Transformer cải thiện khả năng suy luận bằng cách truyền trạng thái ẩn từ lớp trên cùng trở lại đầu vào, giúp mô hình tận dụng được các tính toán chuyên sâu thay vì chỉ dựa vào token đã tạo.
- OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)T6 · 14/08 · 01:19
Hướng dẫn xây dựng với GPT-5.6: Tối ưu chi phí cho hiệu năng AI Agent vượt trội
Dòng model GPT-5.6 mang đến khả năng suy luận bền bỉ và điều phối đa tác nhân với chi phí thấp hơn đáng kể. Đặc biệt, model Luna đạt hiệu suất ngang ngửa bản 5.5 nhưng giảm chi phí vận hành tới 25 lần.
- Hugging Face Daily PapersT5 · 13/08 · 14:45
Mô hình hóa tác nhân AI 'bình dân': Giả lập xã hội LLM quy mô lớn ngay trên laptop
Nghiên cứu đề xuất phương pháp thay thế các tác nhân LLM phức tạp bằng mô hình tham số thấp, cho phép giả lập xã hội hàng nghìn tác nhân trên máy tính cá nhân mà vẫn đảm bảo độ chính xác về hành vi vĩ mô.
- OpenRouter: AnnouncementsT4 · 12/08 · 22:45
OpenRouter ra mắt chuẩn đánh giá tìm kiếm web thời gian thực cho AI Agent
OpenRouter công bố bảng xếp hạng hiệu suất tìm kiếm, cho thấy việc tăng độ sâu tìm kiếm giúp cải thiện đáng kể kết quả, đồng thời khẳng định chọn đúng mô hình quan trọng hơn công cụ tìm kiếm.
- JiQiZhiXinT4 · 12/08 · 16:45
Libra: Hệ thống tối ưu hóa tài nguyên cho Agentic RL, tăng tốc độ huấn luyện gấp 3 lần
Nhóm nghiên cứu từ CUHK và HSU giới thiệu Libra, hệ thống quản lý tài nguyên đột phá giúp giải quyết tình trạng mất cân bằng tải trong huấn luyện Agentic RL, tăng hiệu suất lên gấp 3 lần so với các phương pháp truyền thống.