Liquid AI giới thiệu LFM2.5-VL-3B-DSpark, mô hình dự đoán (draft model) giúp tăng tốc giải mã cho LFM2.5-VL-3B lên 3,13 lần trên Apple silicon và 2,66 lần trên NVIDIA H100.
Pruna-Qwen-Image-2.1 a set of a few-step LoRA adapters that make Qwen-Image-2.1 up to 6.3× faster f…
DịchPruna giới thiệu bộ LoRA adapter giúp Qwen-Image-2.1 tạo và chỉnh sửa ảnh chỉ với 5-8 bước thay vì 40 bước, giúp tăng tốc độ xử lý lên tới 6,3 lần mà vẫn đảm bảo chất lượng.
Liquid AI giới thiệu mô hình drafter LFM2.5-VL-DSpark với 280 triệu tham số, giúp tăng tốc độ giải mã trên thiết bị biên lên 3,13 lần và trên GPU lên 2,66 lần mà chỉ tốn thêm 8,9% tài nguyên.
If you've noticed how fast https://claude.ai and the Desktop app have become in the last few weeks, …
DịchĐội ngũ Anthropic đã cải thiện đáng kể tốc độ của claude.ai và ứng dụng Desktop. Kỹ sư Boris Cherny đã công khai quy trình sử dụng chính Claude để đo lường, gỡ lỗi và tối ưu hóa hiệu suất, cung cấp tài liệu tham khảo quý giá cho các nhà phát triển.
(1/6) Open Weight FastVideo FastH3 V2! Up to 9x speedup on @NVIDIA Blackwell. Lossless quality! 🚀 …
DịchFastVideo vừa công bố mã nguồn mở FastH3 V2, cho phép tạo video chất lượng cao với tốc độ nhanh gấp 9 lần trên kiến trúc NVIDIA Blackwell. Công nghệ này đã hỗ trợ ngay lập tức trên ComfyUI và API, hứa hẹn tối ưu hóa hiệu suất vượt trội cho các nhà sáng tạo nội dung.
Unlocking Lossless Speedups in LLMs via Discrete Diffusion paper: https://huggingface.co/papers/260...
DịchNghiên cứu mới giới thiệu phương pháp sử dụng mô hình khuếch tán rời rạc (discrete diffusion) để tăng tốc độ xử lý cho các mô hình ngôn ngữ lớn mà vẫn đảm bảo độ chính xác tuyệt đối.
Mercury 2.5 from @_inception_ai is now generally available on OpenRouter. It's the fastest model on…
DịchMercury 2.5, mô hình ngôn ngữ sử dụng cơ chế khuếch tán để giải mã token song song, hiện đã khả dụng trên OpenRouter. Đây là mô hình nhanh nhất trên nền tảng này mà không yêu cầu phần cứng chuyên dụng, đặc biệt tối ưu cho các tác vụ lập trình.
New video generation acceleration for MiniMax-H3 from the NVIDIA Sol team! Faster than playback, f…
DịchĐội ngũ NVIDIA Sol hợp tác cùng MiniMax giới thiệu giải pháp tăng tốc Sol-H3, cho phép tạo video 5 giây chỉ trong 1,65 giây trên nền tảng Blackwell, nhanh gấp 15,5 lần so với phiên bản gốc.
Mô hình ngôn ngữ khuếch tán (dLLM) đang nổi lên như giải pháp thay thế cho mô hình tự hồi quy truyền thống, cho phép tạo nội dung song song thay vì từng từ, giúp tăng tốc độ xử lý cho AI Agent lên gấp 5 lần trên thiết bị đầu cuối.
Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng giải quyết nút thắt về độ trễ của AI Agent. Thông tin mang tính thời sự cao, có tiềm năng thay đổi cách vận hành của các mô hình ngôn ngữ lớn trong tương lai.
Banger paper from Stanford on efficient test-time scaling. If you run agents that think for a long …
DịchNghiên cứu mới từ Stanford đề xuất phương pháp Prefix Sliding giúp tối ưu bộ nhớ bằng cách lược bỏ các token trung gian trong quá trình suy luận. Kỹ thuật này tăng tốc độ xử lý gấp 3 lần mà không cần huấn luyện lại, hỗ trợ hiệu quả cho các chuỗi suy luận dài trên 100.000 token.
Sky Computing Lab vừa công bố FastH3, mô hình tạo video 15 giây chỉ trong 13 giây, đạt tốc độ nhanh gấp 14 lần so với các giải pháp hiện tại với chất lượng ngang ngửa MiniMax H3.
DFlash 2 giúp tăng tốc mô hình Qwen3.8-27B trên MacBook M5 Max lên 70 tok/s, nhanh gấp 4,6 lần so với giải mã tự hồi quy thông thường mà vẫn đảm bảo độ chính xác tuyệt đối.
DFlash 2 is very cool! Speculative decoding is such a cool technology. I'm waiting for the day we …
DịchDFlash 2 từ Z Lab và Inco AI mang đến công nghệ giải mã suy đoán (speculative decoding) mạnh mẽ, giúp tăng tốc độ xử lý mô hình AI lên gấp 4,6 lần mà vẫn giữ nguyên độ chính xác, đạt 70 tok/s trên MacBook Pro M5 Max.
Thêm 8 nguồn khác đưa tinX: Testing Catalog (@testingcatalog)The Decoder: AI NewsX: Greg Brockman (@gdb)X: Sam Altman (@sama)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)IT HomeJiqizhixinX: Tibo (@thsottiaux)
Tổng 14 tin, không còn tin nào nữa
40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (23 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả