01/09

Thứ Ba · 1 tin

31/08

Thứ Hai · 2 tin
Tibo@thsottiaux
Sản phẩmĐiểm AI 24/100

Brent: Người đứng sau bước nhảy vọt về hiệu năng của ứng dụng ChatGPT trên máy tính

Brent is incredible and one of the main forces behind the desktop app polish, performance and reliab…

DịchBrent là nhân tố chủ chốt đứng sau những cải tiến liên tục về độ ổn định và hiệu suất cho ứng dụng ChatGPT trên máy tính, giúp trải nghiệm người dùng mượt mà hơn mỗi ngày.

Tibo@thsottiaux
Sản phẩmĐiểm AI 35/100

Ứng dụng ChatGPT trên máy tính tăng tốc tải hội thoại hơn 90%

Brent is one of the best things that happened to the quality and polish of the desktop app. Relent…

DịchBản cập nhật mới nhất cho ứng dụng ChatGPT trên máy tính đã tối ưu hóa hiệu suất vượt trội, giúp tốc độ tải các hội thoại dài nhanh hơn 90% và giảm đáng kể mức tiêu thụ bộ nhớ.

29/08

Thứ Bảy · 1 tin
SemiAnalysis@SemiAnalysis_
Hướng dẫnĐiểm AI 51/100

NVIDIA GB300 NVL72: Hiệu năng vượt trội gấp 7 lần so với H200

NVIDIA GB300 NVL72 IS 7X BETTER 💰💰 PERF PER DOLLAR 💰💰 THAN H200 on long context agentic workload…

DịchNhờ tối ưu hóa kiến trúc và khả năng tận dụng băng thông từ tấm nền đồng, NVIDIA GB300 NVL72 đạt hiệu suất trên mỗi USD cao gấp 7 lần so với H200 trong các tác vụ AI có ngữ cảnh dài.

28/08

Thứ Sáu · 1 tin

26/08

Thứ Tư · 1 tin
ByteByteGo
Hướng dẫnĐiểm AI 47/100

Tăng tốc LLM gấp 3 lần: Giải mã cơ chế Speculative Decoding

Speculative Decoding giúp tăng tốc độ tạo văn bản gấp 2-3 lần bằng cách dùng mô hình nhỏ dự đoán trước các token, sau đó để mô hình lớn xác thực song song. Phương pháp này tận dụng hiệu quả tài nguyên GPU nhàn rỗi mà vẫn đảm bảo độ chính xác tuyệt đối như mô hình gốc.

25/08

Thứ Ba · 1 tin

24/08

Thứ Hai · 1 tin

22/08

Thứ Bảy · 3 tin
opencode@opencode
Sản phẩmĐiểm AI 23/100

OpenCode khắc phục sự cố suy giảm hiệu năng trên dịch vụ suy luận

we just deployed a fix that was causing a small percentage of requests to our inference service to d…

DịchOpenCode vừa triển khai bản cập nhật nhằm khắc phục tình trạng phản hồi chậm ở một số yêu cầu suy luận, giúp cải thiện tốc độ xử lý cho người dùng.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnBài toán khó của Embedder: Dùng LLM thay thế mô hình nhúng truyền thống có đáng không?

Nghiên cứu so sánh toàn diện cho thấy dù LLM có hiệu suất ngang ngửa mô hình nhúng chuyên dụng, nhưng chi phí vận hành lại đắt gấp 1.400 lần và tốc độ xử lý chậm hơn đáng kể.


Vì sao đáng đọc: Nghiên cứu thực nghiệm giá trị, giải quyết bài toán tối ưu chi phí và hiệu năng thực tế cho kỹ sư AI khi lựa chọn giữa LLM và mô hình nhúng.

21/08

Thứ Sáu · 1 tin
cb_doge@cb_doge
Sản phẩmĐiểm AI 31/100

Grok Build 1.0.8: Cải thiện hiệu năng và bổ sung tính năng mới

SpaceXAI just released a new Grok Build update. Version 1.0.8 is now available. Bug Fixes: • Down…

DịchBản cập nhật Grok Build 1.0.8 khắc phục lỗi tải xuống và xử lý công cụ, đồng thời bổ sung tính năng lưu nháp bằng Ctrl+S, tự động hoàn thiện workflow và tối ưu hóa hiệu suất đa tác nhân.

20/08

Thứ Năm · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Sản phẩmĐiểm AI 36/100

MicroGPT viết bằng C thuần đạt tốc độ 10 triệu token/giây trên Apple M5 Pro

Dự án microGPT-C tối ưu hóa bằng NEON đạt tốc độ suy luận ấn tượng 10,16 triệu token/giây. Với chỉ 4.192 tham số, mô hình này vượt trội hơn các mô hình nội suy truyền thống trong việc dự đoán tên gọi mà không cần phụ thuộc vào thư viện bên ngoài.

19/08

Thứ Tư · 1 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 37/100

Giải mã chi phí AI Agent: Không phải LLM, chính các thành phần phụ mới gây trễ hệ thống

Great paper if you are building production-grade agents. It's a good way to understand what is actu…

DịchNghiên cứu từ DAIR.AI chỉ ra rằng trong các ứng dụng AI Agent thực tế, các thành phần ngoài LLM thường là nguyên nhân chính gây độ trễ. Các giải pháp tối ưu hóa như dịch vụ nhận diện tác vụ và bộ nhớ đệm có thể cải thiện đáng kể hiệu suất và giảm tài nguyên hệ thống.

18/08

Thứ Ba · 3 tin
IT Home
Sản phẩmĐiểm AI 85/100

Báo cáo Signal65: Snapdragon X2 Elite Extreme vượt trội hơn AMD Ryzen AI 9 465 tới 83% trong bài kiểm tra đa nhân

Theo báo cáo từ Signal65, chip Snapdragon X2 Elite Extreme của Qualcomm cho thấy hiệu năng đa nhân vượt xa các đối thủ từ Intel và AMD trong điều kiện sử dụng pin, với tốc độ xử lý nhanh hơn tới 83% so với Ryzen AI 9 465 trong bài kiểm tra GeekBench 7.0.

Boris Cherny@bcherny
Sản phẩmĐiểm AI 30/100

Claude Code CLI tối ưu hiệu năng: Giảm một nửa mức sử dụng CPU ở ngưỡng p99

Small quality of life improvements like this add up. More on the way

DịchBằng cách điều chỉnh cơ chế thu gom rác của Bun để chỉ chạy khi tiến trình rảnh rỗi, Claude Code CLI đã giảm đáng kể mức tiêu thụ CPU ở ngưỡng p99, giúp trải nghiệm người dùng mượt mà hơn.

Claude Devs@ClaudeDevs
Sản phẩmĐiểm AI 42/100

Claude Code CLI tối ưu hóa hiệu năng: Giảm 50% mức sử dụng CPU

Perf win of the day: Claude Code CLI now uses 2x less CPU at p99. Bun's garbage collector was runni…

DịchClaude Code CLI vừa cập nhật cơ chế quản lý bộ nhớ, chuyển việc dọn dẹp rác (GC) sang thời điểm nhàn rỗi thay vì chạy theo lịch trình cố định, giúp giảm một nửa mức tiêu thụ CPU trong các tác vụ nặng.

Thêm 1 nguồn khác đưa tinX: Boris Cherny (@bcherny)

17/08

Thứ Hai · 1 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 31/100

Trải nghiệm thực tế: Tốc độ chạy local Qwen3.8 27B trên RTX 5090

Beautiful visual of somebody running, qwen 3.8 27B locally on a RTX 5090 32 GB VRAM system with 115 …

DịchMột bản demo cho thấy Qwen3.8 27B đạt tốc độ ấn tượng 115 tokens/giây khi chạy local trên RTX 5090 32GB VRAM. Cần lưu ý rằng phiên bản BF16 gốc của mô hình này có dung lượng lên tới 55.6 GB.

15/08

Thứ Bảy · 3 tin
AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 42/100

OpenAI tối ưu hóa giao diện: Tốc độ tải hội thoại tăng gấp 16 lần

OpenAI đã tối ưu hóa việc tải các đoạn hội thoại dài, giảm số lượng yêu cầu mạng và bộ nhớ JS đáng kể, giúp thời gian tải giảm từ 27 giây xuống còn 1,66 giây. Điều này cho thấy OpenAI đang tập trung giải quyết nút thắt hiệu năng từ phía client trong kỷ nguyên AI agent.

Kim@kimmonismus
Sản phẩmĐiểm AI 40/100

Codex sắp cập nhật lớn: Tốc độ tải hội thoại tăng gấp 16 lần

Hype: Codex is rolling out a major performance update next week that should make very long conversat…

DịchCodex chuẩn bị tung bản cập nhật giúp tối ưu hóa đáng kể tốc độ tải các đoạn hội thoại dài, giảm thiểu bộ nhớ và số lượng yêu cầu. Trong thử nghiệm thực tế, thời gian tải trung bình đã rút ngắn ấn tượng từ 27,6 giây xuống còn 1,7 giây.

14/08

Thứ Sáu · 2 tin
cb_doge@cb_doge
Hướng dẫnĐiểm AI 30/100

Cùng sự kiệnGrok 4.6 vượt mặt hàng loạt đối thủ sừng sỏ trên bảng xếp hạng EEBench

Grok 4.6 beats Claude Fable 5, Claude Opus 4.8, Gemini 3.1 Pro, GPT-5.5 and GPT-5.6 Sol on EEBench, …

DịchGrok 4.6 vừa thiết lập cột mốc mới khi đánh bại các mô hình hàng đầu như Claude Fable 5, Gemini 3.1 Pro và GPT-5.6 Sol trong bài kiểm tra kỹ thuật điện EEBench.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 72/100

Cùng sự kiệnGoogle ra mắt Gemini 3.7 Flash: Đỉnh cao mới về tốc độ và hiệu năng

Google has released Gemini 3.7 Flash, improving 4 points over Gemini 3.6 Flash and reaching the Inte…

DịchGoogle vừa trình làng Gemini 3.7 Flash, đạt 56 điểm trên bảng xếp hạng Artificial Analysis. Phiên bản này thiết lập chuẩn mực mới khi cân bằng hoàn hảo giữa sức mạnh trí tuệ và tốc độ phản hồi siêu nhanh.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.7 Flash: Bước tiến đột phá cho lập trình và tác vụ AI Agent»

13/08

Thứ Năm · 2 tin
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 60/100

Artificial Analysis ra mắt Optima: Nền tảng tùy chỉnh đánh giá hiệu năng AI

We're launching Optima. Now anyone can create a custom benchmark for their use case, leveraging Arti…

DịchOptima cho phép người dùng xây dựng bộ tiêu chuẩn đánh giá riêng dựa trên dữ liệu cá nhân hoặc HuggingFace, giúp so sánh chính xác chi phí, tốc độ và hiệu suất giữa các mô hình AI hàng đầu để tối ưu hóa lựa chọn.

Thêm 1 nguồn khác đưa tinThe Decoder: AI News
karminski@karminski3
Hướng dẫnĐiểm AI 16/100

So sánh hiệu năng: Liệu phiên bản 'High' có thực sự ổn định hơn 'Max'?

Người dùng đang kiểm chứng lại các phản hồi trái chiều về độ ổn định giữa hai phiên bản mô hình 'Max' và 'High'. Điểm đáng chú ý là mô hình này có xu hướng đưa ra kết quả ngay lập tức mà không cần suy luận, giống như đã biết trước đáp án.

Tổng 25 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (39 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Hiệu năng” — Trang 2 | AIHOT.vn