Nhật báo AI ngày 12/08/2026
NVIDIA giới thiệu mô hình mã nguồn mở Nemotron 3.5 Lightning (30B MoE) tối ưu cho AI Agent, giúp tăng tốc độ tạo token gấp 4 lần và giảm 30% thời gian hoàn thành tác vụ trên các thiết bị từ PC đến Jetson.
⚡ HÔM NAY CÓ GÌ HOT? (HIGHLIGHTS)
Phát hành / cập nhật mô hình
NVIDIA ra mắt Nemotron 3.5 Lightning: Tăng tốc độ xử lý cho AI Agent cục bộ
NVIDIA giới thiệu mô hình mã nguồn mở Nemotron 3.5 Lightning (30B MoE) tối ưu cho AI Agent, giúp tăng tốc độ tạo token gấp 4 lần và giảm 30% thời gian hoàn thành tác vụ trên các thiết bị từ PC đến Jetson.
SGLang hỗ trợ tức thì mô hình NVIDIA Nemotron 3.5 Lightning
SGLang vừa cập nhật hỗ trợ Day-0 cho Nemotron 3.5 Lightning, mô hình MoE 30B với cửa sổ ngữ cảnh 1M token, cho phép tối ưu hóa hiệu suất thông qua các kỹ thuật giải mã suy đoán tiên tiến.
Ant Group ra mắt Ling-3.0-tiny: Mô hình MoE siêu nhẹ với 1.3 tỷ tham số kích hoạt
Ant Group vừa mã nguồn mở Ling-3.0-tiny, mô hình hỗn hợp (MoE) với tổng 7.9 tỷ tham số nhưng chỉ kích hoạt 1.3 tỷ khi suy luận, tối ưu hóa hiệu suất cho các tác vụ thực tế.
Sản phẩm / ứng dụng
Runway ra mắt Seedance 2.5: Hỗ trợ 50 nhân vật tham chiếu và video 30 giây đồng bộ nhạc
Seedance 2.5 chính thức có mặt trên Runway, cho phép tạo video dài tới 30 giây khớp với âm nhạc và hỗ trợ tham chiếu đồng thời 50 nhân vật độc đáo.
Google tích hợp Gemini vào Database Migration Service để tăng tốc chuyển đổi sang PostgreSQL
Google Cloud vừa bổ sung tính năng hỗ trợ bởi Gemini vào Database Migration Service, giúp tự động chuyển đổi các thủ tục, trigger và hàm từ Oracle hoặc SQL Server sang PostgreSQL PL/pgSQL.
ZCode nâng cấp toàn diện: Ra mắt 4 tính năng mới gồm Goal, Subagents, Remote Control và Tác vụ nhàn rỗi
ZCode vừa cập nhật 4 tính năng mới giúp tối ưu hóa sâu cho GLM, đạt tỷ lệ vượt qua bài kiểm tra Z.ai Code Bench cao hơn 2,39% so với Claude Code. Với tỷ lệ cache hit trên 98%, người dùng GLM Coding Plan hiện có thể tận dụng hiệu suất làm việc gấp 1,8 lần so với định mức thông thường.
ChatGPT trên máy tính giờ đây đã hỗ trợ nhập dữ liệu từ các AI khác
Người dùng ChatGPT trên máy tính có thể đồng bộ dự án, lịch sử trò chuyện và các kỹ năng từ những nền tảng AI khác vào ChatGPT Work và Codex, đồng thời thiết lập cập nhật tự động dễ dàng.
Databricks mã nguồn mở Metals v2: Trình hỗ trợ ngôn ngữ Java và Scala cho các hệ thống khổng lồ
Databricks vừa ra mắt Metals v2, trình hỗ trợ ngôn ngữ tối ưu cho các kho mã nguồn hàng triệu dòng. Công cụ này được thiết kế để tăng tốc độ điều hướng và chỉnh sửa, hỗ trợ đắc lực cho các kỹ sư trong quy trình phát triển phần mềm do AI điều khiển.
Tín hiệu ngành
Lỗ hổng API nghiêm trọng: Hé lộ quy trình suy luận 'bí mật' của các mô hình AI hàng đầu
Nhóm nghiên cứu phát hiện lỗ hổng API cho phép đọc quy trình suy luận ẩn của OpenAI, Anthropic và Google, đồng thời làm rò rỉ hàng loạt thông tin nhạy cảm như khóa API và mật khẩu từ các phiên hội thoại công khai.
Tin đồn: Anthropic rục rịch IPO vào tháng 9, đặt mục tiêu định giá gần 1 nghìn tỷ USD
Anthropic đang chuẩn bị cho đợt IPO quy mô lớn dự kiến vào tháng 9 hoặc tháng 10, với mức định giá tham vọng lên tới 965 tỷ USD và doanh thu hàng năm vượt 47 tỷ USD.
Gemini cán mốc 1 tỷ người dùng hàng tháng, trở thành sản phẩm tăng trưởng nhanh nhất của Google
Với hơn 1 tỷ người dùng hàng tháng, Gemini chính thức trở thành sản phẩm tăng trưởng nhanh nhất trong lịch sử của Google, đánh dấu cột mốc quan trọng trong hệ sinh thái AI của hãng.
Nvidia phát triển mô hình AI mã nguồn mở Nemotron 4 với 1 nghìn tỷ tham số
Nvidia đang phát triển dòng mô hình AI Nemotron 4 với quy mô lên tới 1 nghìn tỷ tham số nhằm cạnh tranh trực tiếp với các mô hình mã nguồn mở hàng đầu thế giới, dự kiến ra mắt sớm nhất vào cuối mùa thu năm nay.
Vì sao NVIDIA cần kiến trúc cấp nguồn mới để bứt phá sức mạnh tính toán AI?
NVIDIA đề xuất chuyển sang hệ thống điện một chiều 800V để giảm thiểu hao hụt năng lượng, hỗ trợ mở rộng quy mô các trung tâm dữ liệu AI khổng lồ. Hơn 80 đối tác công nghệ đã bắt đầu phát triển phần cứng dựa trên tiêu chuẩn mới này.
Nvidia và chiến lược 'tài chính vòng tròn': Liệu Jensen Huang có đang đi quá giới hạn?
Các chuyên gia tài chính cảnh báo về rủi ro từ chiến lược huy động vốn của Nvidia, trong khi việc ra mắt mô hình Nemotron mã nguồn mở có thể đe dọa trực tiếp đến các đối tác như OpenAI và Anthropic.
Databricks thâu tóm Electric, tích hợp WASM Postgres vào môi trường AI Agent
Databricks chiêu mộ đội ngũ Electric để đưa WASM Postgres vào các sandbox AI, cho phép các tác nhân (agent) vận hành cơ sở dữ liệu cục bộ, đồng bộ thời gian thực và hoạt động ngoại tuyến hiệu quả hơn.
Nghiên cứu / bài báo
Tăng tốc LLM trên máy ảo macOS: Đạt hiệu suất gần như máy thật nhờ tối ưu hóa Metal
Nhóm nghiên cứu đã phát triển lớp tương thích cho Metal trên máy ảo macOS, giúp llama.cpp đạt tốc độ suy luận LLM nhanh gấp 11-16 lần, tiệm cận 98% hiệu năng phần cứng gốc trên chip Apple Silicon.
Unified Radix Cache: Giải pháp cây đơn nhất hóa bộ nhớ đệm cho mô hình hỗn hợp
Đội ngũ LMSYS giới thiệu Unified Radix Cache, sử dụng cấu trúc cây Radix duy nhất để quản lý bộ nhớ đệm cho các kiến trúc mô hình hỗn hợp như FULL, SWA và Mamba, giúp tối ưu hóa hiệu suất truy xuất.
Google giới thiệu AMIE: Hệ thống AI đột phá với khả năng tư vấn y tế qua video thời gian thực
Google Research ra mắt AMIE, hệ thống AI dựa trên Gemini có khả năng thực hiện tư vấn y tế qua video, chẩn đoán và hướng dẫn khám bệnh với độ chính xác đạt chuẩn chuyên gia.
Thủ thuật / thực hành
OpenAI Astra giải mã 10 bài toán hóc búa: Bước ngoặt lịch sử hay nỗi lo cho giới toán học?
OpenAI công bố mô hình Astra đã giải quyết thành công 10 bài toán toán học lâu đời, kèm theo tài liệu nghiên cứu dài 250 trang được xác thực bằng Lean, gây chấn động cộng đồng khoa học.
Xây dựng quy trình tạo video và âm thanh đa phương thức với MiniMax-H3 qua ComfyUI API
Hướng dẫn chi tiết cách sử dụng ComfyUI làm backend để tự động hóa quy trình tạo video từ MiniMax-H3 bằng Python, hỗ trợ linh hoạt các chế độ tạo hình và tối ưu hóa tài nguyên GPU.
Giải mã GitHub Copilot: Những bài học từ việc chặn lưu lượng qua MitM Proxy
Tác giả thực hiện phân tích ngược GitHub Copilot bằng cách chặn lưu lượng qua mitmproxy, từ đó hé lộ cách thức vận hành của các ứng dụng AI dựa trên nền tảng Electron và chia sẻ cách thiết lập proxy hiệu quả.
Lập trình cho AI Agent: Ngôn ngữ nào tối ưu nhất?
Bài viết thực nghiệm bác bỏ quan điểm ngôn ngữ động tiết kiệm token hơn cho AI. Kết quả cho thấy hiệu suất phụ thuộc vào độ phức tạp của tác vụ: ngôn ngữ động thắng ở tác vụ nhỏ, nhưng ngôn ngữ tĩnh lại vượt trội khi giải quyết các vấn đề lớn hơn.
WeChat thử nghiệm AI viết bài và bình luận: Liệu 'chất người' trên mạng xã hội có đang dần biến mất?
WeChat vừa ra mắt tính năng AI hỗ trợ viết và bình luận bài đăng, làm dấy lên lo ngại về việc AI sẽ thay thế sự chân thực trong giao tiếp xã hội và làm thay đổi thói quen tiêu thụ nội dung của người dùng.
Ryan Greenblatt: AI có thể đạt trình độ siêu trí tuệ nhờ tự cải tiến trước năm 2032
Chuyên gia Ryan Greenblatt dự báo AI sẽ tự động hóa nghiên cứu vào năm 2031, dẫn đến sự bùng nổ của siêu trí tuệ thông qua cơ chế tự cải tiến đệ quy, đồng thời cảnh báo về các rủi ro an ninh nghiêm trọng.
Kỷ nguyên AI: Khi các ông lớn SaaS thiết lập mặt bằng định giá mới
Dù định giá ngành SaaS đang chịu áp lực, các doanh nghiệp dẫn đầu về AI như CrowdStrike, Cloudflare và Shopify vẫn đạt mức định giá vượt trội so với thị trường nhờ lợi thế cạnh tranh rõ rệt.
Liệu bạn có thể tin tưởng những gì AI nói?
Video phân tích sâu về vấn đề 'ảo giác' của AI, giúp người dùng hiểu rõ cách kiểm chứng thông tin và sử dụng các mô hình ngôn ngữ một cách an toàn, hiệu quả hơn.