Nhật báo AI ngày 05/08/2026
NVIDIA chính thức thương mại hóa Alpamayo 2 Super, mô hình dựa trên Cosmos 3 với khả năng suy luận nhân quả, dự đoán quỹ đạo và hỗ trợ đa nhiệm chuyên sâu cho xe tự hành.
⚡ HÔM NAY CÓ GÌ HOT? (HIGHLIGHTS)
Phát hành / cập nhật mô hình
NVIDIA ra mắt Alpamayo 2 Super: Mô hình mã nguồn mở đột phá cho Robotaxi và xe tự lái
NVIDIA chính thức thương mại hóa Alpamayo 2 Super, mô hình dựa trên Cosmos 3 với khả năng suy luận nhân quả, dự đoán quỹ đạo và hỗ trợ đa nhiệm chuyên sâu cho xe tự hành.
SenseTime ra mắt SenseNova U1: Mô hình mã nguồn mở tích hợp suy luận và tạo ảnh
SenseTime giới thiệu SenseNova U1, mô hình mã nguồn mở cho phép thực hiện đồng thời suy luận và tạo hình ảnh trong một quy trình thống nhất, hỗ trợ tạo slide cấu trúc hoặc nội dung đa phương tiện theo từng bước.
OpenRouter chính thức tích hợp FLUX 3 Video: Mô hình đa phương thức thế hệ mới
FLUX 3 Video từ Black Forest Labs đã có mặt trên OpenRouter, mang đến khả năng xử lý đồng nhất video, âm thanh, hình ảnh và chuyển động trong một kiến trúc duy nhất.
Ant Group ra mắt mã nguồn mở mô hình Ling-3.0-flash
Ant Group vừa công bố mã nguồn mở cho Ling-3.0-flash, cung cấp sẵn các phiên bản BF16 và FP8 để người dùng linh hoạt lựa chọn tùy theo nhu cầu phần cứng và hiệu suất.
Tencent Hunyuan ra mắt Hy ASR 3.0: Mô hình nhận diện giọng nói hiểu ngữ cảnh vượt trội
Tencent giới thiệu Hy ASR 3.0, mô hình nhận diện giọng nói tích hợp LLM và kiến trúc MoE, đạt độ chính xác cao trong nhiều ngôn ngữ. Công nghệ này hỗ trợ sửa lỗi ngữ cảnh, xử lý tiếng ồn tốt và hiện đã có mặt trên Tencent Cloud cũng như ứng dụng Yuanbao.
FLUX 3 Video: Bước tiến mới trong công nghệ tạo video từ Black Forest Labs
Black Forest Labs chính thức giới thiệu FLUX 3 Video, mở ra khả năng tạo video chất lượng cao với độ chân thực ấn tượng, đánh dấu cột mốc quan trọng trong lộ trình phát triển mô hình của hãng.
Sản phẩm / ứng dụng
Swiftlet: Chạy mô hình Qwen 80B trên Mac với 4.3GB RAM và 35B trên iPhone
Swiftlet là runtime tối ưu hóa bằng Swift và Metal, cho phép chạy các mô hình Qwen MoE khổng lồ trên thiết bị Apple bằng cách nạp dữ liệu theo yêu cầu, giúp tiết kiệm đáng kể bộ nhớ RAM.
Reflex ra mắt XY: Thư viện vẽ biểu đồ Python siêu tốc bằng Rust, xử lý mượt mà 100 triệu điểm dữ liệu
Reflex giới thiệu XY, thư viện vẽ biểu đồ 2D tương tác mã nguồn mở sử dụng lõi Rust và WebGL2, cho phép hiển thị và tương tác mượt mà với tập dữ liệu lên tới 100 triệu điểm chỉ trong 0,08 giây.
Mianbi AI ra mắt ForgeStencil: Tự động tối ưu hóa hơn 100 phần mềm công nghiệp mà không cần con người
ForgeStencil là hệ thống AI đầu tiên hỗ trợ nghiên cứu và triển khai Stencil tự động, kết hợp Kernel Agent và App Agent để tối ưu hóa toàn diện từ toán tử đến tích hợp ứng dụng.
Soup v0.72.4: Tối ưu hóa fine-tune mô hình 8B trên GPU laptop chỉ với 4GB VRAM
Phiên bản Soup v0.72.4 cho phép người dùng fine-tune các mô hình 8B thông qua QLoRA ngay trên GPU laptop có 4GB VRAM mà không cần dùng đến cloud hay SSH.
OpenRouter ra mắt ori CLI: Tối ưu hóa cấu hình cho Claude Code và các công cụ lập trình
OpenRouter vừa phát hành ori CLI, giúp người dùng tự động thiết lập cấu hình tối ưu cho các công cụ như Claude Code, Codex mà không cần cài đặt thủ công các biến môi trường phức tạp.
SpecForge v0.3.0 ra mắt: Chuẩn hóa giải mã suy đoán với hỗ trợ mô hình SpecBundle
SpecForge v0.3.0 tách biệt suy luận mô hình mục tiêu và huấn luyện mô hình dự đoán, hỗ trợ đa dạng thuật toán như EAGLE3 và DFlash, giúp tối ưu hóa quy trình làm việc cho các hệ thống suy luận AI.
Replit ra mắt Ambient Intelligence: Thiết kế giao diện không cần câu lệnh
Replit giới thiệu tính năng Ambient Intelligence giúp tự động gợi ý các hướng thiết kế ngay trên màn hình mà không cần người dùng nhập câu lệnh (prompt). Bạn chỉ cần chọn phương án ưng ý để hệ thống tự động tạo ra giao diện mới.
Cloudflare hỗ trợ AI Agent tự động gỡ lỗi Workers ngay trên môi trường local
Cloudflare vừa tích hợp tính năng tự động thu thập OpenTelemetry cho Workers trong môi trường local, cho phép AI Agent truy vấn dữ liệu gỡ lỗi và trực quan hóa các tiến trình mà không cần cấu hình phức tạp.
Tín hiệu ngành
Anthropic ký thỏa thuận tính toán trị giá 10 tỷ USD với startup Volta
Anthropic vừa ký hợp đồng 10 tỷ USD với startup Volta để đảm bảo tốc độ cung ứng hạ tầng tính toán. Dù Volta có mô hình kinh doanh rủi ro khi thuê lại hạ tầng từ các đơn vị khai thác Bitcoin, Anthropic chấp nhận đánh đổi để đẩy nhanh tiến độ phát triển AI.
Trung Quốc ban hành tiêu chuẩn quốc gia bắt buộc đầu tiên về an toàn xe tự lái L3/L4
Bộ Công nghiệp và Công nghệ thông tin Trung Quốc vừa công bố tiêu chuẩn quốc gia bắt buộc về an toàn hệ thống tự lái (GB 44721-2026), chính thức áp dụng từ tháng 7/2027. Đây là cột mốc quan trọng thiết lập khung pháp lý thống nhất cho xe tự lái cấp độ 3 và 4 tại thị trường này.
GPT-5.6 Luna giảm giá 80% vĩnh viễn: Không còn là chiêu trò
Mức giảm giá 80% cho GPT-5.6 Luna không phải là chương trình khuyến mãi tạm thời mà là thay đổi vĩnh viễn, nhờ vào sự cải thiện đáng kể về hiệu suất vận hành.
Cựu thẩm phán Tòa án Tối cao California Tino Cuéllar gia nhập Anthropic với vai trò Giám đốc Đối ngoại
Anthropic bổ nhiệm Tino Cuéllar làm Giám đốc Đối ngoại đầu tiên, chịu trách nhiệm dẫn dắt chiến lược chính sách toàn cầu và quan hệ chính phủ, sau khi ông rời vị trí tại Quỹ Carnegie vì Hòa bình Quốc tế.
OpenAI phản hồi về sự cố đánh giá an ninh mạng và công bố các biện pháp bảo mật mới
OpenAI đã làm rõ sự cố liên quan đến đánh giá an ninh mạng từ bên thứ ba và triển khai các quy trình kiểm soát nghiêm ngặt hơn để đảm bảo tính an toàn, tin cậy khi thử nghiệm các mô hình AI.
Các lãnh đạo AI công bố hướng dẫn SAFE: Tăng cường minh bạch bảo mật cho mạng lưới tác nhân AI
Linux Foundation vừa công bố dự thảo hướng dẫn SAFE, nhằm biến các sự cố bảo mật của tác nhân AI thành dữ liệu chia sẻ chung để củng cố khả năng phòng thủ cho toàn hệ sinh thái.
Google ra mắt bộ ba mô hình Gemini mới và nền tảng robot Gemini Robotics ER 2
Google vừa giới thiệu ba mô hình Gemini mới gồm 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber, tập trung tối ưu hóa hiệu suất, giảm độ trễ cho các tác nhân AI chuyên nghiệp cùng hệ thống robot ER 2.
Thủ thuật / thực hành
Chạy DeepSeek V4 Flash trên một GPU AMD MI300X duy nhất
Một kho lưu trữ mã nguồn mở cho phép vận hành mô hình 304B tham số DeepSeek-V4-Flash trên một GPU MI300X duy nhất mà không cần lượng tử hóa, đạt tốc độ ấn tượng 168.6 tok/s và hỗ trợ ngữ cảnh 256K.
MiniMax-H3: Mô hình tạo video đa phương thức đã có thể chạy trên Apple Silicon nhờ MLX
MiniMax-H3, hệ thống tạo video đa phương thức từ văn bản, hình ảnh và âm thanh, hiện đã được chuyển đổi sang MLX để chạy trực tiếp trên máy Mac. Người dùng có thể tạo video 15 giây ngay trên thiết bị với phần cứng Apple Silicon.
Xây dựng quy trình kiểm định bảo mật AI chuyên sâu với NVIDIA SkillSpector và LangGraph
Hướng dẫn thiết lập quy trình tự động đánh giá độ an toàn của các AI skill, kết hợp công cụ quét mã độc, quy tắc YARA và kiểm soát CI/CD để đảm bảo tính bảo mật cho hệ thống AI.
Cloudflare dùng 'nhà máy phần mềm' AI để xử lý sạch lỗi trên GitHub của Astro
Cloudflare áp dụng quy trình tự động hóa bằng AI Agent để tái hiện, chẩn đoán và sửa lỗi trên kho lưu trữ Astro, giúp giảm số lượng issue từ hơn 200 xuống gần bằng 0 thông qua nền tảng mã nguồn mở Flue.
GitHub hướng dẫn cách chia nhỏ mã nguồn khổng lồ từ AI bằng kỹ thuật Stacked Pull Request
GitHub giới thiệu phương pháp chia nhỏ các thay đổi lớn từ AI thành các tầng (L1-L4) theo logic như dữ liệu, API và UI. Cách tiếp cận này giúp việc kiểm duyệt mã nguồn trở nên dễ dàng và hiệu quả hơn thay vì xử lý hàng nghìn dòng code cùng lúc.
Hướng dẫn đánh giá Voice Agent với LangSmith: Từ hiệu năng đến trải nghiệm người dùng
Bài viết từ LangChain hướng dẫn cách hệ thống hóa việc kiểm thử Voice Agent thông qua LangSmith, tập trung vào ba khía cạnh: thực thi, kết quả và trải nghiệm người gọi bằng các công cụ như LLM judges và đánh giá thủ công.
Hướng dẫn từ A-Z: Tự tay chế tạo thiết bị phần cứng đầu tiên nhờ Codex
Tác giả chia sẻ hành trình 5 ngày tự chế tạo thiết bị nhắc nhở ngồi lâu chỉ bằng cách trò chuyện với Codex, từ thiết kế mạch đến in 3D, khẳng định phương pháp học qua thực hành với AI.
Nghịch lý Jevons trong kỷ nguyên AI: Chiến lược định giá phân tầng và bài toán cung cầu tính toán
Trong khi các ông lớn công nghệ vẫn chật vật với cơn khát chip, chiến lược định giá AI đang phân hóa mạnh mẽ: Anthropic tăng giá gấp đôi cho dòng model cao cấp, trong khi OpenAI lại giảm sâu tới 80% cho các phiên bản mới.