Mô hình
Google ra mắt Gemini 3.7 Flash; DeepSeek và Arcee công bố công cụ mã nguồn mở mới
(giờ Việt Nam)
Tóm tắt AI
Google tung ra Gemini 3.7 Flash với hiệu suất lập trình vượt trội và giá ưu đãi. Cùng lúc đó, DeepSeek và Arcee phát hành các bộ công cụ mã nguồn mở nhằm tối ưu hóa quy trình làm việc và tự động hóa tác vụ phức tạp.
Bản dịch AI
Một ngày yên ắng.
Tin tức AI từ 12/8/2026 đến 13/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn đăng ký/hủy đăng ký nhận email theo tần suất mong muốn!
Tổng hợp AI trên Twitter
Ra mắt Gemini 3.7 Flash và ranh giới mới về hiệu năng/giá thành phân khúc tầm trung
Harness, Agent Runtime và tính tự chủ dài hạn
Tốc độ suy luận (Inference), Speculative Decoding và tối ưu hóa cấp Kernel
Benchmark, nền tảng đánh giá (Eval) và những gì chúng thực sự đo lường
Các bản phát hành mô hình và đa phương thức ngoài Gemini
Các tweet hàng đầu (theo mức độ tương tác)
Tổng hợp AI trên Reddit
Tổng hợp từ /r/LocalLlama + /r/localLLM
1. Phát hành mã nguồn mở Qwen 3.8 và suy luận cục bộ (Local Inference)
Qwen3.8-2.4T-A95B đã được phát hành (Hoạt động: 2345): Qwen3.8-2.4T-A95B được công bố/phát hành dưới dạng một mô hình rất lớn theo kiểu sparse/MoE: tên gọi cho thấy tổng số tham số khoảng 2.4T với khoảng 95B tham số hoạt động (active parameters) trên mỗi token. Ở định dạng bf16, việc lưu trữ tất cả trọng số sẽ yêu cầu khoảng 4.8–5 TB bộ nhớ/ổ cứng, khiến việc suy luận cục bộ toàn diện trở nên bất khả thi đối với các phòng lab tại gia thông thường, bất chấp số lượng tham số hoạt động nhỏ hơn nhiều. Các bình luận hàng đầu tập trung vào khả năng triển khai: một người đùa rằng đây "cuối cùng" cũng là một mô hình có thể chạy cục bộ, trong khi những người khác lưu ý rằng 5 TB ở định dạng bf16 vượt quá cả những thiết lập homelab cực đoan nhất; một quan điểm được nhắc lại là chỉ phần 95B tham số hoạt động mới có vẻ khả thi để chạy cục bộ, chứ không phải toàn bộ mô hình.
Qwen 3.8 phát hành trên Hugging Face (Hoạt động: 490): Qwen 3.8 được báo cáo đã phát hành trên Hugging Face, với các bình luận đặc biệt chú ý đến biến thể 27B và lưu ý về cấu hình 95B tham số hoạt động lớn hơn nhiều. Mối quan ngại kỹ thuật chính được nêu ra là khả năng triển khai: ngay cả với kỹ thuật lượng tử hóa mạnh như Q1, một mô hình 95B tham số hoạt động vẫn sẽ không thực tế hoặc cực kỳ chậm trên phần cứng tiêu dùng, trong khi người dùng có GPU như RTX 3090 đang mong chờ bản phát hành 27B nhỏ hơn. Người dùng lạc quan rằng Qwen đã "hứa" và "thực hiện", nhưng có sự hoài nghi rõ ràng rằng mô hình 95B tham số hoạt động có thể sử dụng cục bộ trừ khi trong các thiết lập cực kỳ hạn chế và rất chậm.
Bạn dự định chạy Qwen3.8-2.4T-A95B cục bộ như thế nào? (Hoạt động: 608): Bài đăng đặt câu hỏi liệu và làm thế nào những người đam mê có thể chạy Qwen3.8-2.4T-A95B cục bộ, đặt nó bên cạnh các mục tiêu suy luận cục bộ rất lớn trước đây như Llama-70B, Mistral Large, DeepSeek V2/V3 và Kimi K3. Không có kế hoạch triển khai cụ thể, cấu trúc phần cứng, chiến lược lượng tử hóa hoặc ngăn xếp suy luận nào được cung cấp; ước tính bán kỹ thuật duy nhất trong các bình luận hàng đầu cho thấy thông lượng thấp không thực tế, khoảng 0.003 token/giây cho việc thực thi cục bộ. Các bình luận hàng đầu chủ yếu mang tính bi quan/đùa cợt, ngụ ý rằng việc suy luận cục bộ thực tế sẽ đòi hỏi chi phí đầu tư cực lớn—vào khoảng "$100k"—hoặc lượng bộ nhớ không tưởng thay vì một thiết lập tiêu dùng thực tế.
2. Ra mắt DeepSeek V4 Pro và Agent Harness
DeepSeek: Chúng tôi ra mắt DeepSeek-V4-Pro hôm nay! (Hoạt động: 643): DeepSeek đã công bố DeepSeek-V4-Pro qua X, với các bình luận lưu ý cả bảng giá API mới và việc phát hành trọng số công khai trên Hugging Face: deepseek-ai/DeepSeek-V4-Pro-0813. Điểm kỹ thuật chính cần theo dõi là mô hình này dường như khả dụng cho cả việc sử dụng API được lưu trữ (hosted) và suy luận cục bộ/tự lưu trữ, nhưng cấu trúc chi phí API đã thay đổi đủ để ảnh hưởng đến kinh tế vận hành. Người dùng phản ứng tiêu cực về việc thay đổi giá: một người lập luận rằng mức tăng này loại bỏ lợi thế trước đây của DeepSeek vì các mô hình vốn đã "ngốn token và chậm hơn một chút" nhưng có thể chấp nhận được nhờ chi phí thấp, khiến việc triển khai cục bộ trở nên hấp dẫn hơn.
deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face (Hoạt động: 594): DeepSeek đã xuất bản ngắn gọn deepseek-ai/DeepSeek-V4-Pro-0813 trên Hugging Face, với các bình luận trích dẫn các benchmark mạnh bất thường đối với một mô hình 1.7T tham số so với ví dụ như 2.8T của Kimi; một người nhấn mạnh DeepSWE nhảy vọt từ 12.8 trong bản V4-Pro Preview lên 62.7, được cho là vượt trước GLM-5.2 và Opus-4.8. Kho lưu trữ tạm thời trả về lỗi 404/riêng tư, dường như do vấn đề đóng gói/cấu hình: config.json được cho là đã khai báo 43 lớp ẩn giống như một biến thể "flash", trong khi các tệp trọng số đã tải xuống chứa 61 lớp, cho thấy bản phát hành có thể đã bị gỡ xuống để sửa chữa trước khi xuất hiện trở lại. Người dùng ấn tượng với tốc độ và sự cải thiện benchmark, nhưng một số người kêu gọi thận trọng vì tệp tin ban đầu trên Hugging Face có vẻ không nhất quán nội bộ và có thể cần sửa lỗi.
Deepseek Harness đã sẵn sàng! (Hoạt động: 373): DeepSeek AI đã công bố DeepSeek Harness (dsh), một agent harness mã nguồn mở đang trong giai đoạn xem trước dành cho nhà phát triển, được xây dựng xung quanh kiến trúc "mọi thứ là một plugin" và được hỗ trợ bởi Cordis, tham chiếu thiết kế từ A Programming Paradigm for Spatiotemporal Composability. Dự án này rõ ràng là không ổn định—“SẼ CÓ NHỮNG THAY ĐỔI PHÁ VỠ TÍNH TƯƠNG THÍCH”—và hướng các nhà phát triển đến Discord của DeepSeek Harness; không có benchmark, chi tiết triển khai ngoài mô hình plugin/Cordis, hoặc đảm bảo tính ổn định của API nào được cung cấp. Các bình luận hàng đầu hoài nghi về sự phổ biến nhanh chóng của dự án, với một người dùng cáo buộc các ngôi sao trên GitHub là do bot điều khiển sau khi thấy tăng từ 20k lên 30k sao trong khoảng một giờ. Các phản ứng kỹ thuật khác đặt câu hỏi về xu hướng triển khai bằng TypeScript cho các agent harness và hỏi liệu dsh có thể đạt được tỷ lệ cache hit tốt hơn Reasonix hay không.
3. Tính minh bạch của LLM: Watermarking và rò rỉ dấu vết suy luận (Reasoning-Trace)
Dấu vết suy luận ẩn từ Claude và GPT đã được giải mã, và điều đó thật thú vị (Hoạt động: 447): Một bài báo được trích dẫn, "Stealing Reasoning Traces from Proprietary LLM APIs", tuyên bố một phương pháp rò rỉ phía API có thể khôi phục các token suy luận ẩn từ các mô hình Claude và GPT, với các ví dụ đã xuất bản trong mitkox/stolen-thoughts. Bài đăng làm nổi bật một ví dụ AIME nơi dấu vết Claude được giải mã dường như nhận ra một mục benchmark từ bộ nhớ — "Đây là một bài toán AIME đã biết. Đáp án 60" — làm dấy lên lo ngại về việc nhiễm bẩn benchmark và điểm số toán học bị thổi phồng của các mô hình độc quyền; các bình luận cũng liên kết đến một cuộc thảo luận liên quan trên X/Twitter. Cuộc tranh luận chính là liệu các dấu vết suy luận của các mô hình tiên phong có tiết lộ bất kỳ "bí quyết" thuật toán ẩn nào không: người đăng lập luận rằng chúng chủ yếu cho thấy các hiện vật thông thường như ghi nhớ, các token trung gian không mạch lạc và suy nghĩ quá mức, ngụ ý rằng các mô hình mã nguồn mở có thể gần hơn so với khoảng cách benchmark gợi ý. Cũng có lo ngại suy đoán rằng việc rò rỉ như vậy có thể đã cho phép chưng cất (distillation) quy mô lớn các mô hình độc quyền và việc đóng lỗ hổng này có thể làm chậm các nỗ lực chưng cất trong tương lai.
Anthropic, OpenAI, Google, Meta, Microsoft và Mistral đều đã ký Bộ quy tắc thực hành của EU về tính minh bạch của nội dung do AI tạo ra (Hoạt động: 949): Hình ảnh là ảnh chụp màn hình một bài đăng trên X tuyên bố Anthropic, OpenAI, Google, Meta, Microsoft và Mistral đã ký Bộ quy tắc thực hành của EU về tính minh bạch đối với nội dung do AI tạo ra, với văn bản hỗ trợ của OpenAI nói rằng họ muốn mở rộng các tín hiệu nguồn gốc (provenance signals) cho tất cả các phương thức, bao gồm cả văn bản. Bài đăng trên Reddit diễn giải điều này như là việc đánh dấu chìm (watermarking) vô hình trong tương lai đối với mã và văn bản được tạo ra, bao gồm cả các mô hình cục bộ/mã nguồn mở từ các nhà cung cấp đó, mặc dù bản thân hình ảnh không phải là một thông số kỹ thuật hoặc bằng chứng triển khai. Các bình luận chủ yếu tập trung vào các cách vượt qua thực tế và rủi ro quy trình làm việc: một người lập luận rằng watermarking có thể được học từ ~10 triệu token được tạo ra và loại bỏ bởi một mô hình 1.5B đối nghịch nhỏ hoặc tiện ích mở rộng trình duyệt, trong khi những người khác lo ngại nó có thể đẩy người dùng về phía các mô hình không ký kết/mô hình Trung Quốc hoặc can thiệp vào việc tạo mã và trình biên dịch của agent.
Tổng hợp các Subreddit AI ít kỹ thuật hơn
/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo
1. Cơ chế mô hình đa phương thức SL2T và H3
DeepMind vừa phát hành SL2T, mô hình ngôn ngữ ký hiệu sang văn bản, người khiếm thính giờ đây có thể ký hiệu vào điện thoại thay vì gõ phím, được phát triển với sự đóng góp lớn từ cộng đồng người khiếm thính (Hoạt động: 3468): DeepMind được cho là đã phát hành SL2T, một hệ thống ngôn ngữ ký hiệu sang văn bản chuyển đổi đồng thời các chuyển động tay, cơ thể và khuôn mặt thành văn bản tiếng Anh trong thời gian thực, cho phép người khiếm thính ký hiệu vào điện thoại thay vì gõ phím; chi tiết có trong bài đăng trên blog của DeepMind. Bài đăng cho biết việc theo dõi tư thế chạy trên thiết bị để đảm bảo quyền riêng tư trong khi việc dịch được thực hiện ở phía máy chủ, hỗ trợ các tình huống thực tế như ký hiệu bằng một tay khi cầm điện thoại, và được tuyên bố là "tiên tiến nhất trên các benchmark học thuật" mặc dù không có con số benchmark nào được cung cấp trong bản tóm tắt trên Reddit. Các bình luận hàng đầu nhìn chung là tích cực, bày tỏ sự tôn trọng đối với DeepMind và ngạc nhiên rằng công nghệ hỗ trợ tiếp cận này chưa xuất hiện sớm hơn; không có cuộc tranh luận kỹ thuật đáng kể nào trong các bình luận được cung cấp.
PSA: Tôi là người tạo ra Heretic, và tôi khuyên bạn không nên sử dụng các mô hình "heretic" làm bộ mã hóa văn bản (text encoder) cho H3 (hoặc bất kỳ mô hình nào khác) (Hoạt động: 2901): Người tạo ra Heretic cảnh báo rằng việc thay thế một LLM "heretic"/đã xóa bỏ kiểm duyệt (abliterated) cho một bộ mã hóa văn bản mô hình hình ảnh/video—ví dụ: thay thế bộ mã hóa Qwen3-VL của Minimax H3—sẽ không làm giảm sự kiểm duyệt đầu ra và có thể làm giảm khả năng tuân thủ prompt hoặc tạo ra các hiện vật (artifacts). Các phương pháp kiểu Heretic sử dụng directional ablation / ARA / SOMA để làm nhiễu các biểu diễn luồng dư (residual-stream) để các prompt "có hại" trông giống như các prompt "vô hại" đối với hành vi từ chối của LLM; chúng không tạo ra các nhúng ngữ nghĩa phong phú hơn, "thô" hơn cho các trình tạo diffusion/transformer hạ nguồn, mà thay vào đó làm lệch các trạng thái ẩn khỏi phân phối mà trình tạo đã được huấn luyện. Một ngoại lệ có thể là các mô hình/quy trình làm việc với giai đoạn LLM từ chối rõ ràng, chẳng hạn như các trình tăng cường prompt hoặc các hệ thống như từ chối chủ động kiểu Ideogram, nơi việc bỏ kiểm duyệt thành phần LLM đó có thể quan trọng. Các bình luận chủ yếu ủng hộ PSA này là có thẩm quyền và đáng được lan tỏa. Một người bình luận lưu ý một ngoại lệ thực tế: nếu một quy trình làm việc hình ảnh chạy prompt của người dùng thông qua một trình tăng cường prompt dựa trên LLM mà bản thân nó từ chối nội dung đáng ngờ, việc đổi trình tăng cường đó sang một mô hình không bị kiểm duyệt có thể vượt qua sự từ chối trước khi prompt đến được trình tạo.
2. Benchmark Grok 4.6 và việc tăng giá API DeepSeek
DeepSeek vừa tăng giá API của họ một cách khủng khiếp (có hiệu lực từ ngày 16 tháng 8 năm 2026) - tăng tới 1,114% cho các cache hit (Hoạt động: 1597): DeepSeek đang thay đổi giá API của mình có hiệu lực từ 16:00 UTC ngày 16/08/2026, thêm các khung giờ cao điểm/thấp điểm trong đó giá cao điểm gấp 2 lần giá thấp điểm, theo tài liệu giá API của họ. Mức tăng lớn nhất là đối với đầu vào được lưu trong cache: cache hit của V4-Pro tăng từ $0.003625 lên $0.022/$0.044 ngoài giờ cao điểm/cao điểm trên mỗi đơn vị giá, tức là +507%/+1,114%; đầu ra cũng tăng mạnh, với đầu ra V4-Pro chuyển từ $0.87 lên $1.98/$3.96 (+128%/+355%). Điều này làm giảm đáng kể lợi thế chi phí của DeepSeek đối với các khối lượng công việc có ngữ cảnh dài/lặp đi lặp lại dựa vào prompt caching, và đưa ra sự phức tạp về lập lịch/tối ưu hóa chi phí xung quanh các khung giờ cao điểm UTC. Các bình luận hàng đầu chủ yếu không mang tính kỹ thuật và bi quan; một người bình luận nói rằng họ đã "chuyển đi nơi khác" vì "DS4 tốt nhưng chỉ khi rẻ", ngụ ý rằng giá trị của mô hình phụ thuộc rất nhiều vào giá API thấp.
Grok 4.6 tương đương với Sol 5.6 theo artificial analysis arena (Hoạt động: 1475): Hình ảnh là biểu đồ thanh benchmark có tiêu đề "Artificial Analysis Intelligence Index" cho thấy Claude Opus 5 dẫn đầu ở mức 63, Claude Fable 5 ở mức 62, và GPT-5.6 Sol ngang bằng với Grok 4.6 ở mức 61, hỗ trợ tuyên bố của tiêu đề bài đăng rằng "Grok 4.6 tương đương với Sol 5.6" trên chỉ số tổng hợp này. Các bình luận bổ sung bối cảnh về giá cả/quy mô mô hình: Grok 4.6 được mô tả là rẻ hơn nhiều ($2/M đầu vào, $6/M token đầu ra) so với GPT-5.6 Sol ($5/M đầu vào, $30/M đầu ra), trong khi được cho là một mô hình 1.5T nhỏ hơn so với các đối thủ 5T+. Người dùng coi kết quả này là sự tiến bộ đáng ngạc nhiên của mô hình tiên phong đối với xAI/Grok, với một người lưu ý rằng việc Google "hoàn toàn nằm ngoài phân khúc tiên phong" là điều bất ngờ. Cũng có suy đoán rằng Grok 4.7 có thể mở rộng lên 2T–2.5T tham số và các mô hình lớn trong tương lai sẽ bắt đầu ở mức "Kimi".
Benchmark Grok 4.6 (Hoạt động: 1017): Hình ảnh là bảng benchmark cho "Grok 4.6 High" (hình ảnh) so sánh nó với Grok 4.5 High, GPT-5.6 Sol Max và Fable 5 Max. Nó trình bày Grok 4.6 như một kết quả mô hình tiên phong mạnh mẽ, dẫn đầu về GDPVal-AA v2, AA-Briefcase và Harvey LAB, trong khi các đối thủ vẫn dẫn đầu một số danh mục benchmark khác; bảng lưu ý kết quả dựa trên điểm số mô hình của bên thứ ba sử dụng các con số tốt nhất được tự báo cáo hoặc công khai. Một người bình luận cũng nhấn mạnh quy mô 1.5T được báo cáo, ngụ ý sự quan tâm đến kích thước/tính toán của mô hình như một phần của bối cảnh benchmark. Các bình luận chủ yếu nhẹ nhàng hoặc suy đoán: một người dùng coi sự tiến bộ tiên phong là một chu kỳ cường điệu xoay vòng — Grok → Claude → Gemini → ChatGPT — trong khi một người khác gọi quy mô 1.5T được báo cáo là "ấn tượng".
3. Trải nghiệm người dùng (UX) Agent của Claude Opus 5 và lập trình tự chủ
Tôi đã yêu cầu Opus 5 tự xây dựng GTA6 trong 24 giờ (Hoạt động: 1558): Tác giả tuyên bố họ đã giao nhiệm vụ cho Opus 5 tự động tạo ra một trò chơi thế giới mở giống GTA trong 24 giờ, để mô hình chọn bố cục thành phố, quận, đường xá, tòa nhà, NPC, phương tiện và thời tiết mà không cần chỉ đạo thêm. Sau đó, họ đã xuất bản harness điều phối, bao gồm "kỹ năng, agent, công cụ, tài nguyên và mô hình", tại ukanwat/aaabench; video gameplay/trailer được lưu trữ trên Reddit không thể truy cập từ URL được cung cấp do chặn Reddit 403 Forbidden. Các bình luận chủ yếu mang tính suy đoán: một người dùng hỏi 3D/mô hình/tài sản đến từ đâu, trong khi một người khác lập luận rằng mặc dù kết quả còn "thô", loại tạo trò chơi tự chủ này có thể mở rộng đáng kể sản xuất trò chơi indie trong thập kỷ tới bất chấp khả năng là "rác" do AI tạo ra.
Opus 5 thực sự gần như gây ức chế khi sử dụng. (Hoạt động: 1378): Bài đăng báo cáo khả năng sử dụng kém với Anthropic Claude Opus 5 trong các bối cảnh lập trình/quy trình làm việc mặc dù đã làm theo hướng dẫn của Anthropic và sửa đổi claude.md toàn cục: đầu ra được cho là vẫn quá dài dòng, đầy từ ngữ chuyên môn và dễ thổi phồng các nhiệm vụ nhỏ thành các "dự án" nhiều bước. Khiếu nại kỹ thuật chính của tác giả là các chỉnh sửa mã không hoàn chỉnh / code rot: Opus 5 có thể thay đổi một phần của tệp, làm mất hiệu lực phần khác trong cùng tệp, sau đó chỉ lưu ý "hãy cho tôi biết nếu bạn muốn nó thay đổi như vậy" thay vì sửa sự không nhất quán được tạo ra; họ tương phản điều này với Fable, mà họ nói có ít vấn đề như vậy hơn nhưng giới hạn hàng tuần hạn chế ngay cả trên gói $200. Các bình luận hàng đầu đồng ý mạnh mẽ, mô tả Opus 5 là không thể sử dụng hoặc "gây khó chịu"; một người dùng nói rằng một yêu cầu đơn giản để làm cho tệp văn bản hai trang trở nên súc tích đã trở thành một quá trình kéo dài một giờ với ~10 mục hành động còn lại, trong khi một người khác nói rằng người dùng phải thúc ép nó liên tục để hoàn thành một thay đổi được yêu cầu duy nhất.
Bạn không bao giờ biết những ngày tốt đẹp cho đến khi chúng qua đi (trừ khi bạn vẫn đang sử dụng 4.6) (Hoạt động: 1001): Hình ảnh là biểu đồ thanh so sánh số từ trên mỗi câu trả lời giữa các phiên bản mô hình, cho thấy Opus 5 dài dòng hơn nhiều ở mức 510 từ/câu trả lời so với Opus 4.6 ở mức 234, Opus 4.8 ở mức 259, Opus 4.7 ở mức 276, Fable 5 ở mức 316 và Opus 4.5 ở mức 158. Bài đăng sử dụng điều này để lập luận rằng các mô hình mới hơn—đặc biệt là Opus 5—có thể ít dễ chịu hơn cho các quy trình làm việc thực tế vì chúng "làm tràn ngập cuộc trò chuyện" bằng những lời tán gẫu không cần thiết mặc dù mới hơn hoặc mạnh hơn trên lý thuyết. Các bình luận tranh luận liệu trí thông minh benchmark cao hơn có chuyển thành khả năng sử dụng tốt hơn hay không: một người thích một mô hình yếu hơn một chút nhưng thực thi súc tích hơn là một mô hình kể chuyện quá mức, trong khi một người khác hỏi về nguồn dữ liệu đằng sau biểu đồ. Một người bình luận thứ ba nói rằng họ hiện sử dụng Kimi K3 làm trình điều khiển chính vì nó dễ chịu hơn và phơi bày các dấu vết suy luận để các agent khác giám sát.
Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.