Tin ngành
Cập nhật AI: OpenAI và Anthropic nâng cấp nền tảng Agent, AT&T tối ưu chi phí nhờ mô hình mở
(giờ Việt Nam)
Tóm tắt AI
OpenAI và Anthropic mở rộng tính năng cho Agent, trong khi AT&T đạt hiệu quả kinh tế cao nhờ chuyển dịch sang các mô hình mở. Đồng thời, thị trường chứng kiến cuộc đua giảm giá mạnh mẽ và sự phổ biến của các mô hình tùy chỉnh như Kimi K3.
Bản dịch AI
một ngày yên ắng.
Tin tức AI từ 19/8/2026 đến 20/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận hoặc hủy nhận email theo tần suất mong muốn!
Tóm tắt AI trên Twitter
OpenAI và Anthropic mở rộng bề mặt sản phẩm Agent
Kinh tế học mô hình, giới hạn sử dụng và sự chuyển dịch của doanh nghiệp sang các mô hình mở
Các tiêu chuẩn đánh giá (benchmark) đa phương thức và Agent: Muse Spark, GLM-5.3, Gemini 3.7 Flash
Hạ tầng, phần cứng và công việc hệ thống: Rubin, Cerebras, Linux Agents, Caching
Agent, bộ nhớ và học tập tập trung vào Harness
Các tweet hàng đầu (theo mức độ tương tác)
Tóm tắt AI trên Reddit
Tóm tắt từ /r/LocalLlama + /r/localLLM
1. Lượng tử hóa Qwen3.8-27B và các tiêu chuẩn đánh giá lập trình
Giới thiệu Qwen3.8-27B Dynamic v3 Unsloth GGUFs (Hoạt động: 2059): Hình ảnh là đồ họa thông báo kỹ thuật cho các bản lượng tử hóa Unsloth Dynamic v3.0 GGUF của Qwen3.8-27B, tuyên bố độ chính xác top-1 cao hơn >10% ở cùng kích thước mô hình so với các nhà cung cấp lượng tử hóa khác. Nó nhấn mạnh chỉ thực hiện lượng tử hóa sau huấn luyện (post-training)—không dùng QAT/QAD và không huấn luyện trên tập dữ liệu hiệu chuẩn imatrix—cộng với các mục tiêu bộ nhớ từ 1-bit có thể chạy trên RAM ~8GB lên đến BF16, với đánh giá dựa trên Divergence-300 @32, KLD và so sánh độ chính xác top-1%. Liên kết phát hành dẫn đến blog của Unsloth và kho lưu trữ Hugging Face GGUF: https://unsloth.ai/docs/basics/dynamic-3.0-ggufs và https://huggingface.co/unsloth/Qwen3.8-27B-GGUF. Người bình luận nhìn chung phản hồi tích cực nhưng yêu cầu thêm dữ liệu so sánh, đặc biệt là thêm các bản lượng tử hóa Qwen 3.8 27B UD 2.0 trước đó vào biểu đồ để người dùng đánh giá xem việc nâng cấp có đáng giá hay không. Một người dùng cũng lưu ý đến mối quan tâm thực tế về phần cứng: liệu IQ4XS hiện có thể chạy trên 16GB VRAM mà không cần MTP hay không.
Qwen3.8-27B bị sụt giảm đáng kể về kiến thức so với bản 3.6 (Hoạt động: 758): Người dùng báo cáo Qwen3.8-27B bị thoái lui so với Qwen3.6-27B về khả năng truy xuất thông tin thực tế ngoại tuyến/chỉ dựa trên trọng số, phù hợp với điểm số thấp hơn trên tiêu chuẩn đánh giá kiến thức Omniscience của Artificial Analysis. Sự đánh đổi được quan sát thấy là Qwen3.8 có vẻ mạnh hơn trong việc gọi công cụ (tool calling), lập trình và các quy trình làm việc của agent, nhưng lại yếu hơn khi các công cụ web/tìm kiếm bị vô hiệu hóa đối với các câu đố khó, nhận dạng lịch sử/địa điểm hoặc truy xuất kiến thức trong môi trường airgapped. Người bình luận thường coi đây là một sự đánh đổi chuyên môn hóa có chủ đích hoặc có thể chấp nhận được: Qwen 3.x có thể đang chuyển dịch sang việc sử dụng cho lập trình/agent nơi kỳ vọng có sự truy xuất bên ngoài, trong khi các mô hình như Gemma có thể thích hợp hơn cho việc truy xuất thông tin thực tế kiểu “Google thu nhỏ”. Một người bình luận bày tỏ rõ ràng rằng họ không muốn phân bổ tham số cho các câu đố nhỏ lẻ nếu điều đó giúp cải thiện hiệu suất lập trình.
Tôi đã chạy Qwen3.8-27B so với Opus, Sonnet, GPT và các mô hình khác. Kết quả bên trong. (Hoạt động: 422): Hình ảnh là bảng điều khiển tiêu chuẩn đánh giá cho bài kiểm tra lập trình tự xây dựng của tác giả, so sánh Qwen3.8-27B, DS4 0731, GPT-5.6-sol, Opus 5, Sonnet 5 và Haiku 4.5 qua các bài kiểm tra thuật toán, sửa lỗi/tính năng repo, thời gian hoàn thành thực tế và chất lượng mã nguồn được đánh giá mù (hình ảnh). Điểm kỹ thuật chính là GPT-5.6-sol dẫn đầu tổng thể với hiệu suất tác vụ repo hoàn hảo và các thuật toán gần như hoàn hảo, trong khi các mô hình cục bộ (local) cạnh tranh đáng ngạc nhiên: Qwen3.8-27B xhigh đạt điểm cao trong các thuật toán khó và “sửa lỗi phẫu thuật” nhưng chậm hơn nhiều, và DS4 0731 đạt 8/8 trên cả hai cấp độ repo mặc dù là bản lượng tử hóa cục bộ 2-bit. Tác giả lưu ý một sự đánh đổi thực tế: “tư duy” cao hơn cải thiện một số trường hợp suy luận/chất lượng mã khó nhưng có thể gây suy nghĩ quá mức, tăng độ trễ và thậm chí giảm độ chính xác của tác vụ repo so với tư duy trung bình. Người bình luận đặt câu hỏi về độ bão hòa của tiêu chuẩn đánh giá và độ khó của tác vụ, lập luận rằng nếu gần như tất cả các mô hình đều đạt điểm gần mức cao nhất thì bài đánh giá có thể không phân biệt rõ năng lực giữa mô hình tiên phong và mô hình cục bộ. Những người khác yêu cầu chi tiết hơn về định nghĩa của các tác vụ “thuật toán” và “công việc repo”, kết quả mong đợi và thiết kế kiểm tra ẩn để làm cho kết quả có thể tái lập và diễn giải được.
2. Tăng tốc suy luận DFlash2 cho Qwen3.8-27B
DFlash2 tăng tốc Qwen 3.8 27B lên tới 4 lần (Hoạt động: 418): PR #27342 của llama.cpp thêm dflash2; người đăng bài đã đánh giá Qwen 3.8 27B trên RTX 6000 qua bốn thiết lập prompt/giải mã, báo cáo thông lượng trung bình: cơ sở 47.4 tok/s, mtp 114.7 tok/s, dflash 99.3 tok/s và dflash2 140.6 tok/s. Điều này ngụ ý tốc độ nhanh gấp khoảng 3 lần so với cơ sở và ~22.6% so với MTP trong thử nghiệm nhỏ này, nhưng tốc độ tăng theo cấp độ tác vụ thay đổi đáng kể, với một prompt chỉ đạt ~1.5 lần; người đăng cung cấp liên kết giải thích DFlash2 tại inco.ai/blog/dflash2. Người bình luận đặt câu hỏi về độ nhạy phần cứng: một người báo cáo rằng Apple Silicon không thể đánh bại cấu hình MTP hiện tại của họ trên nhiều tùy chọn/lượng tử hóa, và một người khác hỏi phần cứng nào được hưởng lợi nếu cả người dùng Apple và RTX 5090 đều thấy mức tăng hạn chế. Một câu hỏi về sự đánh đổi đã được đặt ra, nhưng không có dữ liệu cụ thể về sự đánh đổi giữa độ chính xác/chấp nhận/độ trễ nào được cung cấp trong các bình luận.
Tôi lại đẩy giới hạn của Qwen3.8-27B… Dflash2 - 134 tps trên RTX 3090 (Hoạt động: 367): Một bản cập nhật mới cho ngăn xếp suy luận Qwen3.8-27B tối ưu hóa cho RTX 3090 báo cáo ~138 tok/s cho một yêu cầu đơn lẻ trên các prompt trò chuyện thực tế, 942 tok/s ở mức đồng thời 64, và độ trễ phản hồi trò chuyện dài được lưu trong bộ nhớ đệm giảm từ ~23 giây xuống 0.85–1.35 giây; kho lưu trữ có sẵn tại syv-ai/qwen38-27b-rtx3090. Các thay đổi chính bao gồm backport speculative block drafting DFlash2 cho vLLM 0.27.1, bộ soạn thảo (drafter) lượng tử hóa W4A16/GPTQ-int4 thu nhỏ từ 3.85 GB bf16 xuống 1.19 GB, soạn thảo tăng cường tra cứu (lookup-augmented drafting) dựa trên lịch sử token trước đó, bộ nhớ đệm tiền tố (prefix caching) cho mô hình lai Mamba/GDN thông qua --mamba-cache-mode align, và các bản sửa lỗi allocator/CUDA-graph cho phép ngữ cảnh 64k với DFlash2; chất lượng được tuyên bố không thay đổi ở mức perplexity 8.09 và GSM8K 96.5%. Tác giả cũng lưu ý một lỗi vLLM 0.27.1 trong đó các logit dự thảo áp dụng nhiệt độ bị lưu vào bộ nhớ đệm thay vì logit thô, điều này sẽ khiến việc xác minh suy đoán sử dụng sai phân phối đề xuất cho 0 < T ≠ 1; các thành phần bao gồm bộ soạn thảo W4A16 DFlash2 và các tensor biến thể nhanh. Người bình luận hầu hết ấn tượng thay vì chỉ trích sâu sắc, với một người nhấn mạnh việc soạn thảo tăng cường tra cứu là một tối ưu hóa “rõ ràng khi nhìn lại” cho các khối lượng công việc sao chép/viết lại ngữ cảnh dài. Một người khác so sánh tốc độ được báo cáo một cách thuận lợi với các lần chạy MoE cục bộ trước đó, trích dẫn hiệu suất prompt lập trình burst đầu tiên khoảng 150 tok/s trên thiết lập Qwen 3.6 MoE trong llama.cpp.
3. Mở rộng trọng số mở và phát hành mô hình mới
Ornith-1.5 (397B [DeepSWE 56], 35B-A3B, 9B) (Hoạt động: 431): Ornith AI đã công bố Ornith-1.5, một dòng mô hình mã nguồn mở với các biến thể 9B dày đặc, 35B-A3B MoE và 397B MoE, được huấn luyện thông qua các chiến lược tự cải thiện và báo cáo kết quả gần như tiên phong: Terminal-Bench 2.1 86.1, SWE-Bench Verified 86, SWE-Bench Pro 65.1, Đa ngôn ngữ 79.6, DeepSWE 56, HLE 44.6, ClawEval 81.4 và Tool Decathlon 71.2. Một người bình luận đã đánh giá Ornith-1.5 35B-A3B so với Qwen3.8-27B, cho thấy Qwen dẫn trước trên Terminal-Bench 2.1 (73.0 so với 68.5), DeepSWE (42.2 so với 22.0) và HLE không công cụ (30.8 so với 25.6), trong khi Ornith dẫn đầu về NL2Repo (46.2 so với 42.3) và hòa GPQA Diamond (89.2). Một người bình luận khác nhấn mạnh mô hình 9B đặc biệt thú vị, liên kết đến trang dự án: ornith.ai/ornith_1_5.html. Các bình luận tập trung vào việc liệu Ornith có kế hoạch tinh chỉnh Qwen3.8-27B hay không, ngầm đặt câu hỏi liệu kết quả lập trình/suy luận của mô hình 35B-A3B có cạnh tranh được không khi xét đến các con số mạnh hơn của Qwen trên một số tiêu chuẩn đánh giá tương đương.
Tôi vừa xây dựng một mini Kimi-K3 từ đầu với giá dưới 250$. Đã đánh bại GPT-2 (124M)! (Hoạt động: 933): Hình ảnh là bảng tóm tắt huấn luyện cho một lần chạy tiền huấn luyện từ đầu của một mô hình ngôn ngữ MoE kiểu mini Kimi-K3: tổng 1.02B tham số, 145M tham số hoạt động mỗi token, 61M tham số không nhúng, được huấn luyện trong 38,147 bước trên ~5.0B token sử dụng một H200 với giá $4.54/giờ cho tổng số tiền liệt kê là $252.35—hơi mâu thuẫn với tuyên bố “dưới 250$” trong tiêu đề. Bài đăng cho biết mô hình tái tạo các thành phần kiến trúc Kimi K3 như Kimi Delta Attention, Gated MLA, attention residuals, LatentMoE với cân bằng không cần aux-loss, và bộ tokenizer 163,840-token của K3; nó báo cáo 33.4% HellaSwag, cao hơn mức 28% được trích dẫn của GPT-2 124M, với hướng dẫn đầy đủ được liên kết tại đây và hình ảnh tại đây. Các bình luận hầu hết mang tính khuyến khích và khám phá, với người dùng hỏi về điện toán đám mây so với cục bộ và gợi ý các bước tiếp theo như mở rộng lên MoE hoạt động 35B/3B hoặc sử dụng K3 làm giáo viên cho RL tự trị.
Suy nghĩ về Định luật mở rộng (Scaling Law) - Z.ai (Hoạt động: 718): Hình ảnh là một ảnh chụp màn hình kỹ thuật không phải meme từ bài đăng X của Jie Tang/Z.ai, được hiển thị tại đây, lập luận rằng việc mở rộng LLM hiện đại không nên bị giảm xuống chỉ còn số lượng tham số: dữ liệu, phân bổ tính toán, chi phí suy luận, MoE kích hoạt so với tổng tham số, và hậu huấn luyện/RL đều làm thay đổi điểm tối ưu. Bài đăng coi GLM-5.3 là một thí nghiệm có kiểm soát so với GLM-5.2 với cùng cơ sở/kiến trúc/số lượng tham số nhưng có thêm khoảng một tháng môi trường dài hạn + mở rộng RL, tuyên bố đạt được những bước tiến đáng kể từ hậu huấn luyện thay vì quy mô tiền huấn luyện lớn hơn. Người bình luận nhìn chung coi GLM-5.3 là bằng chứng cho thấy các phòng thí nghiệm Trung Quốc như Z.ai đang thực hiện công việc ở cấp độ tiên phong thay vì chỉ chưng cất các mô hình phương Tây. Một chủ đề kỹ thuật mở rộng cùng chủ đề này, suy đoán rằng các mô hình nhỏ hơn có thể vượt quá mong đợi bằng cách tách biệt việc lưu trữ “kiến thức thế giới” khỏi đồ thị tính toán, đánh đổi RAM lấy VRAM trong một kiến trúc giống như Engram.
Tóm tắt Subreddit AI ít kỹ thuật hơn
/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo
1. Kết quả giai đoạn 3 của vắc-xin ung thư cá nhân hóa
Cổ phiếu Moderna, $MRNA, tăng vọt hơn +110% sau khi công bố kết quả tích cực giai đoạn 3 đầu tiên cho vắc-xin ung thư cá nhân hóa. (Hoạt động: 1284): Moderna (MRNA) và Merck đã báo cáo kết quả tích cực giai đoạn 3 đầu tiên cho vắc-xin ung thư cá nhân hóa, với nghiên cứu về khối u ác tính cho thấy giảm tái phát khi được sử dụng trong môi trường giai đoạn cuối quy mô lớn. Chương trình được hiểu rộng rãi là phương pháp tiếp cận neoantigen/mRNA cá nhân hóa kết hợp với liệu pháp miễn dịch ung thư, và thông báo này đã đẩy cổ phiếu MRNA tăng hơn +110%. Người bình luận lưu ý rằng khối u ác tính đặc biệt phù hợp với phương thức này, nhưng thành công ở đó vẫn có thể hỗ trợ mở rộng sang các loại khối u khác. Một mối lo ngại kỹ thuật được đặt ra là chi phí: sản xuất cá nhân hóa có thể khiến chi phí điều trị vào khoảng ~$150k/người, hạn chế hiệu quả chi phí toàn cầu nếu không có những cải tiến lớn về hiệu suất.
AI cuối cùng cũng đang chữa khỏi ung thư (Hoạt động: 1903): Hình ảnh chủ yếu là một meme Star Wars sử dụng một tweet về phương pháp điều trị ung thư mRNA cá nhân hóa hỗ trợ bởi AI được cho là đã thành công trong một thử nghiệm giai đoạn 3 để đùa rằng nhu cầu về GPU thực sự có thể gắn liền với tiến bộ y sinh thay vì chỉ là sự cường điệu. Bối cảnh kỹ thuật rất mỏng: người bình luận lưu ý rằng công việc vắc-xin cơ bản được cho là đã được phát triển từ năm 2017, vì vậy tuyên bố rằng đây là sản phẩm của sự bùng nổ AI tạo sinh/GPU hiện tại có khả năng bị phóng đại. Các bình luận phản bác lại cách đặt vấn đề này, lập luận rằng điều này “không liên quan gì đến làn sóng AI hiện tại”, trong khi những người khác phản hồi bằng các câu đùa về tăng tốc AI/điểm kỳ dị thay vì phân tích kỹ thuật.
2. Ra mắt robot đa năng và robot thực địa
Giới thiệu GEN-1.5, một người học một lần (one-shot learner) (Hoạt động: 1429): Generalist AI đã công bố GEN-1.5, được mô tả là một người học một lần cho AI hiện thân/robot học, với các ví dụ trong bản demo YouTube và bài đăng trên blog. Tuyên bố cốt lõi được nhấn mạnh trong chủ đề là người dùng có thể trình diễn một tác vụ một lần cho robot và khiến nó tái tạo/tổng quát hóa hành vi “gần như ngay lập tức”; video demo được lưu trữ trên Reddit không thể truy cập độc lập do các hạn chế 403 Forbidden của Reddit. Những người bình luận hàng đầu coi kết quả này là một cột mốc quan trọng cho các mô hình nền tảng robot, với một người gọi nó là “tương đương với GPT-2 cho AI hiện thân/robot học”. Cuộc thảo luận phần lớn đầy nhiệt huyết, nhấn mạnh bước nhảy vọt từ các hành vi robot được lập trình sẵn sang học tác vụ nhanh chóng tại chỗ từ một lần trình diễn duy nhất.
Robot-ngựa địa hình của DaxAI ra mắt tại WRC’26: Tự chủ 100Km/10h, tải trọng tối đa 300Kg, tốc độ tối đa 40Km/h (Hoạt động: 1423): DaxAI được cho là đã ra mắt một “robot-ngựa” bốn chân địa hình tại WRC ’26, với các thông số kỹ thuật được tuyên bố là phạm vi 100 km / tự chủ 10 giờ, tải trọng tối đa 300 kg và tốc độ tối đa 40 km/h. Video Reddit được liên kết (v.redd.it/niyx5b3cvikh1) không thể truy cập do phản hồi 403 Forbidden, vì vậy các tuyên bố không thể được xác minh độc lập từ phương tiện truyền thông. Các bình luận hàng đầu hầu hết không mang tính kỹ thuật: người dùng đùa về một “con ngựa không cần ngựa” và bày tỏ sự quan tâm mặc dù mong đợi sự thoải mái khi cưỡi kém.
3. Các tín hiệu quy trình làm việc thực tế của Claude Code
Cuối cùng. Đây có phải là bằng chứng xác thực khiến Opus bớt trở thành gánh nặng không? (Hoạt động: 2114): Hình ảnh hiển thị ảnh chụp màn hình thông báo trên X.com rằng Claude Code hiện hỗ trợ kiểu đầu ra Súc tích (Concise) có thể cấu hình qua /config, nhằm mục đích khiến agent dẫn đầu với kết quả, giảm sự dài dòng và vẫn mở rộng khi được yêu cầu. Trong bối cảnh của tiêu đề, người bình luận coi đây là khả năng làm cho các cấu hình Claude rẻ hơn/nhanh hơn trở nên hữu dụng hơn bằng cách giảm bớt các giàn giáo “giống Opus” dài dòng có thể khiến Claude Code cảm thấy như một gánh nặng cho các quy trình gỡ lỗi phức tạp. Các bình luận hầu hết chỉ trích phong cách viết hiện tại của Claude, đùa rằng chế độ mới có thể chỉ đơn giản là loại bỏ các cụm từ như “bằng chứng xác thực”, “gánh nặng” và “điều phối một subagent”. Một người bình luận suy đoán rằng thay đổi này có thể được thực hiện thông qua một hướng dẫn system-prompt bổ sung như “Ngừng nôn ra những từ ngữ kỹ thuật vô nghĩa.”
chính xác là loại vấn đề mà AI được tạo ra để giải quyết (Hoạt động: 4182): Hình ảnh là một tweet cho thấy Claude đang được sử dụng để viết trình điều khiển/shim macOS cho một máy in HP ít người biết đến chỉ hỗ trợ Windows (hình ảnh). Về mặt kỹ thuật, tuyên bố thú vị không phải là “AI viết mã” chung chung, mà là một LLM có thể giúp ích cho một tác vụ tương thích ngách liên quan đến hành vi trình điều khiển, dịch API, giả định I/O phần cứng và có thể là kỹ thuật đảo ngược hỗ trợ máy in chỉ dành cho Windows. Người bình luận tỏ ra ấn tượng một cách thận trọng nhưng hoài nghi, với một người nói rằng họ sẽ “thực sự thực sự ấn tượng nếu điều này hoạt động”. Một người bình luận kỹ thuật lưu ý rằng việc viết lại toàn bộ trình điều khiển có thể không cần thiết: trình điều khiển Windows có thể được shim bằng cách chặn các lệnh gọi API của nó và ánh xạ chúng sang các tương đương macOS, ngoại trừ bất kỳ quyền truy cập phần cứng trực tiếp nào.
Tại sao Claude Code lại nói những điều như “đó là khoảng 3 ngày làm việc” rồi sau đó hoàn thành tất cả trong 20 phút? (Hoạt động: 1395): Một người dùng báo cáo Claude Code thường xuyên đưa ra các ước tính dự án ở quy mô con người (ví dụ: “ngày” hoặc “tuần”) trong quá trình lập kế hoạch, sau đó hoàn thành việc triển khai trong 20–30 phút. Giải thích kỹ thuật có khả năng được đưa ra trong các bình luận là các ước tính thời gian của nó được kế thừa từ dữ liệu huấn luyện chứa các ước tính kỹ thuật phần mềm của con người, không được hiệu chỉnh theo tốc độ thực thi thực tế, vòng lặp sử dụng công cụ hoặc lịch sử tác vụ cụ thể của kho lưu trữ của agent. Người bình luận nhìn chung coi đây là vấn đề hiệu chuẩn thay vì vấn đề năng lực: Claude dường như ước tính giống như một nhà phát triển con người trừ khi được hướng dẫn cụ thể khác. Một người dùng báo cáo đã cải thiện các ước tính bằng cách thêm một kỹ năng tùy chỉnh khiến Claude kiểm tra lịch sử git commit và đưa ra dự đoán dựa trên dòng thời gian của repo/tác vụ đã quan sát, bao gồm cả rủi ro gỡ lỗi dự kiến.
Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.