Tin ngành
Stanford cải tổ giáo trình kỹ thuật phần mềm AI; lộ diện kiến trúc Astra của OpenAI
(giờ Việt Nam)
Tóm tắt AI
Stanford thay đổi 85% giáo trình để tập trung vào kỹ thuật phần mềm AI-native và hệ thống tác nhân (agent). Đồng thời, các tin đồn về kiến trúc 'looped transformer' của OpenAI Astra và các cập nhật hạ tầng mới từ Photon, Baseten cũng được hé lộ.
Bản dịch AI
một ngày yên ắng.
Tin tức AI từ 22/8/2026 đến 24/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể chọn đăng ký/hủy đăng ký nhận email theo tần suất tùy chọn!
Tóm tắt AI trên Twitter
Các khóa học về Kỹ thuật Agent, Chương trình đào tạo và Thực hành cho nhà phát triển
Kiến trúc mô hình và Suy luận: Tin đồn về Astra, Looped Transformers và Phục vụ thời gian thực (Real-Time Serving)
Bộ công cụ Agent (Agent Harnesses), Truy xuất kỹ năng và Công cụ hậu huấn luyện RL
Google Gemini 3.8 Flash Cyber và những rào cản trong sản xuất liên quan đến bộ công cụ của Google
Meta Muse Spark 1.3 và chu kỳ phát hành Video/Đa phương thức
Các mô hình mở, Robot và các bài đăng nổi bật trên Twitter
Tóm tắt AI trên Reddit
Tóm tắt từ /r/LocalLlama + /r/localLLM
1. Muse Spark và các mô hình mã nguồn mở Spark-X2.5
Muse Spark mã nguồn mở sắp ra mắt (Hoạt động: 902): Hình ảnh là ảnh chụp màn hình bài đăng của Mark Zuckerberg/X thông báo về việc triển khai Muse Spark 1.3, tuyên bố có những cải tiến lớn về lập trình, quy trình làm việc của agent và các tác vụ ngữ cảnh dài, với các mô hình Muse Spark mã nguồn mở “sắp ra mắt”. Bảng điểm chuẩn đi kèm xếp Muse Spark 1.3 cao hơn Muse Spark 1.2 và có khả năng cạnh tranh với các mô hình như GPT 5.6 Sol và Opus 5 trong các đánh giá về agent, ngữ cảnh dài và lập trình. Tuy nhiên, tác giả bài đăng trên Reddit lưu ý rằng Spark có thể quá lớn so với phần cứng của họ và cho biết họ đang chờ đợi Llama 5 hoặc một mô hình trung gian giữa Glimmer và Spark. Những người bình luận coi kết quả này là bằng chứng cho thấy nhiều phòng thí nghiệm hàng đầu đang hội tụ về mặt kỹ thuật, với một người nói rằng “không có bí quyết gì cả” và khoảng cách giữa các mô hình tiên phong có thể chỉ còn vài tháng. Một người bình luận khác cho rằng Muse Glimmer đang bị đánh giá thấp và khẳng định nó vượt trội hơn Qwen 3.8:27B trong các tác vụ không liên quan đến lập trình.
Mô hình mới: Spark-X2.5-4B, Spark-X2.5-1.7B (Hoạt động: 301): XHToken đã phát hành Spark-X2.5 1.7B và 4B, dường như là một kiến trúc tùy chỉnh thay vì chỉ là tinh chỉnh đơn thuần. Các model card tuyên bố hỗ trợ ngữ cảnh gốc 1M token, hỗ trợ đa ngôn ngữ và được huấn luyện trên khoảng 20T token cùng các giai đoạn ngữ cảnh dài/hậu huấn luyện. Kiến trúc này được cho là sử dụng kết hợp giữa full attention và sliding-window attention để giảm chi phí tính toán/KV cho ngữ cảnh dài. Các tuyên bố về điểm chuẩn của bản 4B được cho là cạnh tranh với các mô hình lớn hơn nhiều như dòng Qwen ~9B. Hỗ trợ runtime hiện chưa được đưa vào llama.cpp chính thức; nó phụ thuộc vào một PR #27868 đang chờ xử lý của llama.cpp hoặc bản fork tùy chỉnh của XHToken, với các tệp GGUF đã có sẵn cho bản 1.7B và 4B. Người dùng chủ yếu ấn tượng với quy mô tiền huấn luyện 20T-token và đặc biệt là khả năng hỗ trợ ngữ cảnh gốc 1M ở kích thước dưới 5B tham số. Có sự quan tâm thận trọng về việc liệu các tuyên bố về điểm chuẩn—đặc biệt là bản 4B ngang ngửa với mô hình ~9B—có giữ vững được trong các bài kiểm tra độc lập hay không.
2. Điểm chuẩn Qwen3.8 và tăng tốc GGUF
Qwen sẽ là nhà vua? (Hoạt động: 732): Hình ảnh hiển thị bảng xếp hạng Arena AI Code Arena WebDev, nơi Qwen3.8-Max-0902 xếp hạng #1 với số điểm 1.691, vượt nhẹ so với Claude Opus 5 Max (1.688) và Kimi K3 Max (1.674). Trong bối cảnh bài đăng, kết quả này được sử dụng để lập luận rằng khả năng suy luận mở rộng/quy mô hậu huấn luyện của Qwen có thể đang thu hẹp khoảng cách với các hệ thống tiên phong lớn hơn nhiều, có khả năng diễn ra trước khi Qwen 4 ra mắt hoặc bản cập nhật mã nguồn mở tiềm năng. Người bình luận tỏ ra lạc quan đáng kể về các biến thể Qwen cục bộ/mã nguồn mở, với một người khẳng định Q3.8-27B chạy cục bộ đã vượt trội hơn trải nghiệm lập trình trên ChatGPT trả phí của họ. Những người khác đặt câu hỏi liệu mô hình Max hiệu năng cao nhất có trở thành mã nguồn mở hay không, trong khi một người bình luận khen ngợi khả năng suy luận mở rộng nhưng lưu ý đến sự đánh đổi: độ trễ hàng giờ cho các tác vụ khó.
MTP được phát hành cho Qwen3.8-Flash-Next-GGUF (Hoạt động: 671): Unsloth đã phát hành hỗ trợ/tệp MTP cho Qwen3.8-Flash-Next-GGUF, với hướng dẫn kiểm tra gắn liền với một nhánh/PR của Unsloth llama.cpp (unslothai/llama.cpp#144) và các đường dẫn sử dụng GGUF nhắm vào các runtime cục bộ/endpoint tương thích với OpenAI. Một người bình luận chỉ ra một tối ưu hóa llama.cpp mới được hợp nhất (ggml-org/llama.cpp#28123), báo cáo cải thiện thông lượng MTP từ 123 tok/s lên 183 tok/s đối với mã nguồn và từ 83 tok/s lên 144 tok/s đối với văn bản xuôi, so với 108 tok/s khi không có drafting; trước bản vá, MTP văn bản xuôi được cho là chậm hơn cả khi không dùng bản nháp. Thảo luận trong phần bình luận chủ yếu mang tính thực tế: người dùng hỏi liệu việc offload SSD có ổn định/“hoàn thiện” hay không và lưu ý rằng các tệp MTP có thể đã có sẵn từ vài ngày trước.
3. Các mô hình Gemma bí ẩn trên Arena
Các mô hình Gemma mới trên arena ai (Hoạt động: 1031): Một người dùng Reddit đã phát hiện các mô hình thuộc dòng Gemma mới trên Arena AI thông qua ảnh chụp màn hình, suy đoán liệu chúng có báo hiệu “Gemma 5 hay thứ gì đó khác” hay không. Bình luận kỹ thuật thực chất duy nhất lưu ý rằng kiến trúc Gemma hiện tại được cho là có bộ nhớ đệm KV nặng về VRAM và bộ nhớ đệm này “không lượng tử hóa tốt”, ngụ ý rằng hiệu quả bộ nhớ suy luận vẫn là một mối quan tâm cho các bản phát hành tương lai. Người bình luận nhìn chung rất hào hứng về một mô hình Gemma mới sắp xuất hiện, với một người mô tả một “mô hình mới” có khả năng đang trên đường ra mắt; hy vọng kỹ thuật chính là cải thiện hiệu quả bộ nhớ đệm KV thay vì chỉ là hiệu suất điểm chuẩn cao hơn.
Hy vọng vào bản 122b hoặc bất cứ thứ gì trên 31b.🤞 (Hoạt động: 949): Hình ảnh là một meme/bài đăng suy đoán phi kỹ thuật về các mục nhập bí ẩn của Google/Gemma trong một “bản cập nhật danh sách Arena”, với các tên như gemma-b2-2048s300-wd, thúc đẩy các dự đoán về việc liệu chúng có chỉ ra kích thước tham số mô hình Gemma mới hay không. Cuộc thảo luận tập trung vào việc liệu các mô hình bí ẩn này có thể là các bản phát hành Google/Gemma lớn hơn—tiêu đề hy vọng vào 122B hoặc bất cứ thứ gì trên 31B—hay thay vào đó là các cập nhật về đầu vào hình ảnh/ngữ cảnh/cấu hình cho các mô hình Gemma hiện có, với 2048/4096 có thể đề cập đến độ phân giải, độ dài chuỗi hoặc các biến thể đánh giá/cấu hình thay vì số lượng tham số. Những người bình luận chia làm hai phe: một bên muốn một mô hình flagship lớn hơn và một bên thích các mô hình cục bộ hiệu quả; một người lập luận rằng mô hình 122B là không thực tế cho suy luận cục bộ và Google nên mô phỏng các thiết kế ~27B/MoE kiểu Qwen thay thế. Một người bình luận khác suy đoán các mục nhập này có khả năng là cập nhật hình ảnh/văn bản của Gemma 4 thay vì các kích thước mô hình ẩn mới.
Tóm tắt các Subreddit AI ít kỹ thuật hơn
/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo
1. Phát hành Claude Fable 5.1 và các bản demo lập trình Agent
Giới thiệu Claude Fable 5.1 và Claude Mythos 5.1 (Hoạt động: 1367): Anthropic đã công bố Claude Fable 5.1 và Claude Mythos 5.1 (quyền truy cập hạn chế), tuyên bố Fable 5.1 cải thiện các tác vụ lập trình/kiến thức dài hạn và quy trình nghiên cứu, với điểm chuẩn 52,6% trên Terminal-Bench-Science 0.1 (>2 lần Fable 5) và 55,8% trên Terminal-Bench 4.0 so với 42,0% của Fable 5 (thông báo). Họ cũng báo cáo chi phí đọc bộ nhớ đệm rẻ hơn 75%, giúp giảm ~25% chi phí khối lượng công việc thông thường và lên đến 45% cho các khối lượng công việc mang tính agent cao, cộng với việc tinh chỉnh bảo mật giúp giảm ~60% các kết quả dương tính giả về an ninh mạng và ~85% tỷ lệ dự phòng sinh học/y tế. Các bình luận chủ yếu mang tính chỉ trích: người dùng phàn nàn về các vấn đề chất lượng chưa được giải quyết ở các mô hình trước đó, thiếu quyền truy cập cho người dùng Pro và sự thoái lui trong văn phong. Một người bình luận kỹ thuật đã trích dẫn hướng dẫn kỹ thuật prompt của chính Anthropic cho Fable 5.1, lưu ý rằng mặc dù văn phong ít công thức hơn, nó có thể dày đặc hơn và có thể yêu cầu các hướng dẫn chống phong cách rõ ràng như “Vui lòng loại bỏ tất cả văn phong kiểu cách” (tài liệu).
Fable 5.1 đã tạo ra một bản mod Minecraft với giá 20 đô la (Hoạt động: 1596): Bài đăng tuyên bố Anthropic Fable 5.1, chạy qua khóa API ở chế độ agent atomic.chat, đã tạo ra một bản mod Fabric 1.21.1 Minecraft hoàn chỉnh từ hai tài liệu tham khảo video trên YouTube: một cảnh Naruto Kirin và một đoạn ngắn về mod railgun. Agent được cho là đã thực hiện phân tích video, viết mod, tạo tài sản Blender thông qua cầu nối Blender MCP, tạo mô hình súng/rồng và kết cấu, khởi chạy Minecraft để kiểm tra, sau đó áp dụng một lượt phản hồi; mức sử dụng được báo cáo là ~383,6k output token, chi phí API 20,54 đô la và tổng thời gian ~1 giờ. Bản mod kết quả đã được phát hành trên GitHub, mặc dù video demo được liên kết trên Reddit không thể truy cập được từ URL bên ngoài do lỗi 403 Forbidden. Các bình luận hàng đầu chủ yếu là phản ứng phi kỹ thuật bày tỏ sự ngạc nhiên trước chi phí thấp và khả năng của nó, ví dụ: “20 đô la… tôi thích nó” và “fable thật là quái vật”. Không có cuộc tranh luận kỹ thuật thực chất nào xuất hiện trong các bình luận được cung cấp.
2. Gemini 3.8 Flash và các tuyên bố về suy luận của OpenAI Astra
Điểm chuẩn Gemini 3.8 Flash (Hoạt động: 1186): Hình ảnh là một bảng điểm chuẩn kỹ thuật: “Điểm chuẩn Gemini 3.8 Flash” so sánh Gemini 3.8 Flash với Gemini 3.7 Flash, Claude Opus/Sonnet 5 và các biến thể GPT-5.6. Nó nêu bật Gemini 3.8 Flash là một mô hình chi phí thấp ở mức 0,75 đô la đầu vào / 3,75 đô la đầu ra trên mỗi 1 triệu token trong khi được cho là dẫn đầu hoặc ngang bằng với một số điểm chuẩn về agent, suy luận, pháp lý/tài chính, tầm nhìn và sinh học; Claude Opus 5 vẫn dẫn đầu một số điểm chuẩn lập trình/agent nặng hơn như DeepSWE, Terminal-bench 4.0 và OSWorld-2.0. Người bình luận tập trung vào khoảng cách giá/hiệu suất rõ ràng, lập luận rằng các mô hình lớp Flash có thể đang xâm lấn vào các trường hợp sử dụng trước đây dành riêng cho các mô hình tiên phong đắt tiền. Một số người dùng cũng báo cáo rằng Gemini 3.8 Flash cho cảm giác nhanh hơn 3.7 Flash và khen ngợi nó cho các tác vụ không liên quan đến lập trình/tìm kiếm nặng, đồng thời yêu cầu thêm các ấn tượng về lập trình thực tế.
nếu đúng thì openai đã tạo ra một bước đột phá cấp độ o1 khác (Hoạt động: 1100): Một bài đăng trên Reddit tuyên bố, dựa trên một ảnh chụp màn hình/báo cáo được cho là của OpenAI, rằng họ đã huấn luyện một mô hình được gọi là “Astra” để thực hiện suy luận trong không gian tiềm ẩn (latent-space reasoning)—tức là tính toán trung gian không hoàn toàn được ngoại hóa dưới dạng chuỗi suy nghĩ ngôn ngữ tự nhiên (ảnh). Tiền đề kỹ thuật là suy luận trong các biểu diễn ẩn/liên tục có thể hiệu quả và biểu cảm hơn các dấu vết cấp token dài dòng, đặc biệt đối với các tác vụ phi ngôn ngữ như suy luận không gian. Người bình luận lưu ý các hoạt động nghiên cứu liên quan từ năm 2024 cộng với lợi ích tiềm năng cho các mô hình nhỏ hơn/cục bộ nơi các dấu vết suy luận dài rất tốn kém. Người bình luận chia làm hai phe: nhiệt tình với việc triển khai suy luận tiềm ẩn của mô hình tiên phong và lo ngại về khả năng diễn giải/an toàn: một người coi đó là việc cung cấp cho mô hình một “độc thoại nội tâm”, trong khi người khác lập luận rằng việc để các mô hình “suy nghĩ trong im lặng” có thể làm trầm trọng thêm sự thiếu minh bạch vốn đã kém so với chuỗi suy nghĩ bằng tiếng Anh.
3. Giới hạn gói Anthropic Claude và quyền truy cập Pro
Theo các tài liệu nội bộ của chính họ trong một vụ kiện chống lại Anthropic tiết lộ, gói sử dụng 20x thực tế chỉ cho phép sử dụng nhiều hơn 6 lần. (Hoạt động: 1397): Hình ảnh (liên kết) hiển thị một bảng nội bộ được cho là của Anthropic từ một vụ kiện so sánh giới hạn sử dụng Claude Sonnet 4: Pro ở mức 40–80 giờ/tuần, Max 5x ở mức 140–280 giờ/tuần và Max 20x chỉ ở mức 240–480 giờ/tuần. Ý nghĩa kỹ thuật là cấp “20x” được quảng cáo được trình bày là sử dụng gấp khoảng 6 lần Pro, không phải là hệ số nhân 20x theo nghĩa đen, trong khi “Max 5x” cũng gần với 3,5 lần Pro theo các con số trong bảng. Người bình luận tập trung vào sự khác biệt giữa nhãn tiếp thị và quy mô hạn ngạch thực tế, với một số gợi ý rằng nhiều tài khoản Pro có thể mang lại giá trị tốt hơn. Những người khác đặt câu hỏi về nguồn gốc, lưu ý rằng bài đăng phụ thuộc rất nhiều vào tính xác thực và bối cảnh của vụ kiện/tài liệu nội bộ được cáo buộc.
Anthropic thực sự dường như không còn coi trọng những người đăng ký 20 đô la của mình nữa (Hoạt động: 1343): Bài đăng lập luận rằng gói Claude Pro 20 đô la/tháng của Anthropic đang mất giá trị nếu các mô hình Claude hàng đầu hoặc các bản nâng cấp lớn được dành riêng cho các gói giá cao hơn, ngay cả khi người dùng trả phí thấp hơn nhận được quyền truy cập hào phóng vào các mô hình yếu hơn. Tác giả nói rằng họ muốn giới hạn tốc độ nghiêm ngặt—ví dụ: 20 tin nhắn/ngày—trên mô hình Claude tốt nhất thay vì bị loại trừ hoàn toàn, và so sánh điều này một cách bất lợi với kỳ vọng rằng OpenAI Plus có thể tiếp tục cung cấp cho người dùng 20 đô la quyền truy cập vào các khả năng hàng đầu mới thông qua ChatGPT Plus, trong khi Anthropic phân đoạn quyền truy cập thông qua các gói Claude. Các bình luận hàng đầu nhìn chung là hoài nghi thay vì kỹ thuật: người dùng tuyên bố gói 20 đô la chủ yếu là phễu chuyển đổi, rằng người đăng ký đóng vai trò là bộ đệm huấn luyện/đánh giá và Anthropic ưu tiên khách hàng doanh nghiệp hoặc chi tiêu cao hơn người dùng Pro cá nhân.
Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.