smol.ai AI News
Điểm AI 92/100

Mô hình

Anthropic ra mắt bộ đôi Claude 5.1; OpenAI hé lộ Astra với khả năng an ninh mạng đột phá

(giờ Việt Nam)

Tóm tắt AI

Anthropic trình làng Claude Fable và Mythos 5.1 với hiệu suất lập trình vượt trội và giảm giá cache, trong khi OpenAI giới thiệu Astra - mô hình đạt chuẩn an ninh mạng 'Critical' với kiến trúc transformer vòng lặp mới.

Chính văn · Bản dịch AI

not much happened today | AINews

một ngày yên ắng.

Tin tức AI từ 31/8/2026 đến 1/9/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận/hủy nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

Phát hành Claude Fable 5.1 / Mythos 5.1 của Anthropic: cải thiện khả năng lập trình, giảm chi phí bộ nhớ đệm (cache) và tăng cường các biện pháp bảo mật

Astra của OpenAI và cuộc tranh luận về khả năng giám sát xung quanh độ sâu tái phát (recurrent depth)

Atlas của World Labs: mô hình hóa thế giới thống nhất cho việc tái tạo, điều khiển camera và real2sim

Qwen, GLM, RWKV và đà phát triển của các mô hình mở

Tác nhân (Agents), bộ khung (harnesses), bộ nhớ và nghiên cứu đánh giá

Các tweet hàng đầu (theo mức độ tương tác)

1. Cập nhật mô hình Qwen, DeepSeek và Gemma

deepseek-ai/DeepSeek-V4-Flash-Vision-Exp trên Hugging Face (Hoạt động: 918): DeepSeek dường như đã xuất bản deepseek-ai/DeepSeek-V4-Flash-Vision-Exp trên Hugging Face, được người dùng bình luận mô tả là một biến thể Flash thử nghiệm có khả năng thị giác. Một ghi chú kỹ thuật cho biết mô hình đầy đủ vẫn nặng khoảng 168 GB, sử dụng trọng số 4-bit gốc, do đó phù hợp với các dàn máy có RAM/VRAM 256 GB. Người dùng coi đây là một phần của làn sóng phát hành mô hình dày đặc bất thường trong tháng 8, cùng với các sản phẩm như DS4 Pro 0813, Qwen3.8, GLM5.3 và những mô hình khác. Phản ứng chung rất hào hứng, với việc người dùng cho biết họ đã đặt thông báo cho các đợt phát hành mô hình mới.

MTP đã được phát hành cho Qwen3.8-Flash-Next-GGUF (Hoạt động: 651): Hỗ trợ/tệp tin MTP (dự đoán/soạn thảo đa token) cho Qwen3.8-Flash-Next-GGUF đã được làm nổi bật, với hướng dẫn kiểm tra trỏ đến PR của nhánh llama.cpp từ Unsloth (unslothai/llama.cpp#144) và README về MTP của mô hình trên Hugging Face (unsloth/Qwen3.8-Flash-Next-GGUF). Một người bình luận lưu ý rằng một tối ưu hóa llama.cpp thượng nguồn liên quan đã được hợp nhất trong ggml-org/llama.cpp#28123, báo cáo sự thay đổi về thông lượng từ không có dự thảo: 108 tok/s thành MTP trước đó: 123 tok/s (mã), 83 tok/s (văn bản) và sau đó: 183 tok/s (mã), 144 tok/s (văn bản), với lưu ý quan trọng là MTP trước khi hợp nhất chậm hơn so với không soạn thảo đối với văn bản. Người dùng chủ yếu tập trung vào mức độ sẵn sàng của việc triển khai: một người hỏi liệu các vấn đề về offload SSD đã được giải quyết chưa, trong khi người khác đặt câu hỏi liệu các tệp MTP đã có sẵn từ vài ngày trước đó hay chưa.

Các mô hình Gemma mới trên Arena AI (Hoạt động: 992): Một bài đăng trên Reddit báo cáo đã thấy các mô hình thuộc dòng Gemma xuất hiện trên Arena AI / Chatbot Arena, dựa trên ảnh chụp màn hình được chia sẻ, và đặt câu hỏi liệu đây có phải là dấu hiệu của Gemma 5 hoặc một biến thể sắp ra mắt khác hay không. Mối quan tâm kỹ thuật duy nhất được nêu ra trong các bình luận hàng đầu là kiến trúc Gemma hiện tại được coi là nặng về KV-cache, tiêu tốn đáng kể VRAM cho việc suy luận ngữ cảnh dài, và người dùng cho rằng bộ nhớ đệm này “không lượng tử hóa tốt” so với các thiết kế tiết kiệm bộ nhớ hơn. Người dùng nhìn chung rất hào hứng về khả năng phát hành Gemma mới, với một người nói rằng họ đã “trải qua cảm giác thiếu thốn kể từ tháng 8”. Chỉ trích chính là chi phí triển khai thực tế: người dùng hy vọng Google sẽ cải thiện hiệu quả KV-cache trong mô hình tiếp theo.

2. Quy trình làm việc của tác nhân đa phương thức cục bộ (Local Multimodal Agent)

GLM 5.3 và GLM 5.3 Flash chạy cục bộ trên RTX PRO 6000 WS và xây dựng một căn penthouse bằng BlenderMCP (Hoạt động: 827): Tác giả đã thử nghiệm GLM 5.3 Flash và GLM 5.3 đầy đủ cục bộ thông qua cộng đồng BlenderMCP trên các GPU RTX PRO 6000 WS thuê với định dạng Q4: bản Flash yêu cầu ~190–200GB cộng với khoảng trống ngữ cảnh trên 4 GPU, trong khi GLM 5.3 đầy đủ yêu cầu ~450–470GB trên 6 GPU. Trong tác vụ tạo căn penthouse với các kích thước kiến trúc/ràng buộc vật liệu cụ thể, bản Flash tạo ra 811 đối tượng trong 38 phút 52 giây với 36K token đầu ra và 9 lỗi công cụ, trong khi GLM 5.3 đầy đủ tạo ra 847 đối tượng trong 40 phút 43 giây với 112K token đầu ra và 8 lỗi; đáng chú ý, GLM đầy đủ đã dành 21 phút 55 giây/82K token để suy luận trước khi tạo đối tượng đầu tiên. Phép đo raycast hậu kiểm cho thấy bản Flash mô hình hóa chính xác khoảng trống cao gấp đôi 9m x 8m, trong khi GLM đầy đủ xây dựng nó thành 9m x 4.5m mặc dù báo cáo là 9m x 8m, cho thấy hiệu quả tác vụ và độ bám sát không gian tốt hơn từ bản Flash trong thí nghiệm đơn lẻ này. Người dùng chia rẽ giữa sự hào hứng dành cho GLM 5.3 Flash—một người gọi nó là “thế hệ tiếp theo so với bản 5.3 lớn hơn”—và sự chỉ trích về chất lượng hình học của các đầu ra Blender, ví dụ như cầu thang/ống nước lơ lửng và cấu trúc cảnh nhìn chung kém. Một bình luận cũng coi kết quả này là ví dụ về vai trò ngày càng tăng của các quy trình làm việc AI có hỗ trợ thị giác trong các công cụ 3D.

Đừng bỏ qua hỗ trợ Thị giác (Vision) cho lập trình! (Hoạt động: 413): Bài đăng lập luận rằng việc kích hoạt hỗ trợ thị giác/đa phương thức trong một tác nhân lập trình cục bộ cải thiện đáng kể quy trình phát triển UI/web: sau khi thay đổi mã, mô hình có thể tự động chụp ảnh màn hình, kiểm tra trực quan trang đã hiển thị, phát hiện các lỗi UI/runtime thầm lặng mà các bài kiểm tra hoặc nhật ký không hiển thị, và lặp lại cho đến khi trạng thái trực quan khớp với yêu cầu. Thiết lập được báo cáo là Hermes chạy Qwen3.8-27B-UD-Q5_K_XL trên RTX 5090, với người dùng lưu ý một tùy chọn tiết kiệm VRAM: sử dụng --no-mmproj-offload để giữ các lớp chiếu đa phương thức/thị giác trong CPU/RAM, đánh đổi việc xử lý hình ảnh chậm hơn để lấy thêm bộ nhớ GPU cho ngữ cảnh hoặc lượng tử hóa lớn hơn. Người dùng cho rằng lợi ích chủ yếu dành riêng cho frontend/UI; công việc hướng backend ít thấy lợi thế từ thị giác. Có sự đồng thuận rằng thị giác từ lâu đã hữu ích, và việc offload ngăn xếp thị giác sang CPU thường là một sự đánh đổi độ trễ chấp nhận được cho việc xác minh ảnh chụp màn hình không thường xuyên.

SlopTV: một luồng phát trực tiếp vô tận các nội dung AI "rác" được tạo từ bình luận chat trên YouTube, Minimax H3 trên 2x5090 (Hoạt động: 464): SlopTV là một đường ống phát trực tiếp YouTube hoàn toàn cục bộ, nơi các gợi ý từ chat trực tiếp được LLM mở rộng thành các gợi ý video có cấu trúc khoảng 400 từ, được kết xuất thành các clip 15 giây với MiniMax H3 trên 2× RTX 5090, sau đó phát lại vào cùng luồng đó; khi chat nhàn rỗi, hệ thống tự tạo gợi ý. Việc triển khai sử dụng trọng số mở H3 (66GB trên ổ đĩa), bao gồm mô hình khuếch tán đã cắt tỉa int8 19.5GB và bộ mã hóa văn bản NVFP4 14.6GB vượt quá 32GB VRAM, yêu cầu offload VRAM ComfyUI; thông lượng là ~90 giây/clip/GPU, tạo ra một clip mới khoảng mỗi 45 giây. Các phát hiện kỹ thuật đáng chú ý: sự tuân thủ gợi ý của H3 tốt nhất ở 352p (352×608 được nâng cấp lên 1080p), ComfyUI có thể được nhúng bằng cách giả lập các giả định máy chủ, đường dẫn phát trực tuyến gRPC không có tài liệu của YouTube yêu cầu sửa/biên dịch các proto trong khi hạn ngạch REST có thể bị cạn kiệt trong ~30 phút, và các LLM nhỏ bị quá khớp (overfit) với các ví dụ gợi ý—repo: shuttie/SlopTV, lấy cảm hứng từ infiniteslop.

3. Thực tế phần cứng LLM cục bộ bộ nhớ cao

Những LLM nào sẽ chạy trên Mac Mini và Studio (Hoạt động: 568): Hình ảnh là một biểu đồ tương thích kỹ thuật, “Cái gì chạy trên Mac nào”, từ một video ước tính những LLM nào phù hợp với các bậc RAM của Mac mini và Mac Studio theo các giả định lượng tử hóa. Nó cho thấy các mô hình nhỏ hơn như Qwen 3.8 27B có thể phù hợp với các máy Mac mini/Studio có bộ nhớ cao hơn, trong khi các mô hình lớn hơn nhiều như Qwen 3.8 2.4T và Kimi K3 ~1.4TB thường vượt quá giới hạn bộ nhớ Apple Silicon trên một máy đơn lẻ trừ khi được lượng tử hóa mạnh hoặc chạy trên các thiết lập RAM rất cao/phân cụm. Người dùng nhấn mạnh rằng tính hữu ích của biểu đồ phụ thuộc rất nhiều vào mức độ lượng tử hóa—một số cảnh báo không nên giả định bất cứ thứ gì dưới q4 là chấp nhận được—và các cửa sổ ngữ cảnh lớn, ví dụ 128k, làm tăng đáng kể yêu cầu bộ nhớ. Một người bình luận lập luận rằng nhiều Mac Studio được phân cụm qua Thunderbolt 5/RDMA có khả năng chạy các mô hình quy mô biên mở lên tới khoảng 3T tham số ở q4, có thể với hiệu quả năng lượng cao.

Tại sao mọi người dường như có rất nhiều VRAM? (Hoạt động: 1115): Bài đăng hỏi tại sao các cộng đồng LLM/AI cục bộ dường như bình thường hóa các hệ thống có hàng trăm GB RAM/VRAM, chẳng hạn như các máy lớp DGX Spark kiểu NVIDIA, trong khi các thiết lập tiêu dùng điển hình gần với 8–16 GB VRAM GPU và 16–32 GB RAM hệ thống. Giải thích kỹ thuật từ các bình luận phần lớn là do thiên kiến lựa chọn/mẫu: các bản dựng VRAM cao được đại diện quá mức vì chúng ấn tượng và được đánh giá cao, trong khi hầu hết những người có sở thích chạy các mô hình lượng tử hóa/nhỏ hơn trên các GPU phổ thông với 8–12 GB VRAM. Người dùng coi phần cứng AI đắt tiền là một khoản chi phí sở thích ngách hoặc một khoản đầu tư nghề nghiệp cho các nhà phát triển phần mềm đang cố gắng xây dựng chuyên môn về AI/LLM. Sự đồng thuận là các dàn máy AI cục bộ trị giá hàng ngàn euro không phải là xu hướng chủ đạo; chúng là một nhóm thiểu số ồn ào được khuếch đại bởi sự tập trung của diễn đàn.

Tóm tắt Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

1. Phát hành Claude Fable 5.1 và sự giám sát điểm chuẩn

Giới thiệu Claude Fable 5.1 và Claude Mythos 5.1 (Hoạt động: 1175): Anthropic đã công bố Claude Fable 5.1 và Claude Mythos 5.1, định vị Fable 5.1 là một mô hình lập trình/công việc tri thức cải tiến với hiệu suất tác vụ dài hạn mạnh mẽ hơn: 52.6% trên Terminal-Bench-Science 0.1 so với hơn gấp đôi Fable 5, và 55.8% trên Terminal-Bench 4.0 so với 42.0% cho Fable 5 (thông báo). Các thay đổi về chi phí/an toàn được báo cáo bao gồm đọc bộ nhớ đệm rẻ hơn 75%, ước tính giảm chi phí khối lượng công việc điển hình khoảng ~25% và lên đến 45% cho các khối lượng công việc mang tính tác nhân cao, cộng với ít hơn ~60% các từ chối an ninh mạng dương tính giả và tỷ lệ dự phòng thấp hơn ~85% đối với các câu hỏi cơ bản về sinh học/y tế. Fable 5.1 hiện đã có sẵn rộng rãi, trong khi Mythos 5.1 bị giới hạn trong các chương trình truy cập tin cậy cho các trường hợp sử dụng phòng thủ mạng và khoa học sự sống. Các bình luận chủ yếu mang tính chỉ trích thay vì tập trung vào điểm chuẩn: người dùng phàn nàn về các vấn đề chưa được giải quyết trong các bậc/mô hình Claude khác, đặc biệt là “Opus 5” tạo ra các phản hồi lan man không liên quan và người dùng Pro bị bỏ rơi. Một người bình luận kỹ thuật đã trích dẫn hướng dẫn gợi ý của chính Anthropic cho Fable 5.1, lập luận rằng văn bản của nó vẫn cần các gợi ý chống phong cách rõ ràng như “Vui lòng xóa tất cả văn bản kiểu cách” và đặt câu hỏi tại sao chất lượng viết lại cần sự giảm thiểu (tài liệu).

Những điểm chuẩn này là gì 💀 (Hoạt động: 833): Hình ảnh (liên kết) dường như là một bảng điểm chuẩn cho một mô hình kiểu Anthropic hư cấu/tương lai, “Claude Fable 5.1”, so sánh nó với “Fable 5”, “Opus 5” và “GPT-5.6 Sol”. Ý nghĩa kỹ thuật của nó chủ yếu là châm biếm/hoài nghi: các điểm chuẩn được liệt kê bao gồm các tên đáng ngờ hoặc tương lai như Terminal-Bench 4.0, CursorBench 3.2.0 và bản phát hành OSWorld tháng 8 năm 2026, khớp với phản ứng của tiêu đề bài đăng: “Những điểm chuẩn này là gì 💀” thay vì ghi lại một đánh giá mô hình có thể kiểm chứng. Người dùng đặt câu hỏi về độ tin cậy của khung điểm chuẩn, lưu ý rằng bảng này ngụ ý hiệu suất tương đối kỳ lạ — ví dụ: “Opus 5 đánh bại Fable 5 trên hầu hết mọi thứ” — và phản ứng hoài nghi với những bước nhảy lớn như 24.7 → 52.6 là kịch tính một cách khó tin.

2. Tranh cãi về giới hạn sử dụng gói Claude Max

Claude Max “20x” chỉ áp dụng cho cửa sổ 5 giờ. Sử dụng hàng tuần trên gói $200 gấp 2 lần gói $100 (Hoạt động: 2025): Hình ảnh là một ảnh chụp màn hình phi kỹ thuật của một tweet chỉ trích thông điệp về giá cả/sử dụng của Claude Max của Anthropic: hệ số “20x” được quảng cáo được cho là chỉ áp dụng cho cửa sổ sử dụng 5 giờ luân phiên, trong khi gói Max $200/tháng chỉ cung cấp gấp khoảng 2 lần mức sử dụng hàng tuần so với gói $100/tháng. Ảnh chụp màn hình được liên kết ở đây: i.redd.it/r1sy7gcrkomh1.png. Người dùng lập luận rằng việc dán nhãn gói là gây hiểu lầm, với một người tuyên bố bậc Max “20x” có thể mang lại mức sử dụng hàng tuần gần 1.7x hơn là 2x, khiến việc đăng ký hai gói $100 trở thành một giá trị tốt hơn. Một số bình luận kêu gọi tiết lộ rõ ràng hơn về ngân sách sử dụng theo các đơn vị có thể so sánh, chẳng hạn như chi tiêu API tương đương, thay vì các hệ số mơ hồ.

Theo các tài liệu nội bộ của chính họ, một vụ kiện chống lại Anthropic tiết lộ rằng gói sử dụng 20x thực tế chỉ cho phép sử dụng nhiều hơn 6 lần. (Hoạt động: 1350): Hình ảnh (JPEG) là một bảng cáo buộc, dựa trên các email nội bộ của Anthropic xuất hiện trong một vụ kiện, rằng Claude Max 20x không cung cấp mức tăng sử dụng gấp 20 lần theo nghĩa đen so với Claude Pro cho Sonnet 4. Nó tuyên bố Pro cho phép 40–80 giờ/tuần, trong khi Max 20x chỉ cho phép 240–480 giờ/tuần—khoảng gấp 6 lần mức sử dụng Pro, không phải mức 800–1600 giờ/tuần dự kiến như hệ số được quảng cáo ngụ ý. Người dùng tỏ ra hoài nghi và thất vọng, với một số người nói rằng họ đã nghi ngờ “20x” không phải là nghĩa đen và những người khác đặt câu hỏi liệu nhiều tài khoản Claude Pro rẻ hơn có vượt trội hơn Max hay không. Một mối quan tâm đáng chú ý là sự thiếu hụt nguồn chính rõ ràng cho vụ kiện/tài liệu nội bộ được tuyên bố.

Đây không nên là một tính năng độc quyền và siêu cao cấp (Hoạt động: 1242): Hình ảnh là một cửa sổ bật lên thông báo của Claude về “Claude Fable 5.1”, nêu rõ rằng các mô hình Fable yêu cầu tín dụng sử dụng trên các gói Pro; tính năng được làm nổi bật là “Viết bằng ngôn ngữ đơn giản và bám sát những gì bạn đã yêu cầu.” Bài đăng coi đây là một lời phàn nàn phi kỹ thuật/về giá sản phẩm: việc tuân theo hướng dẫn cơ bản và viết rõ ràng đang được tiếp thị như một khả năng cao cấp độc quyền thay vì hành vi mô hình cơ bản. Người dùng chỉ trích Anthropic vì được cho là đã định vị “viết rõ ràng” như một yếu tố khác biệt trả phí trong khi các mô hình cũ/cao cấp hơn như Opus được coi là có vấn đề về viết hoặc sự vâng lời. Một số phản hồi coi thông báo này là vô lý hoặc giống meme, đùa rằng đó là một cải tiến so với các mô hình “viết bằng ngôn ngữ khó hiểu và không vâng lời bạn.”

3. Quy mô ChatGPT và Quy định DSA của EU

Ủy ban EU (Hoạt động: 2229): Hình ảnh không phải là meme; đó là ảnh chụp màn hình thông báo của Ủy ban Châu Âu chỉ định ChatGPT là Công cụ tìm kiếm trực tuyến rất lớn (VLOSE) và Reddit/Roblox là Nền tảng trực tuyến rất lớn (VLOP) theo Đạo luật Dịch vụ Kỹ thuật số (DSA) của EU. Việc chỉ định này kích hoạt cửa sổ tuân thủ 4 tháng cho các nghĩa vụ DSA bổ sung như đánh giá rủi ro hệ thống, các biện pháp giảm thiểu, kiểm toán độc lập, báo cáo minh bạch và quyền truy cập dữ liệu của nhà nghiên cứu/cơ quan quản lý; hình ảnh: i.redd.it/aystuw0qzpmh1.jpeg. Người dùng tập trung vào việc các “quy định bổ sung” thực sự yêu cầu những gì, với một số hoài nghi rằng tác động chính của EU đối với lĩnh vực công nghệ là điều tiết các nền tảng lớn chủ yếu của Mỹ. Một người bình luận cũng đặt câu hỏi về ranh giới phân loại bằng cách hỏi điều gì được coi là “Công cụ tìm kiếm trực tuyến nhỏ”.

Tại sao ChatGPT thống trị chỉ số sử dụng? (Hoạt động: 1034): Đồ họa thông tin được liên kết (hình ảnh) tuyên bố ChatGPT có 5.3 tỷ lượt truy cập web hàng tháng vào tháng 6 năm 2026, vượt qua 14 công cụ AI được liệt kê tiếp theo cộng lại (4.7 tỷ), mặc dù bài đăng lưu ý các khả năng được cảm nhận rộng rãi tương tự và định giá cao cho OpenAI và Anthropic. Biểu đồ xếp hạng Gemini (1.1 tỷ), Claude (968 triệu), Canva (760 triệu), Google Translate (343 triệu) và DeepSeek (319 triệu) sau ChatGPT, vì vậy câu hỏi kỹ thuật ít liên quan đến sự ngang bằng về điểm chuẩn hơn là về phân phối, giới hạn sản phẩm, UX mặc định và hiệu ứng phễu trong sử dụng AI tiêu dùng. Người dùng cho rằng sự dẫn đầu của ChatGPT chủ yếu là do lợi thế của người đi đầu, thương hiệu/UI mạnh hơn và đặc biệt là các giới hạn sử dụng miễn phí/trả phí dễ dàng hơn; một người dùng đối lập việc sử dụng Codex Pro gần như liên tục với giá $100/tháng với niềm tin rằng họ sẽ nhanh chóng đạt đến giới hạn của Claude ngay cả ở mức $200/tháng.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Anthropic ra mắt bộ đôi Claude 5.1; OpenAI hé lộ Astra với khả năng an ninh mạng đột phá | AIHOT.vn