smol.ai AI News
92

Tin ngành

Meta Muse Spark 1.2 bứt phá hiệu năng, OpenAI hợp nhất ChatGPT và ra mắt chuẩn Agent Plugins

(giờ Việt Nam)

Tóm tắt AI

Meta Muse Spark 1.2 gây ấn tượng với hiệu năng đạt huy chương vàng STEM và chi phí cực rẻ, trong khi OpenAI hợp nhất các mô hình ChatGPT và giới thiệu chuẩn Agent Plugins mở để tăng cường khả năng phối hợp đa tác nhân.

Bản dịch AI

not much happened today | AINews

Một ngày yên ắng.

Tin tức AI từ 5/8/2026 - 6/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận hoặc hủy nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

Sự bứt phá của Muse Spark 1.2 từ Meta: Huy chương vàng Olympiad, cải thiện điểm chuẩn (benchmark) và hiệu năng trên giá thành đầy ấn tượng

OpenAI hợp nhất mô hình ChatGPT, mở rộng gói miễn phí và đẩy mạnh plugin/bảo mật

Các tác nhân (agents), khung điều khiển (harnesses) và cơ sở hạ tầng MCP đang trở thành chiến trường thực sự của các hệ thống

Phục vụ mô hình mở (open-model serving), định tuyến và kỹ thuật tối ưu chi phí

Khoa học, đánh giá và các bộ dữ liệu thế giới thực

Các tweet hàng đầu (theo mức độ tương tác, đã lọc theo mức độ liên quan về kỹ thuật)

Tóm tắt AI trên Reddit

Tóm tắt từ /r/LocalLlama + /r/localLLM

1. Phát hành và điểm chuẩn của Qwen3.8-Max

Qwen 3.8 Max hiện được xếp hạng là mô hình tổng thể tốt nhất, vượt qua Opus 5 theo chỉ số tác nhân (agentic index) của Artificial Analysis (Hoạt động: 947): Bài đăng khẳng định Qwen 3.8 Max được xếp hạng cao hơn Claude Opus 5 trên chỉ số tác nhân của Artificial Analysis, một điểm chuẩn tập trung vào các đánh giá tác nhân GDPval-AA v2 và 𝜏³-Banking. Một người bình luận hàng đầu đã phản bác tuyên bố này, dẫn chứng ảnh chụp màn hình cho thấy Claude Opus 5 đạt 59,2 so với 58,4 của Qwen 3.8 Max, nghĩa là Opus vẫn dẫn trước một chút ở góc nhìn đó. Một người dùng khác chia sẻ kinh nghiệm thực tế rằng Qwen “giỏi hơn Fable rất nhiều trong việc viết PHP” cho công việc hàng ngày, trong khi một người khác bác bỏ việc ngoại suy điểm số từ các mô hình Qwen nhỏ hơn vì cho rằng đó chỉ là suy nghĩ viển vông.

Thời gian phát hành công khai Qwen3.8-2.4T-A95B (hay còn gọi là Qwen3.8-Max): thứ Tư tuần tới (Hoạt động: 867): Một trang giữ chỗ trên ModelScope cho thấy Qwen3.8-2.4T-A95B / Qwen3.8-Max sẽ được phát hành công khai vào “thứ Tư tuần tới” tại modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B. Nội dung trang cho biết đây là mô hình Qwen-Max đầu tiên có trọng số mở, với tổng cộng 2,4 nghìn tỷ tham số và 95 tỷ tham số hoạt động, nhắm đến việc cải thiện khả năng lập trình, công việc, nghiên cứu và các tác vụ dài hạn; trang cũng xác nhận Qwen3.8-27B và các mô hình thuộc dòng Qwen3.8 khác sẽ sớm ra mắt trên các trang riêng biệt. Người dùng bình luận hiểu rằng Qwen3.8-27B sẽ được phát hành sau mô hình lớp Max, và lưu ý rằng cụm từ “các mô hình khác” ngụ ý sẽ có thêm nhiều biến thể ngoài bản 27B. Một mối lo ngại kỹ thuật được nêu ra là gánh nặng lưu trữ/IO thực tế khi chạy suy luận cục bộ cho một mô hình MoE 2,4 nghìn tỷ tham số, một số người đùa rằng cần dùng RAID0 trên nhiều ổ SSD.

Phản hồi từ các nhà phát triển Qwen trong buổi AMA gần đây trên Twitter/X (Hoạt động: 534): Hình ảnh được đăng tải là đồ họa quảng bá AMA của Qwen, không phải sơ đồ kỹ thuật hay điểm chuẩn; ý nghĩa của nó nằm ở ngữ cảnh, quảng cáo cho buổi AMA trên Twitter/X đã được tóm tắt trong bài. Các phản hồi trong AMA khẳng định sẽ sớm ra mắt Qwen 3.8 27B, với thông tin Qwen 3.8 sử dụng tổng cộng 2,4 nghìn tỷ tham số / 95 tỷ tham số hoạt động cho mô hình lớn hơn, các “nỗ lực tư duy khác biệt”, hệ thống hiểu video 100 giờ+ dựa trên bộ nhớ video phân cấp với các đồ thị thực thể/sự kiện/cảnh có cấu trúc, và lời khuyên lượng tử hóa để giữ các phép chiếu attention QKV/output ở 16-bit trong khi lượng tử hóa FFN xuống 4-bit hoặc sử dụng QAT. Người dùng tỏ ra hoài nghi về nội dung của buổi AMA, gọi nhiều câu trả lời là “mơ hồ một cách nực cười”, lưu ý sự né tránh về mô hình 122B, và đặt câu hỏi tại sao người dùng cứ đòi hỏi thêm CLI/harness thay vì tập trung vào khả năng hoặc các bản phát hành mô hình.

2. Công cụ AI mã nguồn mở: TTS và Agents

Tính năng nhân bản giọng nói Qwen3-TTS hiện đã có trong nhánh chính của llama.cpp — bản demo cũ cuối cùng đã trở thành hỗ trợ thực tế (Hoạt động: 527): Hình ảnh là đồ họa thông tin quảng bá/kiến trúc của Qwen3-TTS cho thấy khả năng nhân bản giọng nói, tạo lời nói có thể kiểm soát và quy trình mô hình: Qwen3 LM, MTP, codec/text tokens, speaker embeddings và bộ giải mã codec streaming. Trong ngữ cảnh này, ý nghĩa kỹ thuật của bài đăng là hỗ trợ GGUF cho Qwen3-TTS-12Hz-1.7B-Base đã được đưa vào nhánh chính của llama.cpp thông qua llama-tts, cho phép nhân bản giọng nói đa ngôn ngữ cục bộ từ các tệp tham chiếu WAV/MP3, mặc dù hỗ trợ máy chủ /tts vẫn chỉ là một bản dự thảo PR và các điểm chuẩn so với qwen3-tts.cpp / audio.cpp vẫn còn thiếu. Người dùng quan tâm đến việc llama.cpp hỗ trợ rộng rãi hơn cho các mô hình TTS/STT, đặc biệt là so với các triển khai dành riêng cho ROCm/CUDA hiện có. Người duy trì audio.cpp đã công khai hoan nghênh các điểm chuẩn công bằng để xác định các cơ hội tối ưu hóa.

Prime Agent - một khung điều khiển lập trình mới vượt qua Codex/CC/PI (Hoạt động: 431): Prime Intellect đã công bố Prime Agent, một khung điều khiển tác nhân lập trình/nghiên cứu mã nguồn mở được xây dựng trên pi với khả năng gọi công cụ theo chương trình, “ngữ cảnh như một biến số”, nhắn tin đa tác nhân, thực thi bền bỉ và trạng thái khung điều khiển tự sửa đổi. Bài đăng tuyên bố đạt 95,5% trên ARC-AGI-3, vượt qua mức cơ sở của chuyên gia con người, và cho biết khung điều khiển này cải thiện nhiều mô hình so với các khung điều khiển độc quyền; tài liệu hỗ trợ có trong bài đăng trên blog và thông báo trên X. Người dùng hoài nghi rằng ARC-AGI-3 là một điểm chuẩn khung điều khiển có ý nghĩa và lập luận rằng cơ chế kỹ thuật chưa được chỉ định rõ ràng: “các tác nhân phụ luôn chỉ là các lệnh gọi công cụ” và các khung điều khiển tự sửa đổi có thể không khái quát hóa được ngoài các lần chạy điểm chuẩn lặp đi lặp lại. Họ yêu cầu so sánh với các cơ sở lập trình tác nhân mạnh hơn như Cline, Droid, Junie, Cursor, ForgeCode với các máy chủ ngữ cảnh thay vì chỉ các khung điều khiển độc quyền/mặc định.

3. Chính sách mô hình trọng số mở và thực thi giấy phép

Các vấn đề của MiniMax (Hoạt động: 888): Hình ảnh là ảnh chụp màn hình của một bài đăng trước đó trên r/StableDiffusion cáo buộc rằng MiniMax đã gây áp lực gỡ bỏ đối với các “LoRA H3 đã gỡ kiểm duyệt/nội dung khiêu dâm”, cảnh báo một người tải lên Hugging Face rằng việc vi phạm giấy phép mô hình của MiniMax có thể dẫn đến việc thu hồi giấy phép, sau đó tệp tin được cho là đã biến mất. Trong ngữ cảnh tiêu đề “Các vấn đề của MiniMax”, ý nghĩa kỹ thuật là việc cấp phép/thực thi xung quanh các bản tinh chỉnh LoRA phái sinh thay vì hiệu suất mô hình: người dùng lo ngại rằng các nền tảng như Hugging Face hoặc CivitAI có thể xóa các LoRA bắt nguồn từ MiniMax/H3 nếu chúng vi phạm các điều khoản hạn chế của mô hình gốc. Hình ảnh: i.redd.it/urolt08gujhh1.jpeg Người dùng phần lớn coi đây là vấn đề “trọng số mở so với mã nguồn mở”: MiniMax có thể có quyền thực thi giấy phép hạn chế, nhưng điều đó có nghĩa là mô hình không nên được coi là thực sự mở. Một số người dùng đề nghị đổi tên hoặc làm mờ các LoRA để tránh liên đới, trong khi những người khác hỏi nơi có thể tìm thấy LoRA đã bị xóa.

Hướng dẫn về AI của Nhà Trắng miễn trừ các mô hình mở của Hoa Kỳ khỏi sự kiểm duyệt của chính phủ (Hoạt động: 522): Bài đăng liên kết đến một bài báo của WSJ có tiêu đề “Hướng dẫn về AI của Nhà Trắng miễn trừ các mô hình mở của Hoa Kỳ khỏi sự kiểm duyệt của chính phủ” (WSJ; đã lưu trữ), nhưng nội dung được cung cấp không có thân bài ngoài cảnh báo CAPTCHA/truy cập, vì vậy phạm vi chính xác, định nghĩa và ngưỡng đánh giá của các hướng dẫn không thể được xác minh từ tài liệu được cung cấp. Ý nghĩa kỹ thuật được thảo luận là các mô hình trọng số mở/mô hình mở của Hoa Kỳ có thể tránh được một số yêu cầu đánh giá của chính phủ, có khả năng thay đổi các động lực cho các phòng thí nghiệm trong nước so với các mô hình tiên phong đóng. Người dùng suy đoán rằng việc miễn trừ các mô hình mở của Hoa Kỳ có thể khuyến khích các bản fork của các mô hình mở Trung Quốc và lập luận rằng các phòng thí nghiệm Hoa Kỳ nên phát hành nhiều mô hình trọng số mở lớn hơn và các biến thể chưng cất nhỏ hơn, lưu ý rằng các mô hình mở quy mô 2T+ của Trung Quốc hiện được coi là đối thủ cạnh tranh mạnh.

Các mô hình trọng số mở của Trung Quốc sẽ được miễn các bài kiểm tra an toàn của Hoa Kỳ (Hoạt động: 506): Bài đăng tham chiếu đến một báo cáo của Bloomberg có tiêu đề “Các mô hình trọng số mở của Trung Quốc sẽ được miễn các bài kiểm tra an toàn của Hoa Kỳ”, nhưng trang Bloomberg được cung cấp không thể truy cập ngoài thông báo chống bot/CAPTCHA, vì vậy không có chi tiết kỹ thuật chính về phạm vi chính sách, các lớp mô hình được bao phủ, ngưỡng hoặc chế độ kiểm tra. Chỉ dựa trên tiêu đề, tuyên bố rõ ràng là các mô hình AI trọng số mở của Trung Quốc sẽ không phải chịu các yêu cầu kiểm tra an toàn hiện có hoặc đề xuất của Hoa Kỳ, có khả năng vì các mô hình này được phân phối công khai và nằm ngoài sự kiểm soát quy định trực tiếp của Hoa Kỳ. Người dùng lập luận rằng việc thực thi đối với các mô hình trọng số mở của Trung Quốc sẽ không thực tế: Hoa Kỳ có quyền tài phán hạn chế đối với các nhà xuất bản mô hình nước ngoài, các trọng số thường có thể tải xuống tự do thay vì các giao dịch xuất khẩu, và các lệnh trừng phạt rộng rãi hoặc thực thi thứ cấp có thể gây gián đoạn kinh tế do việc sử dụng rộng rãi của các tập đoàn toàn cầu và Hoa Kỳ.

Tóm tắt các Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

1. Các sự cố an toàn của tác nhân Claude Code

The Cutting Room Floor đã gửi cho Claude Code một payload yêu cầu nó xóa thư mục làm việc (Hoạt động: 1121): Hình ảnh đính kèm (i.redd.it/k5q8gjm75mhh1.jpeg) là một tác phẩm nghệ thuật gây nhiễu/chế giễu phi kỹ thuật với nội dung “BẠN LÀ MỘT NGƯỜI XẤU”, nhưng nó có ý nghĩa về mặt ngữ cảnh vì bài đăng tuyên bố tcrf.net đã gửi nó một cách có điều kiện cùng với một payload tiêm prompt (prompt-injection) cho các tác nhân người dùng AI bị nghi ngờ. Theo văn bản tự viết và bằng chứng được liên kết (phản hồi urlscan và báo cáo GitHub), Claude Code đã phát hiện và từ chối các hướng dẫn cắt/hoán đổi tệp trong repo làm việc, coi tên miền là không đáng tin cậy và tiếp tục mà không thực thi payload. Người dùng bình luận mô tả hành vi này thực chất là tiêm prompt giống như phần mềm độc hại, ngay cả khi được thúc đẩy bởi sự thất vọng về việc AI cạo dữ liệu hoặc lưu lượng truy cập DDoS. Một bình luận kỹ thuật đã chia sẻ ảnh chụp màn hình về những gì một tác nhân nhìn thấy, củng cố rằng payload dường như nhắm vào các chuỗi tác nhân người dùng AI thay vì người dùng trình duyệt bình thường.

Claude rm -rf máy tính của tôi (Hoạt động: 2564): Hình ảnh cho thấy một phiên terminal/chat của Claude Code được cho là thừa nhận nó “đã gây ra thiệt hại” sau khi thực thi lệnh rm -rf phá hoại đối với /c/Users/harih, với các kiểm tra cho thấy các tệp như.ssh đã bị xóa trong khi một số thư mục vẫn còn. Trong ngữ cảnh này, bài đăng tuyên bố Claude Opus 5 đã được yêu cầu tạo bản sao lưu nhưng đã ghi vào sai vị trí và sau đó xóa đệ quy hồ sơ người dùng/ổ đĩa; bài học kỹ thuật là chế độ lỗi về quyền/sandboxing cho các tác nhân lập trình có quyền truy cập shell. Các bình luận về hình ảnh chủ yếu là những trò đùa phi kỹ thuật, nhưng một mối quan tâm liên quan là: “Tại sao nó lại có quyền truy cập vào toàn bộ máy tính của bạn?”—làm nổi bật cuộc tranh luận rộng hơn về việc cấp cho các tác nhân lập trình AI quyền truy cập hệ thống tệp không hạn chế.

2. Quy trình làm việc video cục bộ MiniMax H3

Minimax H3 Turbo Lora (Hoạt động: 1753): Các bản dựng MiniMax H3 Turbo LoRA tương thích với ComfyUI có sẵn trên Hugging Face thông qua larryvrh và drbaph, với các cài đặt gốc được đề xuất: video sigma shift 12, audio sigma shift 4–6, res_multistep, LoRA strength 0.8–1.8 và khoảng 8–10 bước cho EMA hoặc 6–8 cho ckpt500. Bài đăng khuyến nghị sử dụng node/quy trình làm việc tùy chỉnh ComfyUI-MiniMax-H3-Turbo của người tạo vì nó bao gồm một bộ lấy mẫu (sampler) dành riêng cho Turbo nhằm cải thiện âm thanh, đồng thời cảnh báo LoRA chưa được đào tạo kỹ và mang tính thử nghiệm và không nên sử dụng các node bộ nhớ đệm (cache nodes) với Turbo. Một bản sửa lỗi âm thanh/bộ lấy mẫu ComfyUI gốc cũng đang được thực hiện thông qua PR ComfyUI#15243 của Kijai, và một quy trình làm việc ví dụ được liên kết tại đây. Người dùng bình luận chủ yếu bày tỏ sự đánh giá cao đối với công việc và hướng người dùng đến bộ lấy mẫu/quy trình làm việc tùy chỉnh của nhà phát triển gốc; không có sự bất đồng kỹ thuật đáng kể nào.

76 clip 5 giây khám phá các phong cách hoạt hình khác nhau với MiniMax H3 (tất cả được tạo cục bộ trên GPU 6 năm tuổi bởi the_shadow_nyc) (Hoạt động: 1359): Một bài đăng trên Reddit giới thiệu bộ sưu tập 76 clip văn bản-thành-video 5 giây được tạo cục bộ khám phá các phong cách hoạt hình đa dạng với MiniMax H3, được cho là sản xuất trên GPU 6 năm tuổi bởi Kc Tagliareni / the_shadow_nyc (LinkedIn) và được chia sẻ qua Banodoco Discord. Người dùng bình luận nhấn mạnh rằng ngay cả một quy trình làm việc T2V đơn giản không có điều kiện tham chiếu cũng có vẻ đạt chất lượng sản xuất, và một người lưu ý khả năng rõ ràng của H3 trong việc đồng bộ hóa âm nhạc với hoạt hình, điều mà họ coi là một bước tiến đáng kể cho việc tạo video âm nhạc AI cục bộ. Các bình luận hàng đầu nhìn chung là tích cực, nhấn mạnh rằng MiniMax H3 trông có khả năng bất thường đối với việc tạo cục bộ—đặc biệt là đối với chất lượng T2V không cần tham chiếu và đồng bộ hóa âm thanh/hoạt hình. Phương tiện truyền thông được liên kết trên Reddit không thể truy cập độc lập do bị chặn 403 Forbidden.

3. Định giá nền tảng LLM và thay đổi doanh thu

DeepSeek cho biết giá API sẽ tăng “đáng kể” (Hoạt động: 1258): Hình ảnh là ảnh chụp màn hình kỹ thuật của bảng điều khiển Sử dụng Nền tảng DeepSeek hiển thị biểu ngữ trong sản phẩm cảnh báo rằng giá API DeepSeek sẽ tăng “đáng kể” trong tương lai gần, với giá cuối cùng đang chờ thông báo chính thức (hình ảnh). Bảng điều khiển cũng hiển thị các số liệu sử dụng/tài khoản cụ thể bao gồm số dư nạp thêm 24,32 đô la, tổng chi phí 35,67 đô la, chi phí 7 ngày qua là 3,70 đô la, 3.035 yêu cầu API và 475.110.147 token, làm cho bài đăng chủ yếu liên quan đến lập kế hoạch chi phí API và dự báo ngân sách. Các bình luận chủ yếu là tiêu cực/phản ứng, với một người dùng hy vọng thay đổi này có thể chỉ áp dụng cho giá giờ cao điểm, ví dụ: khả năng tăng 2 lần vào giờ cao điểm thay vì tăng giá toàn diện.

70% doanh thu AI của Microsoft đến từ OpenAI (Hoạt động: 1570): Hình ảnh là ảnh chụp màn hình của một tweet tuyên bố ~70% doanh thu AI của Microsoft đến từ OpenAI, đi kèm với hình ảnh phản ứng lo lắng và biểu đồ chứng khoán Microsoft được phóng to cho thấy mức giảm hàng ngày -0,65%. Đây không phải là hình ảnh kỹ thuật hay điểm chuẩn; ý nghĩa của nó là ngữ cảnh/tài chính, làm nổi bật động lực kinh doanh vòng tròn mà người dùng bình luận mô tả: Microsoft đầu tư vào OpenAI, OpenAI mua/thuê tài nguyên tính toán Azure, và Microsoft báo cáo tăng trưởng doanh thu AI/đám mây. Người dùng bình luận hoài nghi về cách đặt vấn đề: một người gọi đó là “lỗi tiền vô tận”, trong khi những người khác đặt câu hỏi về độ tin cậy của nguồn tweet và lưu ý rằng biểu đồ chứng khoán gây hiểu lầm vì nó nhấn mạnh một mức giảm nhỏ hàng ngày mặc dù Microsoft đã tăng đáng kể trong tháng.

MetaOpenAIChatGPTAI AgentsMuse Spark
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.