Latent Space
95

Tin ngành

Muse Spark 1.3 bắt kịp GPT-5.6-Sol: Meta chính thức gia nhập cuộc đua siêu trí tuệ với chi phí đào tạo rẻ bất ngờ

(giờ Việt Nam)

Tóm tắt AI

Meta tạo nên cú lội ngược dòng ngoạn mục khi Muse Spark 1.3 đạt hiệu năng ngang ngửa GPT-5.6-Sol, đồng thời tối ưu chi phí đào tạo xuống hơn 90%.

Bản dịch AI

[AINews] Muse Spark 1.3 matches GPT-5.6-Sol, confirming Meta Superintelligence as the newest Frontier Lab, >90% discount for training

Mùa ra mắt sản phẩm vẫn tiếp diễn từ hôm qua, với Gemini 3.8 Flash như những lời đồn đoán, nhưng Muse Spark 1.3 – sản phẩm từng được hứa hẹn trong bức thư tái xuất đầy ấn tượng của Zuck tháng trước – mới thực sự xứng đáng là tiêu điểm của ngày hôm nay. Theo AAII, đây hiện là mô hình đứng thứ 3 thế giới (!?!).

Image

Hãy nhìn vào sự tự tin khi cuối cùng nó cũng đạt được những con số tương đương với các mô hình tiên phong từ OpenAI và Anthropic (Opus, chứ không phải Fable)… và hứa hẹn rằng đây cũng sẽ là mô hình mở (open weights) (!!!):

X avatar for @finkd

Mark Zuckerberg@finkd

Muse Spark 1.3 ra mắt hôm nay với hiệu năng tiên phong cùng mức giá rẻ đến mức khó tin. Đây là bước nhảy vọt lớn nhất của chúng tôi từ trước đến nay trong lĩnh vực lập trình và tác vụ đại lý (agentic work). Hãy thử nghiệm trên Muse Code và API của chúng tôi. Tiếp theo sẽ là 🍉 và các bản phát hành Muse Spark open weights sắp ra mắt.

7:26 CH · 2 tháng 9, 2026 · 481K Lượt xem

494 Trả lời · 543 Đăng lại · 7.03K Lượt thích

Họ có một mô hình định giá thú vị: rẻ hơn 90%+ nếu bạn chọn tham gia vào quá trình huấn luyện:

Tin tức AI từ 22/8/2026 đến 24/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận/hủy email theo tần suất!

Các khóa học về Kỹ thuật Đại lý (Agent Engineering), Chương trình đào tạo và Thực hành cho nhà phát triển

Stanford đang chính thức hóa kỹ thuật phần mềm thuần AI (AI-native) thành một ngành học: @mihail_eric đã công bố phiên bản mới của khóa học The Modern Software Developer, tập trung vào cái mà ông gọi là "cuộc biến đổi năm 2026" của kỹ thuật phần mềm. Tín hiệu đáng chú ý không chỉ nằm ở bản thân khóa học mà còn ở việc thay đổi toàn bộ chương trình giảng dạy: 85% tài liệu của mùa thu 2025 đang được thay thế bằng các chủ đề như kỹ năng đại lý, kỹ thuật ngữ cảnh (context engineering), cổng MCP, thiết kế codebase sẵn sàng cho đại lý, đánh giá mã nguồn bởi đại lý, bảo mật, đại lý chạy nền song song và các nhà máy phần mềm. Khóa học cũng yêu cầu sinh viên gửi các PR vào các kho lưu trữ mã nguồn mở (OSS) thực tế với sự hỗ trợ từ các đối tác bao gồm Browserbase, OpenHands, Semgrep, Milvus, Marimo, CrewAI, Warp, Vercel, Unsloth, Anyscale và nhiều đối tác khác.

Một khóa học thứ hai tại Stanford tập trung vào xây dựng đại lý từ nguyên lý cơ bản: @Diyi_Yang và @michaelryan207 đã công bố CS329Z: Engineering AI Agents, được định hướng rõ ràng về việc xây dựng các đại lý "từ con số không". Cùng với khóa học của Mihail Eric, điều này cho thấy một sự chuyển dịch rộng hơn từ phương pháp sư phạm "prompting" sang kỹ thuật đại lý định hướng hệ thống: bao gồm các bộ khung (harnesses), đánh giá, bộ nhớ, công cụ, điều phối và các ràng buộc sản xuất thay vì chỉ sử dụng mô hình đơn thuần.

Các cuộc thảo luận của giới chuyên môn đang hội tụ về việc phân bổ trí tuệ có trạng thái (stateful intelligence allocation), thay vì định tuyến đơn giản: Trong một phiên thảo luận, @HarryStebbings đã làm nổi bật lập luận của @EnoReyes rằng để khai thác tối đa các mô hình, cần nhiều hơn là chỉ định tuyến—các đại lý cần hiểu trạng thái tác vụ, những gì vừa xảy ra và điều gì sẽ tiếp theo để phân bổ trí tuệ một cách linh hoạt. Điều này phù hợp với quan điểm của @jerryjliu0 rằng các startup trung lập với nhà cung cấp có thể vượt trội hơn các phòng thí nghiệm tiên phong trong các tác vụ hẹp bằng cách tối ưu hóa toàn bộ hệ thống (end-to-end) và chọn lọc sử dụng cả mô hình tiên phong lẫn mô hình open-weight.

Kiến trúc mô hình và Suy luận: Tin đồn về Astra, Looped Transformers và Phục vụ thời gian thực

Tin đồn "Astra là một looped transformer" có lẽ không mới mẻ như các tiêu đề báo chí gợi ý: @rasbt đã phân tích các báo cáo xung quanh kiến trúc Astra được đồn đại của OpenAI và lập luận rằng khái niệm "độ sâu tái phát" (recurrent depth) hay "looped transformer" chỉ là một tinh chỉnh kiến trúc khá khiêm tốn chứ không phải là một bước đột phá tự thân. Ông chỉ ra Nanbeige 4.2-3B như một tiền lệ open-weight: một chồng transformer 22 lớp được tái sử dụng hai lần, hoạt động hiệu quả như một mô hình 44 lớp mà không cần tăng gấp đôi dung lượng lưu trữ tham số. Sự đánh đổi rất rõ ràng: dung lượng bộ nhớ tương đương, tính toán tăng khoảng ~2 lần và chỉ giữ lại một phần hiệu suất token so với một chồng tiêu chuẩn. Tài liệu tham khảo lịch sử thực chất hơn là Mixture-of-recursions, nơi một bộ định tuyến được huấn luyện sẽ xác định một cách thích ứng số lần một token được xử lý, cho phép các token dễ thoát sớm và các token khó nhận được nhiều tài nguyên tính toán hơn.

Suy luận ẩn không phải là hệ quả tất yếu của sự tái phát: Một sự làm rõ quan trọng thứ hai từ @rasbt là việc tái sử dụng lớp không tự nhiên làm "che khuất chuỗi suy nghĩ" (chain-of-thought). Nó chỉ đơn giản là chuyển nhiều phép tính hơn vào các kích hoạt tiềm ẩn (latent activations) trước khi phát ra token. Nếu độ sâu tái phát làm giảm các dấu vết suy luận hiển thị, đó là vì mô hình có thể cần phát ra ít token trung gian hơn, chứ không phải vì looped transformers tự bản chất triệt tiêu CoT dạng văn bản.

Cập nhật hạ tầng phục vụ tiếp tục nhắm vào các khối lượng công việc đa phương thức thời gian thực: @vikhyatk đã công bố Photon 2.1, bổ sung các mô hình chuyển văn bản thành giọng nói và hỗ trợ NVIDIA B200 cho một công cụ suy luận đa phương thức thời gian thực. Riêng biệt, Baseten đã công bố khả năng cung cấp dịch vụ lưu trữ cho GLM-5.3 Fast, nhấn mạnh vào TPS cao hơn và định vị triển khai thời gian thực thông qua @baseten.

Bộ khung đại lý, Truy xuất kỹ năng và Công cụ hậu huấn luyện RL

HarnessDev của ByteDance Seed định hình lại việc đánh giá đại lý xung quanh bộ khung (harness), không chỉ là hoàn thành tác vụ: @omarsar0 đã làm nổi bật một bài báo mới về HarnessDev, yêu cầu các mô hình bắt đầu từ một hạt giống (seed) yếu nhưng có thể chạy được để xây dựng một bộ khung thực thi, sau đó cải thiện nó trong giai đoạn thứ hai bằng cách sử dụng phản hồi hạ nguồn. Cả hai giai đoạn đều được chấm điểm dựa trên khả năng và chi phí token thực thi, biến hiệu quả thành một phần của mục tiêu. Trên sáu LLM sáng tạo, bốn lĩnh vực và 2.207 trường hợp hạ nguồn, các bộ khung được tạo ra vẫn thua kém các hệ thống do con người thiết kế chuyên nghiệp về mã nguồn, tìm kiếm và nghiên cứu, nhưng lại ngang bằng hoặc vượt trội về viết lách và thử nghiệm ML. Điểm tinh tế chính là các bộ khung tự tiến hóa có ích, nhưng mức tăng không ổn định, phụ thuộc vào mô hình và chỉ có thể chuyển đổi một phần.

Tín hiệu hệ sinh thái liên quan: exo và công cụ tự cải thiện đệ quy: @omarsar0 cũng nhắc đến bộ khung exo như một điểm khởi đầu hữu ích để hiểu các quy trình tự cải thiện đệ quy, cho thấy sự quan tâm ngày càng tăng đối với các khung làm việc nơi các đại lý không chỉ cải thiện đầu ra mà còn cải thiện chính cấu trúc hỗ trợ của chúng.

Truy xuất kỹ năng có vẻ tốt khi nhìn tổng thể nhưng lại gây hại cho các tác vụ thực sự kích hoạt nó: @dair_ai đã tóm tắt một bài báo đề xuất Retrieval-Invoked Actual-Use Effect, một phương pháp đánh giá đối chiếu chạy cùng một tác vụ hai lần, có và không có kỹ năng được kích hoạt, và chỉ tính các tác vụ mà việc truy xuất thực sự được kích hoạt. Trên 17 LLM về lập trình và toán học, bài báo tìm thấy các trường hợp mà truy xuất cải thiện điểm số tổng thể trong khi lại có tác động tiêu cực đến cùng tác vụ trên tập hợp con các tác vụ mà nó được sử dụng. Đối với các nhóm duy trì thư viện kỹ năng hoặc danh mục công cụ, đây là một lời cảnh báo thực tế chống lại việc giải thích quá mức mức tăng tổng thể.

Hạ tầng hậu huấn luyện RL đang ngày càng được thương mại hóa: Nhóm SGLang đã quảng bá một sự kiện với Baseten và NVIDIA Dynamo về Miles, một khung huấn luyện RL sử dụng SGLang làm công cụ suy luận triển khai để hậu huấn luyện RL nhanh hơn, đáng tin cậy hơn @sgl_project. @AravSrinivas mô tả Miles như một dịch vụ RL mã nguồn mở, củng cố xu hướng hướng tới các chồng hậu huấn luyện có thể tái sử dụng thay vì các đường ống nội bộ tùy chỉnh.

Google Gemini 3.8 Flash Cyber và Ma sát sản xuất xung quanh công cụ của Google

Google đã giới thiệu một mô hình an ninh mạng chuyên dụng với các tuyên bố điểm chuẩn mạnh mẽ: @sundarpichai đã công bố Gemini 3.8 Flash Cyber, được định vị là mô hình an ninh mạng có khả năng nhất của Google trong khi vẫn giữ được tốc độ và giá cả ở mức Flash. Các con số được báo cáo bao gồm 86.2% trên CyberGym, 47.2% trên CWE-Bench cho việc vá lỗi và 70%+ thành công trên một điểm chuẩn khám phá lỗ hổng nội bộ trên 20 ngôn ngữ lập trình.

Đồng thời, tâm lý nhà phát triển chỉ ra những lo ngại về bộ khung và rủi ro tài khoản: @theo lập luận rằng Google hiện có công thái học (ergonomics) yếu đối với nhà phát triển xung quanh các bộ khung, ứng dụng mã nguồn, tích hợp bên thứ ba và đặc biệt là các lệnh cấm quyết liệt gắn liền với các tài khoản Google cốt lõi. @QuinnyPig đã làm sắc bén thêm mối lo ngại đó, lưu ý rằng phạm vi ảnh hưởng có thể mở rộng ra ngoài Gmail/Workspace đến các tài khoản Google Cloud liên kết với cùng một danh tính. Những lời phàn nàn sau đó của Theo về hành vi lập trình chậm, nặng về gọi công cụ trên các tác vụ Gemini (1, 2, 3) chỉ là giai thoại, nhưng chúng nhấn mạnh khoảng cách giữa hiệu suất điểm chuẩn và trải nghiệm người dùng (UX) của nhà phát triển trong sản xuất.

Meta Muse Spark 1.3 và Chu kỳ phát hành Video/Đa phương thức

Meta đã ra mắt Muse Spark 1.3 cho các khối lượng công việc đại lý và lập trình: @shengjia_zhao đã giới thiệu Muse Spark 1.3 là mô hình mạnh nhất trong dòng Spark cho các tác vụ đại lý và lập trình, với trọng tâm là công việc tầm nhìn dài hạn và tuân thủ các hướng dẫn phức tạp đáng tin cậy hơn. Phản ứng của cộng đồng nhấn mạnh vào phạm vi giá/hiệu năng của nó, bao gồm @alexandr_wang ca ngợi những gì nó có thể làm "chỉ với một xu", trong khi những người dùng khác so sánh nó một cách tích cực về tốc độ và hiệu quả token so với các dịch vụ "xhigh" cạnh tranh.

Wan 3.0 của Alibaba đang đạt được kết quả bảng xếp hạng bên thứ ba mạnh mẽ trong lĩnh vực video: @ArtificialAnlys báo cáo rằng Wan 3.0 xếp hạng #1 về Chỉnh sửa Video có Âm thanh, #2 về Chuyển văn bản thành Video có Âm thanh và #5 về Chuyển hình ảnh thành Video có Âm thanh trên bảng xếp hạng Artificial Analysis. Bản phát hành được định vị là mô hình tạo và chỉnh sửa tất cả trong một, chấp nhận văn bản, hình ảnh, video, âm thanh, tài liệu và trang web làm tài liệu tham khảo, hỗ trợ âm thanh gốc và tạo video dài tới 30 giây ở độ phân giải 1080p. Giá trong bản xem trước công khai bắt đầu từ $0.05/s cho 480p, tăng lên $0.20/s cho 1080p.

UX đa phương thức nặng về tham chiếu cũng đang được cải thiện: @imagine đã công bố hỗ trợ lên đến 14 tham chiếu cho mỗi video, bao gồm hình ảnh, giọng nói và tham chiếu nhân vật thông qua việc gắn thẻ @ trong các câu lệnh (prompts), một cải tiến giao diện nhỏ nhưng thiết thực cho việc kiểm soát sáng tạo đa tài sản.

Mô hình mở, Robot và các Tweet hàng đầu

Các nỗ lực về mô hình mở tiếp tục mở rộng: @percyliang chia sẻ rằng Marin 535B-A23B đã hoàn thành 13% quá trình huấn luyện, với chi phí tính toán được tài trợ thông qua Quỹ Jen-Hsun và Lori Huang và chạy trên CoreWeave. Bài đăng đáng chú ý không phải vì điểm chuẩn mà vì tính khả thi liên tục của việc huấn luyện mô hình mở quy mô lớn được hỗ trợ bởi nguồn lực tính toán từ thiện.

AI vật lý và các nền tảng robot mở đang tiến lên phía trước: @maze_rapid đã công bố Palmimo DevKit, một nền tảng robot AI để bàn với phần mềm mã nguồn mở và "bộ não" AI có thể thay thế, được thiết kế để các nhà phát triển có thể điều khiển các ứng dụng robot từ vài dòng Python mà không cần chuyên môn sâu về robot. Mọi thứ còn ở giai đoạn đầu, nhưng có liên quan như một ví dụ về các khung đại lý mở rộng sang các hệ thống hiện thân (embodied systems).

Các tweet hàng đầu (theo mức độ tương tác):

@mihail_eric: Khóa học lập trình viên thuần AI được cải tiến của Stanford với sự thay đổi lớn về chương trình giảng dạy và sự hợp tác OSS.

@sundarpichai: Ra mắt Gemini 3.8 Flash Cyber với các tuyên bố điểm chuẩn an ninh mạng mạnh mẽ.

@rasbt: Phân tích kiến trúc chi tiết về looped transformers và lý do tại sao tin đồn về Astra có thể đang phóng đại sự mới lạ.

MetaMuse SparkSiêu trí tuệĐào tạo AIGPT-5.6
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.