Mô hình
Meta AI ra mắt Muse Spark 1.3: Tối ưu hóa hiệu suất lập trình, giảm 25% tiêu thụ token
(giờ Việt Nam)
Tóm tắt AI
Meta Superintelligence Labs vừa phát hành Muse Spark 1.3, mô hình chuyên biệt cho tác vụ lập trình và tác tử thông minh với cửa sổ ngữ cảnh 1 triệu token, giúp giảm đáng kể số lượng lệnh gọi công cụ và tài nguyên tính toán.
Bản dịch AI

Tuần này, Meta Superintelligence Labs đã phát hành Muse Spark 1.3. Đây là phiên bản Muse Spark thứ tư trong vòng năm tháng, tập trung vào các tác vụ đại lý (agentic) và lập trình dài hạn thay vì tạo nội dung đơn lẻ. Cách tiếp cận trong bài đăng của Meta nhấn mạnh vào tính khả dụng: duy trì một luồng công việc dài, cộng tác với người dùng và nhận biết khi nào mô hình bị tắc nghẽn.
Liệu nó có thể triển khai được không? Có, nhưng với hai giới hạn. Muse Spark 1.3 hiện đã có mặt trong Muse Code và Meta Model API, vì vậy bạn có thể gọi nó trong môi trường sản xuất ngay bây giờ. Bạn không thể tự lưu trữ (self-host) vì trọng số (weights) là đóng, và chế độ suy luận tối đa (max reasoning mode) vẫn đang bị hạn chế để chờ kiểm tra an toàn thêm.
Những thay đổi thực sự đối với các tác nhân (agents)
Meta đã huấn luyện Muse Spark 1.3 trên nhiều bộ công cụ tác nhân (agent harnesses) để hành vi có thể khái quát hóa vượt ra ngoài một môi trường duy nhất. Mô hình được xây dựng để xử lý nhiều quy trình làm việc trong một luồng dài. Với một mục tiêu mở, nó tự thu thập ngữ cảnh từ các nguồn lộn xộn và mâu thuẫn, sau đó vá các lỗ hổng trong kế hoạch của mình.
Những thay đổi về khả năng cộng tác là phần thực tế hơn. Muse Spark 1.3 đặt các câu hỏi làm rõ đối với những yêu cầu mơ hồ, thu hút người dùng tham gia khi bị đình trệ và xác nhận trước khi thực hiện các hành động quan trọng. Trong các tác vụ dài, nó thích ứng với sở thích của người dùng: cập nhật trạng thái thường xuyên hoặc thực thi ẩn trong nền. Meta cũng báo cáo khả năng hiệu chỉnh tốt hơn về các giới hạn của chính mô hình, vì vậy nó sẽ gắn cờ các trở ngại thay vì tạo ra kết quả ảo tưởng (hallucination).
Khả năng đa nhiệm cũng được cải thiện. Meta cho biết mô hình ánh xạ một yêu cầu đầu vào tới đúng tác vụ trong một luồng đơn lẻ phức tạp, bất kể người dùng đang điều hướng hay ngắt quãng.
Lập trình và hiệu suất
Muse Spark 1.3 được huấn luyện trên nhiều tác vụ lập trình dài hạn hơn. So với Muse Spark 1.2, Meta mô tả rằng mô hình này ít lượt phản hồi không cần thiết hơn, bớt dài dòng hơn và có phong cách mã nguồn sạch hơn. Trong các so sánh nội bộ của các kỹ sư Meta, nó sử dụng ít hơn khoảng 20% lệnh gọi công cụ và ít hơn khoảng 25% token. Đối với khối lượng công việc đại lý, đây là con số liên quan trực tiếp đến chi phí: ít lượt phản hồi qua lại hơn và ít token phải thanh toán hơn cho mỗi tác vụ hoàn thành.
Điểm chuẩn (Benchmarks)
Theo số liệu của riêng Meta, Muse Spark 1.3 đạt 75,4 điểm trên DeepSWE v1.1, vượt qua Claude Opus 5 với 74,0 và GPT-5.6 Sol với 72,7. Nó đạt 59,4 điểm trên SWE-Atlas Codebase QnA và ngang bằng với GPT-5.6 Sol ở mức 88,8 trên Terminal-Bench 2.1, trong khi Opus 5 đạt 86,7. Khả năng truy xuất ngữ cảnh dài là khoảng cách lớn nhất: điểm MRCR v2 đạt 98,5 (256K–512K) và 98,1 (512K–1M), so với 91,5 và 73,8 của GPT-5.6 Sol.
Việc phân chia chế độ rất quan trọng đối với các tác vụ đại lý. Meta báo cáo OSWorld 2.0 đạt 66,9 cho chế độ max so với 57,2 cho xhigh, GDPval-AA v2 Elo đạt 1.754 so với 1.709, và JobBench đạt 64,9 so với 61,2. DeepSearchQA đạt mức hòa 89,4 cho cả hai. Vì Muse Spark 1.2 được đánh giá ở mức xhigh, một phần của bước nhảy vọt thế hệ này là do sự thay đổi về cấp độ suy luận.
Artificial Analysis chấm điểm biến thể xhigh thương mại ở mức 61 trên Intelligence Index và biến thể max bản xem trước ở mức 62. Điều đó đặt xhigh ngang hàng với GPT-5.6 Sol (max) và Grok 4.6 (high), xếp sau Claude Opus 5 (max, 63) và Claude Fable 5.1 (max, 66). Artificial Analysis cũng đo lường Tau3-Bench Banking ở mức 47% cho xhigh và 52% cho max, đây là điểm số cao nhất mà họ từng ghi nhận trên bài đánh giá đó.
Những điểm chính cần lưu ý
Hãy xem bài đăng phát hành đầy đủ và báo cáo phương pháp đánh giá. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi cũng như đăng ký nhận Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Product Release hoặc Webinar của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.