The Decoder: AI News
85

Mô hình

Meta ra mắt Muse Spark 1.3: Nâng cấp hiệu suất tác vụ AI với mức giá cạnh tranh

(giờ Việt Nam)

Tóm tắt AI

Meta vừa phát hành Muse Spark 1.3 với phiên bản xhigh sẵn sàng sử dụng, trong khi bản max mạnh mẽ hơn hiện đang được cung cấp cho các đối tác chọn lọc.

Bản dịch AI

Meta vừa phát hành Muse Spark 1.3, mô hình thứ tư của họ trong vòng năm tháng. Các thử nghiệm độc lập cho thấy những cải thiện đáng kể trong các tác vụ đại lý (agentic tasks), nhưng vẫn còn một khoảng cách so với các mô hình dẫn đầu. Điểm thu hút của mô hình này chính là mức giá.

Meta đã phát hành Muse Spark 1.3 thông qua Muse Code và Meta Model API. Dòng mô hình này ra mắt vào tháng 4, với phiên bản 1.1 tiếp nối vào tháng 7 và 1.2 vào tháng 8. Theo Artificial Analysis, phiên bản xhigh hiện đã có sẵn, trong khi phiên bản max đòi hỏi nhiều tài nguyên tính toán hơn sẽ chỉ ra mắt sau khi hoàn tất các thử nghiệm an toàn bổ sung và hiện đang được chạy dưới dạng bản xem trước giới hạn cho đối tác.

Với mức giá không đổi là 1,25 USD cho mỗi triệu token đầu vào và 4,25 USD cho mỗi triệu token đầu ra, chi phí cho một tác vụ chỉ số (index task) là 0,55 USD. Không có mô hình nào đạt từ 59 điểm trở lên có mức giá rẻ hơn, trong khi các đối thủ cùng cấp độ chỉ số có giá dao động từ 0,94 USD đến 1,23 USD. Muse Spark 1.3 thực tế có giá cao hơn phiên bản 1.2 (vốn có giá 0,40 USD).

Những cải thiện tập trung vào các lĩnh vực mà chỉ số này đánh giá cao

Trên Intelligence Index, phiên bản max đạt 62 điểm và xhigh đạt 61 điểm, tăng so với mức 57 điểm vào tháng 8 và 53 điểm vào tháng 7. Sự nhảy vọt này phụ thuộc vào cách chỉ số phân bổ trọng số cho các bài kiểm tra. GDPval-AA v2 chiếm 20%, Terminal-Bench 2.1 chiếm 16% và τ³-Bench Banking chiếm 14%, và những cải thiện lớn nhất của Meta đều nằm chính xác ở ba bài kiểm tra này.

Trong bài kiểm tra τ³-Banking, nơi các đại lý vận hành công cụ trong một kịch bản ngân hàng mô phỏng, phiên bản max đạt 52%. Theo Artificial Analysis, đây là vị trí dẫn đầu hiện tại và là lợi thế tuyệt đối duy nhất mà mô hình này nắm giữ. Phiên bản xhigh hiện có đạt 47%, ngang bằng với Claude Fable 5.1 (max) và GLM-5.3-Flash thay vì dẫn đầu. Phiên bản tiền nhiệm 1.2 chỉ đạt 35%.

Terminal-Bench 2.1, bài kiểm tra khả năng lập trình trong terminal, tăng từ 80 lên 85% ở bản xhigh và 86% ở bản max, nhưng Claude Fable 5.1 vẫn giữ vị trí dẫn đầu với 91,4% ở phiên bản max, 91,0% ở xhigh và 89,9% ở high. Trong bài kiểm tra có trọng số cao nhất của chỉ số là GDPval-AA v2, Meta cải thiện từ 1.615 lên 1.709 và 1.754 trên thang đo được hiệu chuẩn theo hiệu suất chuyên gia con người ở mức 1.000 trên 220 tác vụ chuyên môn thực tế. Claude Fable 5.1 (max) đạt 1.853. Meta đánh đổi lợi thế của biến thể max bằng tài nguyên tính toán, tiêu tốn nhiều hơn 62% token suy luận so với bản xhigh.

Ngoài các tác vụ đại lý, mô hình vẫn nằm ở mức trung bình

Trên GPQA Diamond, bài kiểm tra các câu hỏi khoa học cấp độ chuyên gia, Muse Spark tăng từ 90 lên 94%. Đây là nhóm dẫn đầu, nhưng vẫn thấp hơn Gemini 3.8 Flash (high) với 95,3% và Grok 4.6 (high) với 94,9%. CritPt, bao gồm các nghiên cứu vật lý, tăng từ 18 lên 26%, vẫn thấp hơn đáng kể so với GPT-5.6 Sol (max) ở mức 32,3% và Claude Fable 5.1 (xhigh) ở mức 31,1%.

Hai điểm số thực tế đã giảm so với phiên bản 1.2. AA-LCR giảm từ 83 xuống 79%. Độ chính xác thực tế trong AA-Omniscience giảm tới ba điểm, do mô hình thường xuyên từ chối trả lời hơn khi không chắc chắn.

Cả Meta và Artificial Analysis đều chưa công bố giá cho biến thể max. Các mô hình lớn hơn và phiên bản mở (open-weights) đang được phát triển.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay

MetaMuse SparkAI giá rẻMô hình ngôn ngữCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.