Mô hình
Anthropic ra mắt Claude Fable 5.1 và Mythos 5.1: Đạt 52.6% điểm Terminal-Bench, giảm 75% phí đọc bộ nhớ đệm
(giờ Việt Nam)
Tóm tắt AI
Anthropic giới thiệu bộ đôi Claude 5.1 với hiệu năng vượt trội và chi phí tối ưu. Trong đó, Fable 5.1 được phát hành rộng rãi, còn Mythos 5.1 giới hạn cho các tổ chức được kiểm duyệt tại Mỹ thuộc dự án Project Glasswing.
Bản dịch AI

Anthropic vừa ra mắt Claude Fable 5.1 và Claude Mythos 5.1, ba tháng sau khi dòng Fable 5 được phát hành vào tháng 6 năm 2026. Cả hai đều sử dụng cùng một mô hình nền tảng nhưng được đặt sau các lớp bảo vệ khác nhau. Fable 5.1 hiện đã khả dụng rộng rãi dưới tên claude-fable-5-1; trong khi Mythos 5.1 vẫn bị giới hạn cho các tổ chức đã qua kiểm duyệt. Cả hai đều sở hữu cửa sổ ngữ cảnh 1 triệu token và giới hạn đầu ra tối đa 128 nghìn token, với tính năng tư duy thích ứng (adaptive thinking) luôn được bật. Chỉ số hiệu năng tiêu biểu là 52,6% trên Terminal-Bench-Science 0.1, so với 24,7% của Fable 5 và 29,0% của Opus 5. Về mặt thương mại, Anthropic đã giảm 75% chi phí đọc bộ nhớ đệm (cache reads), từ 1,00 USD xuống còn 0,25 USD cho mỗi triệu token, mức mà Anthropic ước tính giúp giảm khoảng 25% chi phí cho các tác vụ thông thường và lên tới 45% cho các tác vụ đại lý (agentic). Giá đầu vào và đầu ra cơ bản vẫn giữ nguyên ở mức 10 USD và 50 USD mỗi triệu token.
Có thể triển khai được không?
Có, Claude Fable 5.1 đã khả dụng rộng rãi dưới tên claude-fable-5-1 trên Claude API, Amazon Bedrock, Claude Platform trên AWS, Google Cloud và Microsoft Foundry. Claude Mythos 5.1 thì không: nó bị giới hạn cho các tổ chức Hoa Kỳ đã qua kiểm duyệt trong khuôn khổ Project Glasswing.
Các con số đánh giá hiệu năng (benchmark)
Trên Terminal-Bench-Science 0.1, một bộ tiêu chuẩn đánh giá nghiên cứu khoa học theo hướng đại lý, Fable 5.1 đạt 52,6% so với 29,0% của Opus 5, 24,7% của Fable 5 và 22,4% của GPT-5.6 Sol. Anthropic báo cáo sai số chuẩn từ 3,5 đến 4,5 điểm mỗi mô hình, vì vậy hãy thận trọng với biên độ thay vì chỉ nhìn vào thứ hạng.
Trên Terminal-Bench 4.0, Fable 5.1 đạt 55,8% và Mythos 5.1 đạt 60,9%. Khoảng cách giữa hai mô hình giống hệt nhau này chính là chi phí của các can thiệp bảo vệ, một sự tiết lộ trung thực hiếm thấy. Các kết quả khác: CursorBench 3.2.0 đạt 73,4%, Humanity’s Last Exam đạt 60,9% khi không dùng công cụ và 65,0% khi có dùng công cụ, AutomationBench đạt 31,4%, OSWorld 2.0 đạt 41,7% (chế độ nghiêm ngặt), và GDPval-AA v2 đạt 1853.
Nguồn gốc của việc cắt giảm chi phí
Giá đầu vào và đầu ra cơ bản không thay đổi. Chi phí đọc bộ nhớ đệm giảm 75%, từ 1,00 USD xuống 0,25 USD mỗi triệu token, tương đương 0,025 lần giá đầu vào cơ bản so với mức 0,1 ở mọi mô hình Claude khác. Anthropic ước tính chi phí giảm khoảng 25% cho các tác vụ thông thường và lên tới khoảng 45% cho các tác vụ đại lý nặng về ngữ cảnh. Xử lý theo lô (batch processing) có giá 5 USD và 25 USD mỗi triệu token.
Ba thay đổi đột phá mà các đội ngũ sẽ gặp phải
Các thay đổi bổ sung: nỗ lực trên mỗi tin nhắn (per-message effort), tin nhắn hệ thống theo lượt (turn-scoped system messages) và thinking.display: "updates" đều đang ở giai đoạn beta thông qua các tiêu đề (headers). Nguồn gốc nội dung (content provenance) là bắt buộc, với hình mờ văn bản thống kê trên tất cả đầu ra và chứng chỉ C2PA trên các tệp tin.
Anthropic cũng ghi nhận các sự suy giảm hiệu năng thực tế. Việc gọi công cụ song song (parallel tool calling) trở nên biến thiên hơn, vì vậy các vòng lặp đại lý có thể chỉ thực hiện một lệnh gọi mỗi lượt thay vì gộp nhiều lệnh như Fable 5. Mô hình ít tường thuật hơn, trả lời từ bộ nhớ thường xuyên hơn ở mức nỗ lực thấp và ưu tiên viết lại toàn bộ tệp thay vì chỉnh sửa có mục tiêu.
Các biện pháp bảo vệ và khoa học
Các biện pháp bảo vệ an ninh mạng hiện cho phép khám phá lỗ hổng nhưng không cho phép phát triển mã khai thác, giúp giảm khoảng 60% các can thiệp trong Claude Code mỗi phiên. Các biện pháp bảo vệ sinh học kích hoạt ít hơn 85% đối với các yêu cầu lành tính. Kiểm thử xâm nhập, tạo mã khai thác và quét lỗ hổng dựa trên tệp nhị phân vẫn được chuyển hướng sang Opus.
Về nghiên cứu, Mythos 5.1 đã thiết kế các chất gắn kết protein với tỷ lệ thành công khoảng 50% trên 12 mục tiêu so với mức trung bình 10 đến 15%, Fable 5.1 đã xây dựng bản đồ độ cao sao Kim với độ phân giải 2 đến 3 km, và các nhân GPU tùy chỉnh đã tăng tốc bảy mô hình gen mã nguồn mở lên tới 2,5 lần.
Những điểm chính cần lưu ý
Hãy xem qua các Chi tiết Kỹ thuật. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi cũng như Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Bản phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.