The Decoder: AI News
92

Mô hình

Anthropic ra mắt Claude Fable 5.1 và Mythos 5.1: Cải thiện khả năng lập trình, giảm chi phí tới 45%

(giờ Việt Nam)

Tóm tắt AI

Anthropic vừa giới thiệu bộ đôi mô hình Claude Fable 5.1 và Mythos 5.1, tập trung nâng cao hiệu suất lập trình cho AI agent và chất lượng văn bản với chi phí vận hành tối ưu hơn.

Bản dịch AI

Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less

Anthropic ra mắt Claude Fable 5.1 và Mythos 5.1, những mô hình AI mạnh mẽ nhất từ trước đến nay của hãng. Cùng với những cải tiến trong khả năng lập trình tác tử (agentic coding) và chất lượng văn bản, công ty cũng cắt giảm chi phí lên tới 45%.

Giống như các phiên bản tiền nhiệm, cả hai mô hình 5.1 đều chia sẻ cùng một mô hình nền tảng nhưng khác biệt về các rào cản an toàn (safety guardrails). Fable 5.1 được phát hành rộng rãi, trong khi Mythos 5.1 bị giới hạn trong các chương trình truy cập đặc biệt dành cho an ninh mạng và khoa học sự sống.

Đây cũng là những mô hình Claude đầu tiên được tích hợp sẵn hình mờ (watermark). Anthropic đang ra mắt một API phát hiện ở dạng xem trước riêng tư (private preview), cho phép các cơ quan quản lý, đơn vị truyền thông, tổ chức kiểm chứng thông tin và các viện nghiên cứu xác minh xem một văn bản có chứa hình mờ hay không. Công ty có kế hoạch mở rộng quyền truy cập theo thời gian và các bên quan tâm có thể đăng ký tại đây.

Fable 5.1 có chi phí thấp hơn khoảng 25% so với Fable 5 đối với các khối lượng công việc thông thường, và mức tiết kiệm lên tới khoảng 45% đối với các tác vụ đòi hỏi tính tác tử cao, bao gồm các quy trình tự động kéo dài với nhiều lệnh gọi công cụ. Anthropic đạt được điều này bằng cách giảm chi phí đọc bộ nhớ đệm (cache reads) từ 1 USD xuống còn 0,25 USD trên mỗi triệu token. Tất cả các mức giá API khác vẫn giữ nguyên ở mức 10 USD trên mỗi triệu token đầu vào và 50 USD trên mỗi triệu token đầu ra. Để so sánh, Opus 5 có mức giá bằng một nửa, với 5 USD cho đầu vào và 25 USD cho đầu ra trên mỗi triệu token.

Chi phí cao là lời phàn nàn lớn nhất về Fable 5, và điều này có khả năng đã góp phần khiến mô hình này có tỷ lệ áp dụng thấp trong nhóm khách hàng doanh nghiệp. Áp lực về giá đã gia tăng kể từ khi Opus 5 ra mắt vào cuối tháng 7, vốn đã ngang bằng hoặc vượt qua Fable 5 trên hầu hết các bài kiểm tra đánh giá với mức giá thấp hơn. Giống như các mô hình Claude trước đây, các phiên bản mới đi kèm với hệ thống cấp độ nỗ lực (effort-level system) giúp kiểm soát việc sử dụng tài nguyên tính toán. Ở mức nỗ lực thấp hoặc trung bình, Fable 5.1 sẽ mang lại kết quả tương đương Fable 5 với chi phí thấp hơn.

Những bước nhảy vọt trong các bài kiểm tra đánh giá về lập trình và nghiên cứu

Fable 5.1 đạt được những cải tiến lớn trong các bài kiểm tra đánh giá về tính tác tử. Trên Terminal-Bench-Science 0.1, mô hình đạt 52,6%, cao hơn gấp đôi so với mức 24,7% của Fable 5 và vượt xa mức 22,4% của GPT-5.6 Sol. Trên Terminal-Bench 4.0 dành cho lập trình tác tử, Fable 5.1 đạt 55,8% trong khi Mythos 5.1 đạt 60,9%, so với 42,0% của Fable 5 và 37,3% của GPT-5.6 Sol. Liệu những cải tiến này có chuyển hóa thành hiệu quả thực tế ở cùng quy mô hay không sẽ trở nên rõ ràng trong những tuần tới.

Nhà nghiên cứu Felix Rieseberg của Anthropic cho biết Fable 5.1 cũng cải thiện phong cách viết. Các mô hình trước đây quá lạm dụng danh sách gạch đầu dòng và văn bản in đậm trong trò chuyện, còn Fable 5.1 đã tiết chế điều đó, đồng thời tuân thủ các hướng dẫn về phong cách chặt chẽ hơn và mang lại cảm giác tự nhiên hơn về tổng thể.

Fable 5.1 mở rộng sang công việc an ninh mạng

Các bộ lọc an toàn cho các câu hỏi về an ninh mạng, sinh học và y tế ít khắt khe hơn so với các phiên bản trước. Ở các mô hình 5.0, chúng nhạy cảm đến mức kích hoạt cả với những yêu cầu có thiện chí, tạo ra các cảnh báo giả (false positives) với tần suất gây khó chịu.

Các bộ lọc an ninh mạng trong bản 5.1 tạo ra ít cảnh báo giả hơn 60%, và đối với các truy vấn liên quan đến sinh học, các bộ lọc kích hoạt ít hơn 85% đối với các câu hỏi vô hại về sinh học và y học cơ bản.

Fable 5.1 hiện đã có thể xác định các lỗ hổng phần mềm lần đầu tiên, mặc dù không thể phát triển các mã khai thác (exploits). Việc kiểm thử xâm nhập (penetration testing) và tạo mã khai thác vẫn được chuyển hướng sang các mô hình Opus. Mythos cũng là một phần của Claude Security cho các mục đích phòng thủ.

Cách truy cập Fable 5.1 và Mythos 5.1

Claude Fable 5.1 hiện đã có sẵn trên tất cả các nền tảng, bao gồm AWS, Google Cloud và Microsoft Azure. Các nhà phát triển có thể truy cập thông qua API bằng cách sử dụng claude-fable-5-1. Đối với khách hàng doanh nghiệp, Anthropic đang triển khai Enterprise Frontier Safeguards (EFS), giúp lưu trữ dữ liệu khách hàng hoàn toàn trên cơ sở hạ tầng đám mây của chính khách hàng đó.

Claude Mythos 5.1 hiện bị giới hạn cho các tổ chức tại Hoa Kỳ thông qua hai chương trình: Chương trình Xác minh An ninh mạng (Cyber Verification Program) cho công việc an ninh phòng thủ và Chương trình Xác minh Khoa học Sự sống (Life Sciences Verification Program), được phát triển cùng với chính phủ Hoa Kỳ. Anthropic có kế hoạch mở rộng quyền truy cập cho các đối tác quốc tế.

Anthropic cũng đang mạnh tay trấn áp các cuộc tấn công chưng cất (distillation attacks), nơi các khả năng của một mô hình bị trích xuất một cách có hệ thống thông qua hàng ngàn tài khoản giả mạo. Các tài khoản API mới không còn có thể chỉnh sửa ngữ cảnh trước đó của Claude trong các cuộc trò chuyện đa lượt trong khi vẫn giữ lại bản ghi suy luận (thinking transcript), điều mà theo Anthropic là đã đóng lại một kỹ thuật chưng cất đã được ghi nhận.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền về các công nghệ tiên phong "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.

Đăng ký ngay

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.