Mô hình
Anthropic ra mắt Claude Opus 5: Hiệu năng tiệm cận Fable 5 với giá chỉ bằng một nửa
(giờ Việt Nam)
Tóm tắt AI
Anthropic vừa trình làng Claude Opus 5, mẫu flagship mới sở hữu hiệu năng vượt trội, thiết lập kỷ lục mới trên ARC-AGI-3 với chi phí vận hành tối ưu, chỉ bằng một nửa so với dòng Fable 5.
Bản dịch AI
Theo tin từ IT ngày 25 tháng 7, Anthropic hôm nay đã ra mắt Claude Opus 5, mẫu flagship mới nhất thuộc dòng Opus. So với thế hệ tiền nhiệm Opus 4.8, model này được cải thiện về hiệu năng trong khi vẫn giữ nguyên mức giá.
Anthropic cho biết, Opus 5 được định vị là model hiệu năng cao dành cho nhu cầu sử dụng hàng ngày. Theo công bố chính thức, model này có năng lực tiệm cận với Claude Fable 5 ở một số khía cạnh nhưng mức giá chỉ bằng khoảng một nửa. Hiện tại, Opus 5 đã trở thành model mặc định cho dịch vụ Claude Max và là model có năng lực cao nhất dành cho người dùng Claude Pro, đạt mức dẫn đầu trong nhiều bài kiểm tra về lập trình, tri thức và nghiên cứu khoa học.

Theo giới thiệu, Opus 5 đã đạt được những kết quả vượt trội trong các bài đánh giá về lập trình và tri thức như Frontier-Bench, GDPval-AA. Trong bài kiểm tra Frontier-Bench v0.1, Opus 5 đã vượt qua các model khác, đồng thời tăng gấp đôi hiệu suất tác vụ so với Opus 4.8 với chi phí trên mỗi tác vụ thấp hơn.

Trong bài kiểm tra CursorBench 3.2, kết quả của Opus 5 ở chế độ nỗ lực cao nhất chỉ thấp hơn 0,5% so với đỉnh của Fable 5, nhưng chi phí cho mỗi tác vụ chỉ bằng khoảng một nửa. Ngoài ra, ở các thiết lập nỗ lực cao, trung bình cao và cao nhất, Opus 5 đều vượt trội hơn các model khác về hiệu suất trên mỗi đơn vị chi phí.

Về khả năng xử lý tri thức và giải quyết vấn đề, kết quả kiểm tra do Anthropic công bố cho thấy Opus 5 đạt điểm số cao trong các bài đánh giá như ARC-AGI 3, Zapier AutomationBench và OSWorld 2.0. Trong đó, tại bài kiểm tra ARC-AGI 3, điểm số của Opus 5 cao gấp khoảng 3 lần so với vị trí thứ hai; trong Zapier AutomationBench – bài kiểm tra đo lường khả năng hoàn thành quy trình nghiệp vụ hoàn chỉnh của model – tỷ lệ thành công của nó cao gấp khoảng 1,5 lần so với các model có chi phí tương đương.

Anthropic cho biết, so với Opus 4.8, Opus 5 cũng có sự cải thiện đáng kể trong các tác vụ nghiên cứu khoa học, bao gồm các lĩnh vực như sinh học cấu trúc, hóa hữu cơ và tin sinh học. Trong các tác vụ hóa hữu cơ, chẳng hạn như suy luận cấu trúc phân tử dựa trên dữ liệu quang phổ, Opus 5 cao hơn Opus 4.8 10,2 điểm phần trăm; trong tác vụ dự đoán ảnh hưởng của biến đổi trình tự protein đến chức năng, nó cao hơn 7,7 điểm phần trăm.
Về ứng dụng thực tế, Anthropic nhấn mạnh Opus 5 có khả năng xác thực kết quả của chính mình và tự sửa lỗi liên tục tốt hơn. Ví dụ, trong một bài kiểm tra, model cần tạo mô hình 3D FreeCAD dựa trên bản vẽ linh kiện máy móc mà không thể xem trực tiếp nội dung bản vẽ. Opus 5 đã tự viết quy trình thị giác máy tính, trích xuất thông tin hình học từ các pixel thô và hoàn thành việc tái tạo mô hình thành công.
Trong một bài kiểm tra khác, Opus 5 đã phát hiện ra một lỗ hổng thực tế trong một trình quản lý gói mã nguồn mở và sửa lỗi mà bản vá của cộng đồng đã bỏ sót. Ngoài ra, một kỹ sư tại công ty giao dịch đã sử dụng Opus 5 để xây dựng giao diện dữ liệu cho một sàn giao dịch mới trong một phiên làm việc duy nhất; trong điều kiện thiếu nguồn dữ liệu thời gian thực để xác thực, model này còn tạo ra các công cụ kiểm thử để kiểm tra kết quả phân tích mã.
Về khía cạnh an toàn, Anthropic cho biết các hạn chế bảo mật của Opus 5 ít hơn so với Fable 5. Công ty dự đoán rằng số lần kích hoạt bộ phân loại an toàn của Opus 5 sẽ giảm khoảng 85% so với Fable 5.

Tuy nhiên, Opus 5 vẫn áp dụng các hạn chế đối với một số kịch bản rủi ro cao. Ví dụ, trong lĩnh vực an ninh mạng, model có thể hỗ trợ phân tích lỗ hổng trong mã nguồn, nhưng sẽ chặn các thao tác như quét lỗ hổng dựa trên tệp nhị phân, kiểm thử xâm nhập và tạo mã khai thác lỗ hổng.
Anthropic cho biết Opus 5 không được huấn luyện chuyên biệt cho các tác vụ tấn công mạng, nhưng cùng với sự nâng cao năng lực tổng thể, khả năng phát hiện lỗ hổng của nó đã được tăng cường. Trong bài kiểm tra OSS-Fuzz, Opus 5 có hiệu suất phát hiện lỗ hổng gần tương đương với Mythos 5, nhưng vẫn thua kém đáng kể so với Mythos 5 trong việc chuyển đổi lỗ hổng thành công cụ tấn công thực tế.

Trong lĩnh vực sinh học, Opus 5 tiếp nối cơ chế an toàn của Opus 4.8 và hiện trở thành model nghiên cứu khoa học có năng lực mạnh nhất mà Anthropic mở cho công chúng. Tuy nhiên, Anthropic cho rằng Opus 5 vẫn còn những hạn chế trong việc thực hiện các tác vụ nghiên cứu khoa học tự chủ, kéo dài – những tác vụ được cho là có thể mang lại rủi ro cao hơn.
Về giá cả, Claude Opus 5 đã được triển khai trên các nền tảng của Anthropic, với giá đầu vào là 5 USD cho mỗi triệu token (tỷ giá hiện tại khoảng 33,9 Nhân dân tệ) và giá đầu ra là 25 USD cho mỗi triệu token (tỷ giá hiện tại khoảng 169,6 Nhân dân tệ), giữ nguyên so với Opus 4.8. Các nhà phát triển có thể gọi claude-opus-5 thông qua Claude API.
Ngoài ra, Anthropic còn ra mắt chế độ Opus 5 Fast, với tốc độ vận hành nhanh gấp khoảng 2,5 lần chế độ mặc định và mức giá gấp đôi giá cơ bản. Đồng thời, Anthropic mở thử nghiệm hai tính năng, bao gồm chuyển đổi công cụ giữa chừng trong cuộc hội thoại trên nền tảng Claude và tính năng tự động dự phòng (fallback) trong API.
Tính năng tự động dự phòng cho phép người dùng tự động chuyển tác vụ sang các model khả dụng khác khi bộ phân loại an toàn chặn yêu cầu, từ đó tránh việc trả về thông báo lỗi trực tiếp. Anthropic cho biết, giống như các model dòng Opus trước đây, Opus 5 không đặt ra yêu cầu lưu trữ dữ liệu khi mở cho người dùng phổ thông.
Tuyên bố quảng cáo: Các liên kết ngoài chứa trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.