Mô hình
Anthropic ra mắt Claude Opus 5: Hiệu năng vượt trội với chi phí chỉ bằng một nửa
(giờ Việt Nam)
Tóm tắt AI
Anthropic vừa trình làng Claude Opus 5, model mạnh mẽ nhất hiện nay với hiệu suất trên Frontier-Bench v0.1 gấp đôi bản tiền nhiệm, đồng thời giảm 50% chi phí vận hành.
Bản dịch AI

Claude Opus 5 đã ra mắt từ hôm nay. Đây là một mô hình tư duy sâu sắc và chủ động, tiệm cận với trí tuệ tiên phong của Claude Fable 5 nhưng với mức giá chỉ bằng một nửa.
Trong các bài đánh giá về lập trình và kiến thức chuyên môn như Frontier-Bench và GDPval-AA, Opus 5 là mô hình hiện đại nhất hiện nay (state-of-the-art), mặc dù vẫn đứng sau Mythos 5 trong các tác vụ an ninh mạng.
Opus 5 được thiết kế để sử dụng hàng ngày: nó hoạt động hiệu quả hơn các mô hình khác. Đây là mô hình mặc định mới trên Claude Max và là mô hình mạnh mẽ nhất trên Claude Pro.
Hiệu suất và hiệu quả chi phí
Claude Opus 5 mang lại hiệu suất cải thiện đáng kể với cùng mức chi phí như phiên bản tiền nhiệm, Opus 4.8. Các biểu đồ trong phần này cho thấy hiệu suất thay đổi như thế nào tùy theo thiết lập nỗ lực (effort setting) của mô hình, cho phép khách hàng tối ưu hóa cho trí tuệ hoặc tiết kiệm token để có kết quả nhanh hơn và rẻ hơn.
Opus 5 vượt trội trong các tác vụ kỹ thuật phần mềm quan trọng. Ví dụ, trên Frontier-Bench v0.1, Opus 5 vượt qua tất cả các mô hình khác và tăng gấp đôi hiệu suất của Opus 4.8 với chi phí mỗi tác vụ thấp hơn. Trên CursorBench 3.2, ở mức nỗ lực tối đa (max effort), mô hình đạt kết quả trong phạm vi 0,5% so với điểm số cao nhất của Fable 5, nhưng với chi phí mỗi tác vụ chỉ bằng một nửa; nó cũng đạt hiệu suất cao hơn trên mỗi đơn vị chi phí so với tất cả các mô hình khác ở các mức nỗ lực high, xhigh và max.
Chúng tôi ghi nhận kết quả tương tự đối với các tác vụ kiến thức và giải quyết vấn đề. Ví dụ:
Đây cũng là mô hình tốt nhất và tiết kiệm chi phí nhất của chúng tôi trên một số bài đánh giá liên quan:
Opus 5 là một bước cải tiến đáng kể so với Opus 4.8 trong nghiên cứu khoa học. Nó cho thấy hiệu suất tốt hơn Opus 4.8 trong tất cả các bài đánh giá về khoa học sự sống của chúng tôi, bao gồm các chủ đề như sinh học cấu trúc, hóa hữu cơ và tin sinh học. Những cải tiến của nó rõ rệt nhất ở các tác vụ hóa hữu cơ, như suy luận cấu trúc phân tử từ dữ liệu quang phổ (nó đạt điểm cao hơn 10,2 điểm phần trăm so với Opus 4.8 trong bài kiểm tra nội bộ của chúng tôi), và các tác vụ liên quan đến protein như dự đoán cách các biến thể trong trình tự protein ảnh hưởng đến chức năng của chúng (ở đây, nó đạt điểm cao hơn 7,7 điểm phần trăm).
Cuối cùng, Opus 5 có khả năng tạo ra các kết quả đầu ra trực quan mạnh mẽ hơn nhiều:
Làm việc với Claude Opus 5
Claude Opus 5 mạnh mẽ hơn nhiều trong việc tự kiểm chứng công việc và lặp lại cẩn thận cho đến khi thành công. Trong các bài đánh giá và thử nghiệm truy cập sớm, chúng tôi và người dùng đã tìm thấy nhiều ví dụ về tính chủ động và sự kỹ lưỡng của Opus 5:
Dưới đây là các báo cáo thêm từ những khách hàng truy cập sớm về trải nghiệm làm việc với Opus 5:
Trên FrontierCode 1.1, Claude Opus 5 đạt hiệu suất gần bằng cấp độ Fable với chi phí chỉ bằng một nửa. Trong Devin, nó cũng thể hiện thế mạnh đặc biệt trong các tác vụ gỡ lỗi khó và phân tích nguyên nhân gốc rễ.
Claude Opus 5 mang lại trí tuệ gần bằng Fable 5 với tốc độ và chi phí của Opus. Trên CursorBench, nó chỉ kém Fable 5 một chút và có nhiều hành vi tương tự. Chúng tôi rất hào hứng khi thấy các nhà phát triển sử dụng nó trong Cursor.
Claude Opus 5 đã đứng đầu bảng xếp hạng AutomationBench của Zapier mà không tiêu tốn nhiều token hơn các mô hình Claude trước đó. Nó đã lấy một bảng tính sức khỏe tài khoản thô và chạy toàn bộ quy trình ngăn chặn khách hàng rời bỏ từ đầu đến cuối: gắn cờ các tài khoản có nguy cơ, cảnh báo chủ sở hữu phù hợp và tóm tắt cho bộ phận vận hành giữ chân khách hàng. Các mô hình trước đây không vượt qua được; Opus 5 đạt 100%.
Trong công việc phân tích hệ gen, Claude Opus 5 hành xử giống một nhà khoa học cẩn trọng hơn bất kỳ mô hình nào chúng tôi từng chạy. Nó tìm đến các kiểm định thống kê phù hợp để loại trừ các yếu tố gây nhiễu, đối chiếu kết quả của chính mình bằng các phương pháp độc lập và duy trì tiến độ thông qua các phân tích nhiều bước dài.
Claude Opus 5 vượt trội hơn mọi mô hình trong cùng dòng trên các bài đánh giá nội bộ của chúng tôi. Nó không chỉ tốt hơn ở các tác vụ lập trình đại lý (agentic coding) khó nhất, tăng 22% so với Opus 4.7, mà còn ổn định hơn, với độ biến thiên giữa các lần chạy thấp hơn nhiều. Đối với hàng triệu nhà xây dựng trên Lovable, sự nhất quán đó là yếu tố then chốt. Kết quả đáng tin cậy, qua từng bản dựng.
Claude Opus 5 là bước nhảy vọt lớn nhất trong dòng Opus kể từ bản 4.5. Trên cùng các bản dựng ứng dụng full-stack, giao diện người dùng cho thấy điều đó đầu tiên: những hình ảnh động, trò chơi và tác phẩm 3D tốt nhất mà chúng tôi từng thấy từ một mô hình Opus.
Chúng tôi rất yêu thích Claude Opus 5. Đối với loại công việc phân tích mở mà đại lý của chúng tôi xử lý, đây là một bản nâng cấp thực sự so với Opus 4.8, và những cải tiến lớn nhất nằm chính xác ở nơi quan trọng: các tác vụ khó hơn, mơ hồ hơn. Phản hồi rõ ràng và súc tích hơn, và chúng tôi cũng thấy hiệu quả được cải thiện ở các mức nỗ lực cao hơn.
Claude Opus 5 là một cải tiến đáng kinh ngạc so với Opus 4.8 cho các quy trình nghiên cứu tài chính mà các nhà phân tích của chúng tôi thực hiện hàng ngày. Nó nổi bật ở khả năng suy luận số học, xử lý bảng biểu và tư duy phản biện sắc bén hơn ở những nơi cần sự chính xác.
Claude Opus 5 mang lại trí tuệ và độ chính xác trong ngành, điều cần thiết cho việc phân tích nội dung doanh nghiệp chuyên biệt. Box nhận thấy rằng Opus 5 vượt trội hơn Opus 4.8 8% và mang lại những cải thiện hiệu suất đáng chú ý trong các quy trình phân tích dữ liệu (cải thiện 11%) và thẩm định (cải thiện 17%) mà các tổ chức công nghệ, chăm sóc sức khỏe và khu vực công dựa vào hàng ngày.
Claude Opus 5 là một bước tiến thế hệ rõ ràng so với Opus 4.8. Trong một ngày cuối tuần, tôi đã giao cho nó vai trò chánh văn phòng (chief-of-staff) quản lý môi trường phát triển của mình: nó tự xây dựng trình giám sát, điều khiển từng hộp công cụ và chỉ gọi tôi khi cần đưa ra các quyết định quan trọng.
Claude Opus 5 đã thực hiện những thay đổi quy mô lớn trên toàn bộ cơ sở mã Fundamental Research Assistant, thích ứng với phản hồi trong suốt quy trình đại lý và giải thích lý do của nó rõ ràng hơn bất kỳ mô hình nào chúng tôi từng sử dụng. Nó xử lý được những công việc mà thông thường chúng tôi phải chia nhỏ thành nhiều phần.
Trên một số tác vụ mô hình hóa tài chính khó nhất, Claude Opus 5 là một bước tiến rõ rệt so với Opus 4.8 về cả độ chính xác và hiệu quả. Mức hiệu suất tối thiểu của nó cao hơn đáng kể, đặc biệt là về logic chuyên môn tài chính sâu. Trên các mức nỗ lực, nó đạt độ chính xác trung bình cao hơn 9 điểm phần trăm với số lượt tương tác và lệnh gọi công cụ ít hơn một phần ba và thời gian ít hơn 60%.
Claude Opus 5 tự kiểm tra công việc của mình theo cách mà một nhà phát triển frontend thực thụ sẽ làm. Trên bài kiểm tra của chúng tôi, nó mở các trang trong trình duyệt ở độ rộng máy tính để bàn và điện thoại, phát hiện một sản phẩm bị ẩn dưới nếp gấp trên thiết bị di động và một nút thanh toán nằm ngoài màn hình, sau đó sửa cả hai trước khi bàn giao công việc.
Claude Opus 5 là một bước tiến rõ rệt về hiệu suất trong công việc đại lý pháp lý so với các mô hình Opus trước đây, và chúng tôi thấy những cải tiến lớn nhất trong các lĩnh vực thực hành như quản trị doanh nghiệp và trọng tài. Chúng tôi cũng ấn tượng với khả năng duy trì chất lượng của Opus 5 ở các mức suy luận thấp hơn, đạt hiệu suất tương tự trong khi tạo ra ít hơn trung bình 26% token so với Opus 4.8 ở mức suy luận tối đa.
Những cải tiến lớn nhất của Claude Opus 5 đối với chúng tôi nằm ở công việc dài hạn: xây dựng một bộ slide hoàn chỉnh, sau đó sửa đổi nó. Chất lượng của Artifact là yếu tố quyết định mô hình nào chúng tôi chọn, và đây là bước tiến rõ ràng nhất mà chúng tôi từng thấy — hiểu biết trực quan tốt hơn, định dạng sạch hơn, ít lỗi slide hơn.
Khả năng phán đoán của Claude Opus 5 là điều nổi bật nhất. Khi bàn giao một PR, nó không vội vàng xuất bản: nó xác minh các nhánh, kiểm tra mẫu và suy nghĩ thấu đáo về các tác động kiểm thử để việc bàn giao được sạch sẽ. Các mô hình cũ hơn thường có xu hướng nhảy cóc và bị mắc kẹt ở các bước kiểm tra của chúng tôi.
Trong một phiên tái cấu trúc, Claude Opus 5 đã phản bác một thiết kế tôi đề xuất, và nó không nhượng bộ khi tôi khăng khăng. Thay vào đó, nó giải thích chính xác điều gì có giá trị trong ý tưởng của tôi, thu hẹp sự phản đối vào một câu hỏi thiết kế duy nhất và đề xuất một thỏa hiệp giữ lại phần tốt trong khi sửa chữa khiếm khuyết. Đó là kiểu phán đoán cho phép chúng tôi tin tưởng giao phó cho nó với ít sự giám sát hơn.
Đối với các bản sửa lỗi (redlines) ở lượt đầu tiên, Claude Opus 5 đạt điểm cao nhất trong số các mô hình chúng tôi đã thử nghiệm, gần gấp đôi Opus 4.8. Việc bình luận cũng tốt hơn: trên các thỏa thuận bảo mật (NDA), nó đi đến phần sửa lỗi trong thời gian ngắn hơn và với ít lượt duyệt hơn, trong khi độ chính xác được duy trì hoặc tốt hơn.
Claude Opus 5 viết các diff sạch, chặt chẽ, không có mã chết (dead code) và là công cụ phát hiện nguy cơ mạnh mẽ hơn đối với các vấn đề tinh vi, đặc thù của cơ sở mã. Chúng tôi đang áp dụng nó cho các khối lượng công việc sản xuất.
Chúng tôi chắc chắn sẽ chuyển đổi một số trường hợp sử dụng trong Cosmos, nền tảng đại lý hợp nhất của chúng tôi. Chúng tôi mong muốn sử dụng Claude Opus 5 ngày càng nhiều cho việc đánh giá mã, và tôi tự tin nói rằng chúng tôi muốn mọi người sử dụng Opus 5 hơn là Opus 4.8.
Điều nổi bật về Claude Opus 5 là khả năng phán đoán. Nó suy nghĩ kỹ hơn trước khi viết một dòng mã, tự bắt lỗi logic của chính mình trong quá trình lập kế hoạch thay vì sau khi sự việc đã xảy ra, và suy luận về lý do tại sao một câu trả lời đúng, chứ không chỉ là liệu nó có hoạt động hay không. Đây là bước nhảy vọt rõ ràng nhất trong việc giải quyết vấn đề mà chúng tôi từng thấy từ mô hình Claude này sang mô hình tiếp theo, và chúng tôi mong chờ thấy nó được áp dụng trong các IDE của JetBrains.
Claude Opus 5 là mô hình Opus mạnh nhất mà chúng tôi đã thử nghiệm trên bài kiểm tra giao dịch của mình, và nó đạt được điều đó bằng cách sử dụng khoảng một phần bảy số token suy luận và độ trễ dưới một nửa so với Opus 4.8. Câu trả lời tốt hơn với chi phí tính toán chỉ bằng một phần nhỏ.
Claude Opus 5 cho phép các đại lý giám sát quản lý một phần bộ nhớ của chính họ trong môi trường sản xuất, giúp chúng tự chủ và đáng tin cậy hơn trong các khung thời gian dài hơn. Đại lý coi ngữ cảnh của nó như một tài liệu sống: sau khi gắn cờ một sự bất thường tiềm ẩn trong một trong các dịch vụ của chúng tôi, nó đã kiểm tra lại giả định của chính mình so với môi trường sản xuất, phát hiện tín hiệu đó là lành tính, viết phần sửa lỗi vào bộ nhớ của nó và tự rút các truy vấn giám sát của mình.
Claude Opus 5 là một mô hình lập trình đại lý mạnh mẽ được xây dựng cho công việc dài hạn, nhiều bước. Nó hiểu sâu sắc cơ sở mã của bạn, duy trì mạch tư duy qua các tác vụ phức tạp và xác định các yêu cầu để phát triển tính năng và sửa lỗi hiệu quả hơn Opus 4.8. Các nhà phát triển hiện có thể xây dựng với Opus 5 trong Kiro, tiếp cận các khả năng nâng cao của nó để giải quyết các dự án đầy tham vọng.
01 /
24
Bài viết được AI dịch và tổng hợp tự động từ Anthropic: Newsroom (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.