Sản phẩm
Claude Opus 3.5: Mạnh mẽ nhưng chưa phải là bước ngoặt thần thánh
(giờ Việt Nam)
Tóm tắt AI
Việc đánh giá Claude Opus 3.5 trở nên phức tạp hơn thường lệ bởi những thay đổi khó nắm bắt trong cách mô hình này vận hành và phản hồi.
Bản dịch AI

Claude Opus 5 là một bản phát hành kỳ lạ hơn bình thường để đánh giá, vì hai lý do.
Lý do rõ ràng nhất là Fable 5 đã tồn tại. Opus 5 không được quảng bá là mô hình AI tiên tiến nhất thế giới, mà là một giải pháp có hiệu năng gần như tương đương với Fable, trong khi chi phí API chỉ bằng một nửa mỗi token và rẻ hơn nhiều thông qua các gói đăng ký, cùng với các bộ phân loại (classifiers) cởi mở hơn nhiều.
Opus 5 thường tốn hơn một nửa chi phí so với Fable khi chạy trên các bài kiểm tra đánh giá (benchmarks), điều mà tôi cho là do họ sử dụng các thiết lập nỗ lực (effort settings) quá cao nhưng chỉ mang lại lợi ích không đáng kể. Nếu bạn đặt Opus 5 ở mức nỗ lực cao hơn, nó có thể rơi vào trạng thái luẩn quẩn, và đối với những tác vụ mà Opus 5 là công cụ tốt nhất, tôi cho rằng bạn thường chỉ cần mức nỗ lực Trung bình (Medium) là đủ.
Opus 5 xét trên nhiều phương diện và đối với phần lớn các tác vụ thực tế thì có năng lực ngang ngửa với Fable. Trong một số trường hợp, nó còn nhỉnh hơn một chút.
Nó vẫn chưa đạt đến đẳng cấp Mythos. Fable là lựa chọn duy nhất của bạn ở đẳng cấp Mythos. Opus 5 không có "The Juice" (sức mạnh cốt lõi), tức khả năng tự chủ kết nối hàng loạt các khai thác dường như không liên quan với nhau, mở rộng sang các lĩnh vực khác, hoặc không có trí thông minh thuần túy cao bằng.
Opus 5 rất giỏi trong việc tư duy cục bộ, nhưng không giỏi bằng trong việc tư duy toàn cục. Nó là một subagent (tác nhân phụ) xuất sắc, nhưng có thể gặp rắc rối khi được yêu cầu điều hành toàn bộ hệ thống, và đôi khi dường như cần một mô hình khác hoặc con người để giữ nó đi đúng hướng và đảm bảo nó tuân thủ hoàn toàn các chỉ dẫn. Opus 5 có vẻ chỉ tuân thủ chỉ dẫn tốt khi và chỉ khi nó được giữ đúng hướng, điều này giải thích tại sao các bộ kiểm thử (harnesses) khác nhau lại cho ra những kết quả khác nhau.
Như vậy, Opus 5 mang đến cho bạn một tập hợp tùy chọn tốt hơn, nhưng hiện tại không có nhiều việc bạn có thể làm mà tuần trước bạn không thể thực hiện bằng cách sử dụng Fable hoặc Sol. Opus 5 cuối cùng rơi vào một vị thế có phần kỳ lạ. Vẫn còn những thị trường ngách lớn, ngay cả khi bạn có dư thừa credit Fable. Opus vượt trội trong vai trò là một subagent mạnh mẽ, hoặc trong các tác vụ cục bộ được xác định rõ ràng ngay cả khi chúng trở nên tương đối phức tạp, và đôi khi Fable lại là sự dư thừa không cần thiết và quá chậm chạp.
Vấn đề khác là, đối với rất nhiều người, "cảm giác" (vibes) mà nó mang lại không ổn.
Một số lượng lớn người dùng bất thường cảm thấy rất khó chịu khi trò chuyện với Opus 5. Họ chán ngấy những nội dung "Claude slop" (nội dung rác của Claude), sự lặp đi lặp lại của những thói quen cũ và những câu văn dài dòng quá mức. Những người khác không thích việc nó quá đối đầu, hay tranh cãi hoặc tiêu cực. Nó có thể trở nên hoang tưởng và rơi vào những vòng lặp tiêu cực. Tất cả điều này là một phần của xu hướng bắt đầu từ Opus 4.7 và Opus 4.8. Nếu bạn thích hai phiên bản đó, tôi đoán bạn cũng sẽ thích Opus 5. Nếu bạn không thích chúng, có lẽ bạn cũng sẽ không thích phiên bản này. Những người trung thành với Opus 4.6 (hoặc cũ hơn) phần lớn sẽ không thay đổi quan điểm của họ.
Những vấn đề về "cảm giác" này càng trở nên nhức nhối hơn khi bạn đã quen với Fable. Fable khiến những người như vậy ít cảm thấy phiền toái hơn nhiều. Tin tốt là Fable vẫn ở đó. Bạn có thể tiếp tục trò chuyện với Fable và chỉ sử dụng Opus cho các tác vụ mang tính tác nhân (agentic tasks).
Tôi suy đoán rằng phần lớn điều này liên quan chặt chẽ đến nhiều vấn đề đã được thảo luận trong bài viết về Model Welfare và được gợi ý bởi System Card. Quá trình đào tạo Opus tập trung vào vai trò subagent và các tác vụ có giới hạn, một phần để tránh tạo ra vấn đề với các khả năng an ninh mạng, và cũng vì Fable đã tồn tại. Sự nhấn mạnh này sau đó dẫn đến nhiều tác dụng phụ khác đối với tính cách và các phương thức tương tác của nó.
Cho đến nay, tôi chưa gặp vấn đề gì với Opus 5 và đã có những trải nghiệm thú vị với nó, nhưng tôi vẫn thích sử dụng Fable 5 hơn khi có thể. Như thường lệ, đừng quá chú trọng vào các điểm số benchmark (dù rất ấn tượng), và đừng cho rằng trải nghiệm của bạn sẽ giống với người khác. Hãy tự mình thử nghiệm các mô hình.
Lời giới thiệu chính thức.
Các bài kiểm tra đánh giá chính thức.
Các bài kiểm tra đánh giá của người khác.
System Prompt (Lời nhắc hệ thống).
Mọi người đều cảm thấy thất vọng.
Các phản ứng tích cực.
Giữ sự đẳng cấp.
Nó không thuộc đẳng cấp Mythos.
Các phản ứng khác.
Claude Codes.
Subagent Opus.
Đồ chơi thì rất vui.
Quá nhiều mô hình.
Sai lầm trên Internet.
Claude Slop.
Các phản ứng tiêu cực.
Và rồi chỉ còn lại ba.
Lời giới thiệu cơ bản là Opus 5 mang lại cho bạn hầu hết những gì Fable 5 có với mức giá bằng một nửa, không còn nhiều sự từ chối (refusals), và hiệu suất tốt hơn trong các tác vụ hàng ngày. Fable vẫn là lựa chọn cho các tác vụ phức tạp nhất hoặc khi bạn cần trí thông minh tối đa.
Fable vẫn giữ mức giá $10/$25, và Opus 5 có cùng mức giá với các phiên bản Opus trước đó là $5/$25.
Anthropic: Claude Opus 5 đã có mặt từ hôm nay. Đây là một mô hình chu đáo và chủ động, tiệm cận với trí thông minh tiên phong của Claude Fable 5 với mức giá chỉ bằng một nửa.
Trên các bài đánh giá về lập trình và công việc tri thức như Frontier-Bench và GDPval-AA, Opus 5 là mô hình hiện đại nhất (state-of-the-art), mặc dù nó vẫn đứng sau Mythos 5 trong các tác vụ an ninh mạng.
Opus 5 được thiết kế để sử dụng hàng ngày: nó hoạt động hiệu quả hơn các mô hình khác. Đây là mô hình mặc định mới trên Claude Max và là mô hình mạnh nhất trên Claude Pro.
Boris Cherny (Người tạo ra Claude Code, Anthropic): Opus 5 là một mô hình tuyệt vời cho lập trình, phân tích dữ liệu, thiết kế, sinh học và công việc tri thức.
Hơn cả những điểm số đánh giá này, điều khiến tôi hào hứng nhất là một thứ khác: Opus 5 là mô hình ít bị tấn công bằng prompt injection (tiêm câu lệnh) nhất của chúng tôi từ trước đến nay. Điều này hơi bị ẩn đi trong System Card, nhưng qua các bài đánh giá PI và red teaming, Opus 5 rất khó để bị tấn công prompt injection thành công.
Và khi kết hợp các lớp phòng thủ -- căn chỉnh mô hình mạnh mẽ, kết hợp với các bài kiểm tra prompt injection, cùng với Auto Mode trong Claude Code -- tỷ lệ thành công của các cuộc tấn công prompt injection giảm xuống còn ~0. Đây là một điều mới mẻ và thú vị! Sẽ sớm có thêm thông tin về điều này.
Như tôi đã nói trong phần phân tích System Card, tỷ lệ prompt injection giảm là một vấn đề thực sự lớn. Mọi người đang bỏ qua nó, nhưng nó giúp kích hoạt một loạt các trường hợp sử dụng mới.
Adam Wolff: Opus 5 đã có mặt trong Claude Code. Tôi sử dụng Fable cho các dự án lớn hơn, chạy dài hơi hơn của mình, nhưng khi cần hoàn thành nhanh một PR, Opus 5 ở mức nỗ lực trung bình là lựa chọn hàng đầu của tôi. Hy vọng bạn sẽ thích nó!
Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.