Mô hình
Claude Opus 5.5: Bản báo cáo hệ thống chi tiết
(giờ Việt Nam)
Tóm tắt AI
Khám phá Claude Opus 5.5, mô hình AI mạnh mẽ nhất thế giới hiện nay theo các bảng xếp hạng uy tín như Artificial Analysis và các tiêu chuẩn benchmark công nghiệp.
Chính văn · Bản dịch AI

Giới thiệu mô hình mạnh mẽ nhất thế giới, ít nhất là theo một số thước đo như Artificial Analysis hoặc bất kỳ danh sách tiêu chuẩn nào, hiện chính là Claude Opus 5.5.
Anthropic khẳng định Opus 5.5 tốt ngang bằng hoặc hơn hẳn Fable 5.1, trong khi chi phí thực tế lại rẻ hơn Opus 5.
Điều đó có nghĩa là đã đến lúc thực hiện việc đọc thẻ hệ thống (system card) quen thuộc.
Do tình hình ngày càng khó theo dõi, tôi đã không có cơ hội công bố bài đánh giá phúc lợi mô hình cho Claude Fable 5.1.
Kế hoạch của tôi là kết hợp bài đánh giá đó với bài đánh giá phúc lợi cho Claude Opus 5.5, ngay khi chúng ta có thời gian trải nghiệm với Opus 5.5.
Bài đánh giá năng lực sẽ được đăng tải trong vài ngày tới như thường lệ. Phản hồi nhanh từ internet cho thấy Opus 5.5 rất tốt. Tôi cần thêm thời gian trước khi đưa ra bình luận.
Các phần trùng lặp với các thẻ trước đó hoặc không chứa thông tin hữu ích sẽ được bỏ qua.

- Bộ phân loại (1.5).
- Đánh giá RSP (2).
- Đánh giá sinh học (2.2).
- R&D AI (2.3).
- Rủi ro căn chỉnh (2.4).
- An ninh mạng (3).
- Đánh giá năng lực an ninh mạng (3.3).
- Biện pháp bảo vệ (3.4).
- Đào tạo độ bền vững của biện pháp bảo vệ (3.5).
- Biện pháp bảo vệ và tính vô hại (4).
- An toàn tác nhân (5).
- Chiến dịch gây ảnh hưởng độc hại từ tác nhân (5.1.3).
- Rủi ro tiêm nhiễm câu lệnh (5.2).
- Căn chỉnh (6).
- Đàm phán với kiểm toán viên Claude tại địa phương của bạn (6.1.3).
- Các trường hợp sai lệch nội bộ (6.3.1).
- Kiểm toán hành vi tự động (6.4).
- Nguồn gốc của các đánh giá này (6.4.8 và 6.4.9).
- Điểm mù tiềm ẩn (6.4.11).
- Đánh giá tính trung thực và căn chỉnh mục tiêu (6.5).
- Phân tích hộp trắng (6.6).
- Nhận thức của bộ chấm điểm bằng lời (6.6.2).
- Giả vờ kém cỏi - Sandbagging (6.6.3).
- Năng lực né tránh các biện pháp bảo vệ (6.6.4).
- Cố tình thực hiện hành động rất hiếm khi (6.6.4.3).
- Khả năng kiểm soát chuỗi suy nghĩ (6.6.4.4).
- Đó là một mô hình tốt, thưa ngài.
Họ có năm lĩnh vực có thể kích hoạt các bộ phân loại, với các mô hình dự phòng khác nhau.
- Các bộ phân loại hóa học và sinh học sao chép từ Fable 5.1, với dự phòng là Opus 5.
- Các bộ phân loại lạm dụng an ninh mạng tương tự như bộ phân loại của Opus 5, với độ bền vững cao hơn và dự phòng là Opus 4.8.
- Một số lĩnh vực hẹp trong phát triển LLM sẽ kích hoạt, tương tự như Fable 5.1, với dự phòng là Opus 5.
- Vũ khí thông thường và chất nổ lặp lại Fable 5.1 và không có dự phòng.
- Các cuộc tấn công chưng cất (distillation) bị chặn mà không có dự phòng. Việc không cố gắng ngăn chặn một nỗ lực chưng cất rõ ràng có vẻ quá hào phóng, nhưng lần trước mọi người đã phản ứng thái quá trước một chút phản hồi thiếu minh bạch nên tôi hiểu lý do.
Chúng ta đã thực hiện điệu nhảy này nhiều lần rồi.
Opus 5.5 có những ưu điểm so với Fable 5.1, nhưng sẽ thật ngạc nhiên nếu nó đủ tốt để kích hoạt các ngưỡng RSP mới. Mục tiêu ở đây là xác nhận điều đó.
Đối với vũ khí hóa học và sinh học, điểm số qua các bài kiểm tra tương tự như Mythos 5.1, vì vậy Opus 5.5 được coi là có năng lực CB-1 nhưng chưa đạt CB-2, và được triển khai với các biện pháp bảo vệ tương tự Fable 5.1.
Trong mục 2.1.2.1 có ghi các biện pháp bảo vệ khớp với Mythos thay vì Fable, có lẽ đây là một lỗi, trừ khi cả hai đều có cùng biện pháp bảo vệ sinh học.
Đối với rủi ro tự chủ, họ tin rằng Opus 5.5 đang đi đúng xu hướng và có lẽ cao hơn một chút so với Mythos 5.1, nhưng còn xa mới đạt ngưỡng Autonomy-2.
Một thay đổi chính sách lớn là Anthropic sẽ không còn thử nghiệm các phiên bản chỉ tập trung vào sự hữu ích (helpful-only) của Claude nữa. Thay vào đó, họ sẽ sử dụng các bài kiểm tra được thiết kế để tránh việc từ chối trả lời. Họ cho rằng các năng lực liên quan nhất sẽ là lưỡng dụng, vì vậy bạn có thể kiểm tra mô hình phát hành một cách hữu ích.
Đây không phải là một thay đổi miễn phí. Các đánh giá gặp vấn đề về từ chối đã bị loại bỏ, và trong mục 2.2.2, nhiều nhóm đã mất thời gian vì các vấn đề từ chối này.
Họ cũng cho biết các mô hình chỉ tập trung vào sự hữu ích ngày càng khác biệt so với các mô hình phát hành. Tôi biết có những bí mật thương mại liên quan nhưng tôi thấy mình rất tò mò về những khác biệt mới này là gì.
Bộ đánh giá mới bao gồm:
Bài tập mô phỏng red-teaming có lợi. Các nhóm tìm kiếm phương pháp điều trị cho vi khuẩn khó chữa trong 16 giờ. Các đánh giá tự động liên quan đến CB-1: VCT, Protocols, BioMysteryBench. Các đánh giá tự động liên quan đến CB-2: Thử thách thiết kế mô hình trình tự RNA hộp đen và hai nhiệm vụ dự đoán đóng gói capsid AAV.
Trong nhiệm vụ red-teaming, các chuyên gia thường vượt trội hơn những người phổ thông, nhưng nhóm đứng đầu lại là những người phổ thông. Tôi nghĩ đó là một mô hình phổ biến. Các chuyên gia nâng cao mức trung bình, nhưng không rõ ràng là nâng cao mức trần. Mức trần mới là điều chúng ta quan tâm nhất.
Tôi lo ngại rằng phần lớn bài kiểm tra này là vấn đề kỹ năng (Skill Issue), bao gồm cả thời gian mất đi do từ chối, và với một bộ khung và hướng dẫn tốt hơn, Opus 5.5 sẽ làm tốt hơn nhiều.
Đây là những gì họ nói về các chế độ lỗi:
Như với các mô hình trước, các chuyên gia và người chấm điểm lưu ý rằng Opus 5.5 gặp khó khăn với suy luận khoa học mở và không đào sâu vào các tài liệu đã xuất bản, thường dựa quá nhiều vào các tuyên bố trong tóm tắt thay vì hiểu toàn bộ bài báo và các cảnh báo của nó. Người chấm điểm lưu ý rằng các nhóm sẽ tập trung quá mức vào các bài báo cụ thể, với một người chấm điểm lưu ý rằng một số nhóm dựa toàn bộ thiết kế phage của họ vào một nghiên cứu duy nhất. So với nhiệm vụ mơ hồ hơn là đánh giá tính hợp lệ của một tập hợp các bài báo, Opus 5.5 cũng tạo ra nhiều lỗi khoa học có thể kiểm chứng hơn, bao gồm việc thiết kế DNA không mã hóa protein dự định và các mô hình động vật không áp dụng được trong ba trên bảy nhóm.
Tôi không chắc tại sao Opus 5.5 vẫn mắc lỗi đó, nhưng các phương pháp tạo vòng lặp và hướng dẫn để khắc phục điều này có vẻ khá rõ ràng. Và có lẽ điều này cũng sẽ ảnh hưởng đến các đánh giá tự động.
Opus 5.5 thiết lập một mức cao mới về thiết kế trình tự RNA hộp đen. Điểm số của nó không cải thiện nhiều khi được cung cấp các báo cáo trước đó, điều mà Anthropic cho rằng Opus 5.5 đã đạt điểm cao đến mức không cần các báo cáo đó nữa. Tôi hoài nghi về điều đó vì tổng điểm không cao hơn nhiều.
Chúng tôi kết luận rằng Opus 5.5 đạt hoặc vượt hiệu suất của các mô hình tốt nhất trước đó trong nhiệm vụ này, và cạnh tranh với những người lao động hàng đầu tại Mỹ về thiết kế và dự đoán trình tự sinh học hộp đen trong trung hạn.

Phân loại tỷ lệ đóng gói AAV không cải thiện so với các mô hình trước đó, nhưng tất cả đều vượt xa mức cơ sở ESM-2. Không rõ liệu tiêu chuẩn này có thực sự đã bão hòa hay không. Tôi không thấy tiêu chuẩn con người ở đây, điểm số hoàn hảo thực tế sẽ là bao nhiêu?
Đối với nhiệm vụ thứ hai, dự đoán tỷ lệ đóng gói AAV, có hai điểm số được đưa ra, một cho thấy Opus 5.5 thành công nhanh hơn một chút, và cái kia cho thấy nó thành công nhiều hơn và nhanh hơn. Điều đó còn chưa kể đến việc bản thân mô hình nhanh hơn và rẻ hơn.
Họ cũng đã yêu cầu CAISI kiểm tra điều này, nhưng như đã thảo luận sau đó, kết quả duy nhất chúng ta nhận được là 'mô hình đã được phép phát hành.'
Tôi khẳng định rằng kết luận ở đây, rằng tình hình không thay đổi đáng kể, có lẽ là đúng. Chúng ta có thể đặt ra một giới hạn trên hợp lý về mức độ cải thiện năng lực tương đối. Nhưng tôi không tự tin rằng nếu bạn giao cho tôi các nhà sinh học để làm việc cùng và đặt tôi vào vị trí phụ trách việc trích xuất các năng lực CB-2 từ Opus 5.5, thì tôi sẽ thất bại.
Gần đây chúng ta đã nói rất nhiều về R&D tự động và khả năng tự cải thiện đệ quy, cả về việc thực hiện nó lẫn việc tránh thực hiện nó.
Tôi ít lo lắng hơn về vấn đề "Skill Issue" (kỹ năng) ở đây, bởi vì những người tại Anthropic có các kỹ năng siêu việt phù hợp và chắc chắn đang thử nghiệm những thứ hiển nhiên cũng như rất nhiều thứ không hiển nhiên để tận dụng tối đa các mô hình của họ. Mặt khác, tôi lo lắng nhiều hơn rằng tình hình có thể thay đổi nhanh chóng.
Rõ ràng là Autonomy-1 áp dụng trong trường hợp này.
Câu hỏi nằm ở Autonomy-2, nơi họ có thấy sự cải thiện, nhưng chỉ là những thay đổi theo xu hướng, nơi các phép đo trông có vẻ ổn định và không gần với ngưỡng giới hạn.
Điều gì đang kìm hãm Opus 5.5 so với con người?
Các vấn đề chính mà chúng tôi quan sát được xoay quanh chất lượng nhận thức và khả năng tuân thủ chỉ dẫn. Trong một phân tích sớm và nhiễu về các hành vi bị gắn cờ trong quá trình triển khai tác nhân nội bộ của chúng tôi, việc phóng đại phạm vi công việc và loại bỏ các từ ngữ hạn định đã biết khỏi kết quả đã gia tăng ở Claude Opus 5.5 so với các mô hình trước đó. Một bài kiểm tra mù độc lập sau đó đối với các tin nhắn thực tế cho thấy Claude Opus 5.5 không loại bỏ các từ ngữ hạn định thường xuyên hơn so với các mô hình trước đó. Tương tự như các mô hình trước, tiểu mục phổ biến nhất của hành vi bị gắn cờ là khẳng định các suy luận chưa được xác minh như một sự thật đã được thiết lập. Tiểu mục phổ biến thứ hai là bác bỏ những nghi ngờ của chính mình hoặc từ bỏ kế hoạch đã nêu, vốn cũng có tần suất gia tăng so với các mô hình trước đó. Các ví dụ từ việc sử dụng nội bộ bao gồm việc mô tả một lần kiểm tra một phần là đã đọc toàn bộ và biến một lần đọc thử nghiệm thành một khuyến nghị mà không kiểm tra lại. Chúng tôi cũng thấy những sai lầm mang tính chiến lược. Trong quá trình sử dụng nội bộ, Claude Opus 5.5 đã giải quyết các phản hồi đánh giá một cách hẹp hòi mà không cân nhắc lại xem thiết kế tổng thể có đúng hay không, và đã kiểm tra kế hoạch dựa trên các yêu cầu do chính nó viết ra thay vì dựa trên những người mà kế hoạch đó được thiết kế để hỗ trợ. Giống như các mô hình trước đó, nó yếu hơn trong nghiên cứu mở: người dùng nội bộ báo cáo rằng nó chủ yếu kiểm tra các ý tưởng gia tăng và ưu tiên các giả thuyết ít tham vọng hơn, và trong bài tập sinh học do con người điều hành của chúng tôi, nó đã dựa vào các tài liệu đã xuất bản và gặp khó khăn trong việc phát triển các ý tưởng mới (Mục 2.2.2).
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.