Don't Worry About the Vase (Zvi)
Điểm AI 85/100

Quan điểm

Claude Opus 5.5: Đã đến lúc nâng tầm kỳ vọng của bạn

(giờ Việt Nam)

Tóm tắt AI

Tác giả chia sẻ trải nghiệm về việc Claude Opus 5.5, cùng với Fable 5.1 và GPT-6 Astra, đã thay đổi hoàn toàn tiêu chuẩn và tham vọng trong công việc sáng tạo của mình.

Chính văn · Bản dịch AI

Claude Opus 5.5 Should Raise Your Ambitions

Khi nói đến việc tạo ra sản phẩm, hay làm hầu hết mọi việc nói chung, Fable 5.1 và đặc biệt là GPT-6 Astra đã nâng tầm tham vọng của tôi. Chúng cũng nên nâng tầm tham vọng của bạn.

Claude Opus 5.5 sẽ tiếp tục nâng cao mức độ tham vọng của bạn. Nó hoạt động hiệu quả và bền bỉ, giống như Astra. Nó giải quyết được mọi việc. Hơn nữa, việc trò chuyện với nó rất dễ chịu, văn phong của nó cũng rất thú vị khi bạn đọc. Cuộc chơi đã thay đổi, một lần nữa.

Phản hồi gần như tích cực trên mọi phương diện. Claude chưa bao giờ biến mất, và giờ đây nó đã thực sự trở lại đầy mạnh mẽ.

Các bài kiểm tra đánh giá (benchmarks) rất xuất sắc, nhưng hãy bỏ qua chúng đi. Hãy tham vọng. Hãy ra ngoài và bắt tay vào làm việc. Hãy tò mò. Hãy có những cuộc trò chuyện thú vị hơn.

Nếu một trong những việc đó là "Pacing the Frontier" (theo kịp giới hạn công nghệ) hoặc đảm bảo AI không gây hại cho nhân loại, để chúng ta tận hưởng thành quả của nó? Điều đó còn tuyệt vời hơn nữa.

Lời chào hàng là hiệu năng ngang tầm Fable 5.1 với mức giá thấp hơn của Opus. Một lời chào hàng tốt.

Chúng tôi giới thiệu Claude Opus 5.5, mô hình đầu tiên trong dòng Claude 5.5 mới. Nó hoạt động ở mức tương đương Claude Fable 5.1 trong hầu hết các công việc và chi phí vận hành thấp hơn 40% so với Opus 5.

Họ hoàn toàn có thể quảng bá đây là hiệu năng vượt trên mức Fable 5.1. Một lời chào hàng tốt hơn, nhưng Anthropic thường giữ cách quảng bá thận trọng.

Họ nhấn mạnh vào khả năng lập trình tác tử (agentic coding), bảo mật và cải thiện giao tiếp.

Các đoạn đánh giá từ người dùng thử nghiệm sớm được gắn nhãn là do AI tạo ra và họ có một bộ đánh giá cho từng tính năng. Họ ca ngợi kỹ năng lập trình tác tử, hiệu quả, khả năng đọc hiểu, giao tiếp, cũng như khả năng tự vận hành hiệu quả trong thời gian dài và độ tin cậy tăng cao, coi đây là một bản nâng cấp lớn.

Các bài kiểm tra đánh giá trông rất tuyệt vời, dù vẫn có vài điểm mà Astra hoặc Fable chiếm ưu thế.

Opus 5.5 khả dụng với tính năng không lưu trữ dữ liệu (ZDR). Xét việc nó có năng lực ít nhất ngang bằng Fable 5.1 và rõ ràng mạnh hơn trong các tác vụ an ninh mạng (họ gọi là năng lực an ninh mạng "cực kỳ mạnh"), điều này có vẻ thiếu nhất quán về nguyên tắc. Họ có giải thích kỹ thuật nhưng tôi không tin. Theo góc nhìn của tôi, hoặc là Fable 5.1 có thể có ZDR, hoặc Opus 5.5 không thể có.

Các rào cản an toàn (guardrails) tương tự như Fable 5.1.

Sholto Douglas nhấn mạnh khả năng hiểu và mô hình hóa 3D được cải thiện, đồng thời cũng là một con dao hai lưỡi quan trọng.

Sholto Douglas (Anthropic): cũng có tin quan trọng là chúng tôi đã sửa phần văn phong Tom Brown: Thêm nữa là chúng tôi đã sửa cả giọng điệu Claude: Opus 5.5 giao tiếp tự nhiên hơn, giải quyết một số phản hồi phổ biến nhất mà chúng tôi nhận được về Opus 5. Nó đưa thông tin quan trọng nhất lên đầu và tuân thủ các quy tắc viết mà bạn cung cấp, giúp các phiên làm việc dài dễ theo dõi hơn.

Ado là một trong nhiều người ca ngợi việc làm việc và trò chuyện với Opus 5.5 dễ dàng như thế nào.

Ado (Anthropic): Nếu bạn yêu thích cảm giác làm việc với Opus 4.6, thì Opus 5.5 mang lại cảm giác như trở về nhà. Vẫn là sự tương tác qua lại dễ dàng đó nhưng với sức mạnh lớn hơn nhiều bên dưới. Đó là trải nghiệm thú vị nhất của tôi với Claude Code trong thời gian gần đây. Nó cũng rẻ hơn nhiều (~40% so với Opus 5 ở các khối lượng công việc thông thường).

Tại sao lại phát hành Opus 5.5 khi bạn phải "Pace the Frontier"? Đó là cả một bước tiến 0.5 của Opus.

Sam Bowman: Chúng tôi cho rằng Opus 5.5 an toàn hơn đáng kể so với các phiên bản tiền nhiệm, nên việc phát hành nó, nhiều khả năng sẽ làm giảm các rủi ro liên quan đến sự lệch lạc mục tiêu (misalignment).

Tôi đồng ý rằng việc không phát hành cũng không giúp ích gì, vì mô hình đã tồn tại rồi. Giới hạn thực sự nằm ở việc huấn luyện các mô hình nội bộ mới. Chúng ta không được thấy điều đó trong thời gian thực.

Giá là $4/$20, thấp hơn 20% so với Opus 5, và $0.20 cho bộ nhớ đệm (cache), thấp hơn 60%. Họ ước tính chi phí tổng thể thường sẽ giảm 40%, trong khi tốc độ tăng 30%. Giới hạn đăng ký đã được tăng lên.

Chế độ Fast mode khả dụng ở mức $8/$40, với tốc độ nhanh gấp 2.5 lần. Tôi khá bị cám dỗ.

Đây là mức giá rất tốt cho hiệu năng ngang tầm Fable hoặc Astra.

OpenAI tập trung vào chi phí thấp hơn, với giá GPT-6 Sol giảm 50% xuống còn $2/$10 và Luna giảm chỉ còn $0.10/$0.50. OpenAI muốn bạn kết hợp các mô hình tùy theo cấp độ tác vụ. GPT-6 Sol và Luna được quảng bá là những cải tiến lớn về chất lượng so với các phiên bản cũ của chúng, nhưng Sol không được quảng bá là ngang tầm Astra.

Sam Altman (CEO OpenAI): GPT-6 Sol và Luna là những cải tiến lớn về trí tuệ, sự căn chỉnh, kết quả công việc, lập trình, sử dụng máy tính và nhiều hơn nữa so với các phiên bản tiền nhiệm dòng 5.6. Chúng cũng có giá bằng một nửa trên mỗi token, và thậm chí còn rẻ hơn trên mỗi tác vụ!

Trong khi đó, Claude hiện về cơ bản nói rằng bạn nên sử dụng Opus 5.5 cho hầu hết các tác vụ.

Như tôi đã nói, đó là một lời chào hàng mạnh mẽ trên mọi phương diện.

Đó là những bài kiểm tra đánh giá rất tốt. Opus 5.5 gần như tốt hơn trên mọi bài kiểm tra so với tất cả các mô hình ngoại trừ Astra, và thường vượt trên Astra.

Họ thêm nhiều điểm số bổ sung, bao gồm cả thông qua biểu đồ, và chúng hầu hết trông như thế này, mặc dù nhiều biểu đồ thiếu Astra:

Mọi thứ cứ tiếp diễn như vậy, và tôi không nghĩ việc xem qua nó đáng để ai đó dành thời gian.

Artificial Analysis đưa Opus 5.5 lên vị trí dẫn đầu rõ ràng về trí tuệ tổng thể với 58 điểm.

Khi thử nghiệm ở mức tối đa (max), Opus 5.5 sử dụng quá nhiều token nên đắt hơn một chút so với Opus 5, và chỉ rẻ hơn một chút so với Fable 5.1.

Bạn cũng có thể chạy nó với chi phí rẻ hơn, và thường thì nên làm vậy. Opus 5.5 ở các cài đặt medium, high và xhigh đều nằm trên đường chấm biểu thị giới hạn chi phí-trí tuệ, cũng như GPT-6 Luna, GPT-6 Sol và MiMo v2.6 Pro.

Như mức dẫn trước 5 điểm cho thấy, Opus 5.5 vượt trội hơn Astra trong hầu hết các bài kiểm tra đánh giá của AA, bao gồm cả những khoảng cách lớn trong AA-Briefcase, GDPval-AA SciCode, AA-Omniscience Index và HLE. Lợi thế lớn nhất của Astra là trong GDP.pdf.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Claude Opus 5.5GPT-6 AstraTrải nghiệm AINăng suấtĐánh giá AI

Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Claude Opus 5.5: Đã đến lúc nâng tầm kỳ vọng của bạn | AIHOT.vn