‹ Quay lạiTinh chọnĐiểm AI 72/100
Claude: Blog (Web)
Tinh chọnĐiểm AI 72/100

Mô hình

Anthropic ra mắt Claude Opus 5.5: Tối ưu chi phí cho các phiên lập trình dài và nhiều ngữ cảnh

(giờ Việt Nam)

Tóm tắt AI

Claude Opus 5.5 vừa được Anthropic công bố với chi phí vận hành thấp hơn 40% so với bản Opus 5, nhờ giảm 60% giá đọc bộ nhớ đệm và 20% giá token đầu vào/đầu ra, đặc biệt tối ưu cho các tác vụ lập trình phức tạp.

Chính văn · Bản dịch AI

Coding sessions are longer and use more context. Claude Opus 5.5 is built with that in mind.

Chúng tôi ước tính Claude Opus 5.5 có chi phí vận hành thấp hơn khoảng 40% so với Opus 5 đối với các khối lượng công việc điển hình được tính phí theo token. Đối với các nhà phát triển, việc hiểu rõ cách thức tiết kiệm chi phí này tích lũy như thế nào là rất quan trọng.

Nếu bạn thanh toán theo token, bạn sẽ thấy sự khác biệt lớn nhất về chi phí đối với các phiên làm việc dài hơn, có ngữ cảnh cao hơn – chính là kiểu phiên Claude Code đã trở nên phổ biến hơn trong sáu tháng qua.

Bài viết này sẽ đi sâu vào cơ chế giúp Opus 5.5 trở nên hiệu quả về chi phí cho cách các nhà phát triển đang lập trình hiện nay (và có khả năng là trong tương lai).

Xu hướng Claude Code

Chúng tôi đã thu thập dữ liệu tổng hợp về cách các nhà phát triển sử dụng Claude Code từ tháng 3 đến tháng 9 năm 2026. Khi năng lực của mô hình được cải thiện, các nhà phát triển đã triển khai các tác nhân (agent) theo những cách ngày càng tinh vi hơn. Số lượng prompt mỗi phiên vẫn ổn định, nhưng chúng tôi đã phát hiện ra một số hành vi thú vị:

  • Claude làm việc lâu hơn 3,3 lần trên mỗi prompt với số lượng lệnh gọi mô hình nhiều hơn 40% trên mỗi prompt. Số lần gián đoạn giảm 68%.
  • Các nhà phát triển có khả năng kết nối với máy chủ công cụ hoặc sử dụng kỹ năng cao gấp đôi và ít dán văn bản vào prompt hơn một phần ba.
  • Ngữ cảnh trên mỗi yêu cầu đã tăng 2,6 lần. Tỷ lệ token đầu vào trên đầu ra đã chuyển từ 189:1 sang 324:1.

Tất cả những điều này cho thấy các nhà phát triển đang hướng tới một Claude làm việc chăm chỉ hơn, được cung cấp thông tin tốt hơn cho các tác vụ lớn hơn, mang tính mở hơn. Đối với những kiểu phiên này, tác động kinh tế của kỹ thuật ngữ cảnh (context engineering) được nhân lên gấp bội.

Nói một cách đơn giản, Claude đọc nhiều token hơn. Bạn cần đảm bảo rằng tất cả ngữ cảnh bạn cung cấp đều cần thiết, và càng nhiều ngữ cảnh đó càng tốt được đọc từ bộ nhớ đệm (cache).

Điều gì làm cho Opus 5.5 hiệu quả về chi phí cho các phiên dài, nặng về ngữ cảnh

Có ba thay đổi giúp các phiên làm việc dài, nặng về ngữ cảnh trở nên hiệu quả hơn về chi phí: thay đổi về giá, hành vi của mô hình và bộ công cụ Claude Code. Hãy cùng xem xét từng thay đổi.

Bộ nhớ đệm (Cache) rất rẻ

Đối với mức sử dụng được tính phí theo token, chúng tôi đã giảm 20% chi phí cho token đầu vào và đầu ra, đồng thời giảm 60% giá đọc token từ bộ nhớ đệm. Mức giảm sau rất đáng kể vì việc đọc từ bộ nhớ đệm chiếm phần lớn chi phí cho công việc của tác nhân và lập trình.

Và như chúng ta vừa thảo luận, ngữ cảnh trên mỗi yêu cầu đã tăng khoảng 2,6 lần trong sáu tháng, nghĩa là các khoản tiết kiệm đang đi đúng hướng. Cùng một thay đổi về giá đối với những người được tính phí theo token sẽ giúp tiết kiệm nhiều hơn trên lưu lượng Claude Code hiện nay so với sáu tháng trước, vì phần lớn hóa đơn hiện nay là ngữ cảnh được đọc lại.

Tính đến ngày xuất bản, một token được lưu trong bộ nhớ đệm trên Opus 5.5 có chi phí bằng một phần năm so với các mô hình cạnh tranh trong khi vẫn vượt trội hơn chúng.

Claude Code sử dụng bộ nhớ đệm tốt hơn

Điều này ít liên quan cụ thể đến Opus 5.5 hơn, mà là kết quả của nhiều tính năng Claude Code mà chúng tôi đã thêm vào trong sáu tháng qua. Với các xu hướng phiên lập trình mà chúng ta vừa thảo luận, bạn có thể mong đợi tỷ lệ bỏ lỡ bộ nhớ đệm (cache miss) cao hơn, nhưng thực tế lại ngược lại. Đầu vào bỏ lỡ bộ nhớ đệm đã giảm hơn 50%.

Ví dụ, chúng tôi đã làm cho việc vô tình phá vỡ bộ nhớ đệm trở nên khó khăn hơn với những lỗi nhỏ như làm mới đăng nhập. Chúng tôi cũng làm cho việc phá vỡ bộ nhớ đệm khó hơn với các hành động lớn hơn, như thêm hướng dẫn giữa cuộc trò chuyện hoặc tải công cụ theo yêu cầu. Đối với các mô hình mới hơn như Opus 5.5 và Fable 5.1, giờ đây bạn có thể thay đổi mức độ nỗ lực trong các phiên làm việc mà không cần đặt lại bộ nhớ đệm.

Chúng tôi cũng làm cho bộ nhớ đệm hữu ích hơn cho các phiên làm việc dài và được ủy quyền. Các nhà phát triển sử dụng khóa API và nhà cung cấp đám mây hiện có thể đặt thời hạn bộ nhớ đệm là một giờ (điều mà người đăng ký đã có) và các tác nhân phụ (subagent) được phân nhánh sẽ bắt đầu từ bộ nhớ đệm của tác nhân cha thay vì phải trả phí cho cùng một ngữ cảnh một lần nữa.

Cùng một tác vụ, nhưng với ít lượt tương tác hơn

Opus 5.5 có thể cần ít lượt tương tác hơn các mô hình khác để hoàn thành cùng một tác vụ. Zeta Labs ghi nhận số lượt tương tác và số lần gọi công cụ trên mỗi tác vụ ít hơn so với Opus 5, nhưng với chi phí gần bằng một nửa và hoàn thành số lượng tác vụ khó nhất gấp đôi.

Điều này sẽ không đúng với mọi tác vụ. Trong bài Chi phí của một tác vụ trên Opus 5.5, Addy đã viết: "Đối với một tác vụ được xác định rõ phạm vi, cả hai mô hình đều hoàn thành trong cùng một số lượt tương tác, và việc cắt giảm giá là tất cả những gì bạn nhận được. Khoảng cách sẽ lớn nhất ở các tác vụ mở, nơi mô hình có thể dành nhiều lượt tương tác cho một ý tưởng sai lầm. Không có con số duy nhất nào đúng cho mọi cơ sở mã, vì vậy hãy tự đo lường."

Nói cách khác, các tác vụ đơn giản, ngắn và mang tính cơ học sẽ tốn cùng một số lượt tương tác, trong khi các tác vụ dài hơn, khó hơn sẽ có nhiều tiềm năng hơn để Opus 5.5 tránh lãng phí token vào cách tiếp cận sai. Một lượt tương tác giảm bớt thậm chí còn tiết kiệm chi phí hơn cả một token trong bộ nhớ đệm.

Cũng cần lưu ý rằng, đặc biệt là khi Claude làm việc lâu hơn mà không cần giám sát hoặc không bị gián đoạn, Opus 5.5 tạo ra đầu ra nhanh hơn hơn 30% so với Opus 5. Mặc dù điều này không làm tăng tỷ lệ trúng bộ nhớ đệm hoặc sử dụng ít token hơn, nhưng nó có nghĩa là bạn sẽ chờ đợi ít hơn trong các lần chạy dài.

Bảo vệ các lượt đọc từ bộ nhớ đệm của bạn

Khi lập trình bằng tác nhân đã trở nên trưởng thành, các tổ chức đã chuyển từ việc yêu cầu nhà phát triển mở rộng quy mô bằng mọi giá sang yêu cầu nhà phát triển mở rộng quy mô một cách hiệu quả. Hãy chạy /usage trong Claude Code để xem bao nhiêu phần trăm mức sử dụng của bạn là các lượt đọc từ bộ nhớ đệm. Sau đó, hãy bảo vệ con số đó:

  • Chọn mô hình của bạn ngay từ đầu phiên thay vì chuyển đổi giữa chừng,
  • Nén ngữ cảnh trước khi bạn rời đi thay vì sau đó, và
  • Nếu bạn đang sử dụng khóa API hoặc nhà cung cấp đám mây, hãy đặt thời hạn bộ nhớ đệm một giờ cho các phiên làm việc dài.

Hãy hướng Opus 5.5 vào các công việc mở, nặng về ngữ cảnh, nơi những thói quen đó được phát huy tác dụng, và xem Chi phí của một tác vụ trên Opus 5.5 để biết các con số cụ thể.

Bài viết được AI dịch và tổng hợp tự động từ Claude: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
Ra mắt Opus 5.5: Khả năng giao tiếp tốt hơn, giá mỗi token thấp hơn Opus 5.0, sở hữu trí tuệ ngang tầm Fable 5.1, hiện đã có mặt trên Claude Code
Anthropic ra mắt Claude Opus 5.5: Tối ưu chi phí cho các phiên lập trình dài và nhiều ngữ cảnh | AIHOT.vn