‹ Quay lạiTinh chọnĐiểm AI 62/100
Fireworks AI (Web)
Tinh chọnĐiểm AI 62/100

Sản phẩm

Fireworks AI ra mắt FireRouter với Opus: Tối ưu chi phí lập trình lên đến 57%

(giờ Việt Nam)

Tóm tắt AI

Fireworks AI giới thiệu FireRouter với Opus, cho phép định tuyến thông minh dựa trên bộ nhớ đệm giữa Claude Opus 5.5, GLM 5.3 và GLM 5.3 Flash, giúp tối ưu hóa hiệu suất và chi phí cho các tác vụ lập trình.

Chính văn · Bản dịch AI

Introducing FireRouter with Opus

Fireworks Nexus cho phép các đội ngũ kỹ thuật đưa các mô hình mở hàng đầu vào các hệ thống hiện có của họ và cắt giảm một nửa chi phí mà không làm ảnh hưởng đến tốc độ hay chất lượng. Giải pháp này bao gồm FireRouter, bộ định tuyến nhận biết bộ nhớ đệm (cache-aware) đầu tiên trên thị trường, tạo ra sự khác biệt lớn về tốc độ và chi phí.

Hôm nay, chúng tôi giới thiệu FireRouter with Opus, được tối ưu hóa cho dòng Opus và hiện đã có sẵn trong CLI của chúng tôi, đồng thời lần đầu tiên xuất hiện dưới dạng một mô hình định tuyến độc lập. Bất kỳ tài khoản Fireworks nào cũng có thể trỏ đến nó như một endpoint serverless giống như bất kỳ mô hình nào khác.

Sau hơn một tháng thử nghiệm A/B nội bộ, FireRouter with Opus thực hiện các tác vụ lập trình với độ chính xác đạt 98,1% trong khi chi phí thấp hơn 57% so với việc chỉ sử dụng Opus.

FireRouter là gì

FireRouter-diagram

Mỗi lượt tương tác của người dùng gửi đến FireRouter sẽ được đánh giá xem mô hình nào trong tập hợp phù hợp nhất với tác vụ đó. Sau đó, hệ thống ước tính chi phí xử lý của từng mô hình, bao gồm cả chi phí của bộ nhớ đệm prompt (prompt cache) và liệu việc từ bỏ bộ nhớ đệm này để chuyển sang mô hình khác có xứng đáng hay không. Cuối cùng, hệ thống sẽ định tuyến đến mô hình cân bằng tốt nhất giữa chất lượng và chi phí.

Hiện tại, lượt tương tác của người dùng sẽ được định tuyến giữa Claude Opus 5.5, GLM 5.3 và GLM 5.3 Flash. Tập hợp mô hình này sẽ thay đổi khi các mô hình và phiên bản mới được ra mắt.

Kết quả

Lưu lượng truy cập lập trình nội bộ của chúng tôi được phân bổ ngẫu nhiên vào các phiên sử dụng FireRouter with Opus hoặc nhóm đối chứng chỉ dùng Opus, trên cùng khối lượng công việc và người dùng.

Chi phí mỗi phiên giảm 57% (±19 điểm phần trăm), từ 15,36 USD xuống còn 6,63 USD.

cost

Để chấm điểm độ chính xác, chúng tôi xác minh xem tác nhân (agent) có hoàn thành công việc hay không, câu trả lời có đúng hay không và người dùng có phải thực hiện bất kỳ chỉnh sửa nào ở lượt tiếp theo hay không.

FireRouter with Opus đạt 78,7% số lượt được chấm điểm so với 80,2% của nhóm chỉ dùng Opus, tương đương 98,1% độ chính xác tổng thể.

Accuracy

Phần lớn lưu lượng truy cập của chúng tôi đến từ công việc lập trình nội bộ, nơi các mô hình mở có thể xử lý nhiều lượt tương tác thông thường. Tính năng định tuyến nhận biết bộ nhớ đệm của FireRouter đã cân nhắc khoản tiết kiệm từ việc chuyển đổi mô hình so với chi phí mất đi các lượt truy cập bộ nhớ đệm (cache hits). Kết quả là tỷ lệ cache hit đạt 94,2% với FireRouter và Opus, so với 97,8% khi chỉ dùng Opus– một sự đánh đổi nhỏ, có chủ đích giúp giảm đáng kể chi phí tổng thể.

Cache

Hai dòng lệnh để dùng thử

FireRouter with Opus hiện đã có sẵn trên nhiều hệ thống bao gồm Claude Code, Codex, Cursor IDE và nhiều hệ thống khác. Hãy bắt đầu với các lệnh bên dưới và tìm hiểu thêm tại tài liệu FireRouter.

bash Copy 12 fireconnect login fireconnect claude --model firerouter/opus

Đăng nhập vào Fireworks để xem mức tiết kiệm ước tính cho chi phí sử dụng Claude Opus của đội ngũ bạn.

FireRouter with Opus savings chart
Fireworks AIĐịnh tuyến AITối ưu chi phíClaude Opus 5.5Lập trình

Bài viết được AI dịch và tổng hợp tự động từ Fireworks AI (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Fireworks AI ra mắt FireRouter với Opus: Tối ưu chi phí lập trình lên đến 57% | AIHOT.vn