MarkTechPost
85

Sản phẩm

Fireworks AI ra mắt Fireworks Nexus: Giải pháp tối ưu chi phí cho lập trình viên bằng mô hình mã nguồn mở

(giờ Việt Nam)

Tóm tắt AI

Fireworks Nexus là lớp điều hướng thông minh giúp chuyển các tác vụ lập trình thông thường từ các mô hình đắt đỏ sang mô hình mã nguồn mở, giúp doanh nghiệp kiểm soát ngân sách AI hiệu quả.

Bản dịch AI

Fireworks AI Releases Fireworks Nexus: A Drop-In Routing and Cost-Control Layer That Moves Routine Coding Work to Open-Weight Models

Fireworks AI vừa ra mắt Fireworks Nexus, một nền tảng quản lý và điều hướng AI dành cho các tổ chức kỹ thuật. Nền tảng này kết nối các công cụ lập trình mà các nhà phát triển đang sử dụng với một lớp quản lý các mô hình mã nguồn mở (open-weight models).

Vấn đề mà nền tảng này nhắm đến đã được ghi nhận rõ ràng. Forbes đưa tin rằng Uber đã tiêu tốn toàn bộ ngân sách AI năm 2026 chỉ trong bốn tháng. Claude Code đã đạt khoảng 5.000 kỹ sư sau khi ra mắt vào tháng 12. Fireworks trích dẫn báo cáo tương tự, lưu ý rằng tỷ lệ áp dụng các tác nhân AI (agentic adoption) đã tăng từ khoảng một phần ba lên hơn bốn phần năm số kỹ sư chỉ trong hai tháng.

Fireworks cho rằng vấn đề cốt lõi nằm ở sự không tương xứng, chứ không phải do chi tiêu quá mức. Hầu hết các tổ chức đang vận hành các công việc thường nhật với mức giá của các mô hình tiên tiến (frontier prices). Sự phức tạp trong vận hành đã khiến việc chuyển sang các mô hình mã nguồn mở trở nên kém hấp dẫn đối với các đội ngũ nền tảng.

Nexus bao gồm ba thành phần:

1. Kiểm soát doanh nghiệp và khả năng quan sát chi phí: Các nhóm thiết lập ngân sách ở cấp độ nhóm hoặc công ty. Họ theo dõi ROI trên các mô hình và công cụ, đồng thời thực thi chính sách từ một nơi duy nhất. Các yêu cầu chạy trên nền tảng suy luận (inference platform) của Fireworks, với các điểm cuối (endpoints) được lưu trữ tại Mỹ, không lưu trữ dữ liệu và có độ phủ trên 20 trung tâm dữ liệu toàn cầu.

2. Tính liên tục của quy trình làm việc: FireConnect là công cụ cài đặt một dòng lệnh giúp ánh xạ các vị trí mô hình (model slots) vào các mô hình của Fireworks. Nó được phát hành theo giấy phép Apache 2.0 và có thể được cài đặt từ Fireworks Dashboard chỉ bằng một lệnh duy nhất. Claude Code, Codex và OpenCode vẫn hoạt động bình thường mà không cần thay đổi. FireConnect chạy trên các API Serverless của Fireworks tương thích với Anthropic và OpenAI, vì vậy hầu hết các công cụ đều kết nối thông qua URL cơ sở và ID mô hình.

3. Quản lý lưu lượng thông minh: Một mô hình được huấn luyện tùy chỉnh sẽ chấm điểm độ khó của từng yêu cầu. Các yêu cầu thông thường sẽ được chuyển đến một mô hình mã nguồn mở tiết kiệm chi phí do Fireworks cung cấp. Các yêu cầu khó sẽ được chuyển tiếp đến nhà cung cấp hiện tại của bạn bằng khóa (key) riêng, mà Fireworks khẳng định là không bao giờ được lưu trữ ở phía máy chủ. Nhóm nghiên cứu báo cáo rằng điều này thường giúp giảm chi phí từ 3–5 lần.

Một lưu ý quan trọng cho bất kỳ ai đang lên kế hoạch triển khai: Bộ định tuyến (router) hiện đang ở giai đoạn xem trước nghiên cứu (research preview). Nó hiện điều hướng giữa Claude Opus 5 và GLM-5.2, vì vậy đường dẫn chuyển tiếp yêu cầu phải có khóa Anthropic. Một cấu hình hoàn toàn mở sẽ điều hướng giữa Kimi K3 và GLM-5.2 thay thế.

Hiệu suất

Nhóm nghiên cứu của Fireworks đã thử nghiệm Nexus với các đội ngũ phát triển bao gồm Notion và Doximity. Kết quả sơ bộ cho thấy chi phí cho mỗi pull request được hợp nhất giảm một phần ba. Nhóm nghiên cứu cũng báo cáo tỷ lệ token hỗn hợp chỉ bằng khoảng một phần tư so với các phòng thí nghiệm mô hình đóng. Đây là những số liệu từ nhà cung cấp trong chương trình xem trước và nên được nhìn nhận theo hướng đó.

Những bằng chứng hữu ích hơn đến từ hai đánh giá độc lập mà Fireworks trích dẫn.

Faros AI đã chạy 211 tác vụ kỹ thuật thực tế được lấy từ 12 kho lưu trữ (repositories) qua bảy lộ trình mô hình và harness. Claude Code trên GLM-5.2 đạt 0,568 điểm theo thang đánh giá dựa trên mô hình. Claude Code trên Opus 4.8 đạt 0,521 điểm. Khoảng cách về chi phí lớn hơn khoảng cách về chất lượng: 0,92 USD mỗi tác vụ so với 1,76 USD. Tỷ lệ bộ nhớ đệm (cache share) lần lượt là 89,7% và 99,7%, vì vậy bộ nhớ đệm không giải thích cho kết quả này. Faros nhấn mạnh rằng nhóm thử nghiệm này là đặc thù của công ty và không phải là bảng xếp hạng chung.

Arize, trong một nghiên cứu chung với Fireworks, đã đánh giá 10 mô hình trên 40 tác vụ Terminal-Bench với sáu lần thử nghiệm mỗi tác vụ. Tổng cộng là 2.400 lượt chạy và 626 USD chi phí API, được chấm điểm bởi bộ kiểm thử (test suite) riêng của từng tác vụ. Chỉ số chính là chi phí cho mỗi tác vụ thành công, bao gồm cả các lần thất bại và thử lại.

Hai phát hiện từ nghiên cứu đó liên quan trực tiếp đến thiết kế của Nexus. Đối với các tác vụ dễ, việc trả phí cho mô hình tiên tiến không mang lại lợi ích gì: Kimi K2.6 đạt tỷ lệ thành công 73% trong khi GPT-5.5 đạt 69%. Đối với các tác vụ khó, chỉ có các mô hình hàng đầu mới cạnh tranh được, với GPT-5.5 đạt 51% và Kimi K3 đạt 32%. Bộ đánh giá (evaluation harness) của Arize là mã nguồn mở, vì vậy các nhóm có thể chạy lại trên khối lượng công việc của riêng họ.

Việc mô phỏng điều hướng qua các lượt chạy đó đã đánh bại mọi chiến lược đơn mô hình. Một thang leo thang (escalation ladder) được thiết kế cẩn thận đạt mức 0,525 USD cho mỗi tác vụ thành công trong khi giải quyết ổn định 32,3 trên 40 tác vụ. Chỉ riêng GPT-5.5 tốn 0,636 USD và giải quyết ổn định 25 trên 40 tác vụ. Việc leo thang ngây thơ qua cả mười mô hình tốn 1,319 USD, tệ hơn bất kỳ mô hình đơn lẻ nào được thử nghiệm. Thiết kế thang leo thang là không thể thiếu.

Cách các nhóm thực sự kích hoạt tính năng này

Có ba con đường thực tế, và chúng có phạm vi ảnh hưởng (blast radii) khác nhau.

Con đường FireConnect là ít ma sát nhất. Trình cài đặt yêu cầu Claude Code CLI đã có sẵn trên PATH, nhắc nhập khóa API Fireworks một lần, đăng ký một marketplace plugin và ghi lại các cài đặt Claude Code với bản sao lưu có dấu thời gian. Nó cung cấp các lệnh /fireconnect:on, /fireconnect:off, /fireconnect:setup, /fireconnect:models và /fireconnect:set-models.

Con đường thứ hai bỏ qua hoàn toàn plugin. Thiết lập ANTHROPIC_BASE_URL và khóa Fireworks, hoặc sử dụng client tương thích với OpenAI với URL cơ sở và ID mô hình đã thay đổi. Arize lưu ý rằng việc thêm một mô hình vào harness của họ chỉ tốn một dòng cấu hình. Khả năng thay thế đó chính là điều giúp cho việc xây dựng thang leo thang trở nên khả thi.

Con đường thứ ba chính là bộ định tuyến, nằm phía trước một hợp đồng mô hình tiên tiến hiện có.

Những điểm chính cần lưu ý

Nguồn: Thông báo về Fireworks Nexus, kho lưu trữ FireConnect, đánh giá của Faros AI và tiêu chuẩn chi phí trên mỗi tác vụ thành công của Arize.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động.

Fireworks AITối ưu chi phíLập trìnhMô hình mởAI doanh nghiệp
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.