LangChain: Blog
85

Thủ thuật

Đánh giá NVIDIA NeMo Switchyard: Chỉ 7% tác vụ AI cần đến các mô hình tiên tiến nhất

(giờ Việt Nam)

Tóm tắt AI

LangChain thử nghiệm trên 145 tác vụ cho thấy việc sử dụng chiến lược định tuyến thông minh qua NeMo Switchyard giúp giảm 74% chi phí mà vẫn duy trì độ chính xác cao, khi chỉ một phần nhỏ yêu cầu các mô hình đắt đỏ.

Bản dịch AI

Các tác nhân (agents) thực hiện rất nhiều lệnh gọi LLM, và hầu hết các đội ngũ đều gửi tất cả các lệnh đó đến cùng một mô hình. NVIDIA NeMo Switchyard là một thư viện định tuyến mô hình mã nguồn mở giúp tự động hóa việc lựa chọn mô hình trong các bước quy trình làm việc của tác nhân, nhờ đó những công việc không cần đến mô hình tiên tiến (frontier model) sẽ không bị gửi đến đó.

Chúng tôi đã chạy bộ đánh giá Deep Agents của mình thông qua Switchyard và đo lường số lượt mà bộ định tuyến gửi đến một mô hình tiên tiến. Kết quả là 7%. Một mô hình 30 tỷ tham số đã xử lý 93% còn lại. Việc định tuyến giữa NVIDIA Nemotron 3.5 Lightning và Claude Opus 4.8 đã cắt giảm tổng chi phí xuống 74% so với việc chỉ chạy Opus, trong khi vẫn giữ được 93% độ chính xác cho cùng các lệnh gọi đó.

Dưới đây là những gì chúng tôi đã đo lường, cùng với một công thức giúp bạn biết khi nào nên cân nhắc chiến lược tương tự cho khối lượng công việc của riêng mình.

Vấn đề khi chỉ chọn một mô hình

Gửi mọi lệnh gọi đến một mô hình duy nhất từng là lựa chọn mặc định hợp lý khi các mô hình có giá rẻ hơn và khả năng không chênh lệch quá nhiều. Điều đó đã thay đổi. Các mô hình tiên tiến ngày càng đắt đỏ và mạnh mẽ hơn, trong khi các mô hình mã nguồn mở (open weight models) đã trở nên đủ nhanh và rẻ để xử lý một phần đáng kể công việc của tác nhân, dù không phải tất cả. Trong khi đó, một lượt "đọc tệp này" và một lượt "tìm hiểu lý do tại sao bài kiểm tra này thất bại" vẫn được gửi đến cùng một mô hình với cùng mức giá trên mỗi token, mặc dù một bên là tác vụ đơn giản còn bên kia thì không.

Số lượng lượt thực sự cần đến mô hình đắt tiền là yếu tố quyết định việc định tuyến có mang lại hiệu quả kinh tế hay không. Chúng tôi đã chạy các bộ benchmark trên Deep Agents, vì vậy chúng tôi đã hướng một bộ vào bộ định tuyến thay vì một mô hình cụ thể.

Switchyard làm được gì

Switchyard là thư viện định tuyến mã nguồn mở của NVIDIA. Nó tự động định tuyến từng truy vấn của tác nhân qua bất kỳ sự kết hợp nào giữa các mô hình đóng và mở dựa trên các chiến lược bạn cấu hình cho từng bước. Bạn có thể chạy nó như một proxy mà tác nhân của bạn trỏ tới, hoặc như một middleware bên trong quy trình của tác nhân.

Nó cung cấp hai phương pháp định tuyến, với phương pháp thứ ba đang trong quá trình nghiên cứu, và chúng cân bằng độ trễ với độ chính xác theo những cách khác nhau:

Chúng tôi đã benchmark trình phân loại LLM ở chế độ leo thang (escalation mode), tức là type = "llm_classifier" trong cấu hình ở phần dưới. Chế độ leo thang bắt đầu mọi tác vụ trên mô hình rẻ hơn. Một mô hình đánh giá nhỏ sẽ đọc từng lượt đã hoàn thành và bỏ phiếu xem tác nhân có đang đi đúng hướng hay không. Hai phán quyết tiêu cực liên tiếp sẽ định tuyến tác vụ đó đến mô hình đắt tiền cho các bước tiếp theo. "Cánh cửa một chiều" này giúp giảm chi phí định tuyến vì việc leo thang tác vụ giúp mô hình đánh giá không phải chạy trên mọi lượt.

Những gì chúng tôi đã đo lường

Bộ đánh giá Deep Agents của chúng tôi bao gồm 145 tác vụ tác nhân đa bước, trung bình mỗi tác vụ có 6,3 lệnh gọi mô hình, với các thao tác công cụ tương ứng với khối lượng công việc thực tế:

Các đánh giá bao gồm việc sử dụng công cụ, truy xuất đa bước, thao tác hệ thống tệp và tóm tắt ngữ cảnh dài, với các kịch bản được lấy từ τ²-bench airline, Berkeley Function Calling Leaderboard, FRAMES và Nexus. Bạn có thể xem lại các đánh giá tại đây.

Một lưu ý về phạm vi trước khi chia sẻ kết quả. Các đánh giá này được chạy trong các kịch bản có kiểm soát. Lợi ích của phương pháp này là chúng ta có thể quy lỗi trực tiếp cho nguyên nhân gây ra. Tuy nhiên, sự đánh đổi của việc kiểm soát này là nó khiến bộ đánh giá bị bão hòa: độ chính xác cao trên cả ba loại khối lượng công việc, với chỉ 8 điểm chênh lệch giữa mô hình 30 tỷ tham số và mô hình tiên tiến. Điều đó khiến việc định tuyến ít có cơ hội chứng minh giá trị hơn so với một khối lượng công việc khó hơn. Hãy coi những gì theo sau là phép đo cho một khối lượng công việc cụ thể thay vì dự báo cho công việc của bạn. Tất cả chi phí đều tính giá đầu vào được lưu vào bộ nhớ đệm theo mức giá cache, đây là mức giá hiển thị trên hóa đơn.

Sự phân chia giữa nơi các lệnh gọi được gửi đến và nơi chi phí được chi trả là phát hiện cốt lõi. Nemotron 3.5 Lightning xử lý 93% lệnh gọi mô hình với 10,4% chi phí, trong khi Opus xử lý 7% lệnh gọi với 68,4% chi phí. Mô hình tiên tiến được sử dụng ít hơn nhiều so với giả định của thiết lập đơn mô hình, và 6 điểm độ chính xác cuối cùng tốn kém gấp 3,5 lần cho mỗi tác vụ hoàn thành.

Mô hình đánh giá chiếm 21,2% chi phí còn lại. Nó chạy trên mọi lượt cho đến khi một tác vụ leo thang, và không giống như mô hình tiên tiến, nó không nhận được lợi ích từ việc lưu bộ nhớ đệm prompt (prompt caching), vì vậy nó trở thành mục chi phí lớn thứ hai trong nhánh định tuyến, khoảng một phần ba chi phí của Opus. Vì vậy, nếu bạn muốn cắt giảm chi phí định tuyến, mô hình đánh giá là thứ đáng để tối ưu hóa, chứ không chỉ là tỷ lệ leo thang.

Lập ngân sách cho một khoảng, không phải một con số

Lưu lượng truy cập vào mô hình tiên tiến trong năm lần chạy của chúng tôi dao động từ 4,1% đến 9,1%, trung bình là 6,9%, với lần chạy nặng nhất có tỷ lệ leo thang cao gấp đôi lần chạy nhẹ nhất. Một lệnh gọi Opus có giá 0,0324 đô la so với 0,00037 đô la của Nemotron 3.5 Lightning, chênh lệch khoảng 87 lần, vì vậy sự biến động đó dẫn đến phạm vi chi phí từ 2,16 đô la đến 3,61 đô la. Không có gì thay đổi giữa các lần chạy đó ngoại trừ việc bộ định tuyến quyết định leo thang những lượt nào, và hóa đơn vẫn thay đổi tới 67%.

Đó là sự đánh đổi bạn phải chấp nhận với bộ định tuyến: nó làm giảm chi phí trung bình và mở rộng phạm vi xung quanh mức đó. Hãy lập kế hoạch dựa trên mức cao nhất của phạm vi đó. Nếu bạn muốn thu hẹp nó, số lần xác nhận (strike count) là cài đặt có đòn bẩy cao nhất mà bạn có. Đó là phần "confirmations" trong cấu hình bên dưới, nó thiết lập số lượt xấu mà mô hình đánh giá phải thấy trước khi chuyển tác vụ sang mô hình tiên tiến. Giảm con số này xuống, bạn sẽ leo thang thường xuyên hơn, và đó là những lệnh gọi đắt đỏ. Bản thân mô hình đánh giá là đòn bẩy còn lại: nó chiếm 21,2% chi phí định tuyến, vì vậy một mô hình đánh giá rẻ hơn, hoặc một mô hình bỏ qua các lượt đang diễn ra tốt đẹp, sẽ giúp giảm trực tiếp hóa đơn của bạn.

Phản đối hiển nhiên

Chỉ riêng Nemotron 3.5 Lightning đạt 77,7% với giá 0,72 đô la mỗi lần chạy, so với 86,0% với giá 11,45 đô la khi chỉ chạy Opus và 80,0% với giá 3,00 đô la khi định tuyến. Tại sao phải dùng bộ định tuyến mô hình làm gì?

Việc định tuyến đạt điểm cao hơn 2,3 điểm so với mô hình rẻ tiền và tốn kém gấp 4,2 lần. Khoảng cách đó nhỏ hơn mức biến động 2,7 điểm của các lần chạy riêng lẻ, vì vậy chúng tôi không thể nói rằng định tuyến đã đánh bại mô hình rẻ tiền ở đây. Cần nói thẳng rằng mô hình rẻ tiền đã làm tốt. Chỉ có 8 điểm khác biệt giữa Nemotron 3.5 Lightning và mô hình tiên tiến trong bộ đánh giá này. Đây chỉ là một khối lượng công việc, vì vậy hãy kiểm tra nó với khối lượng công việc của riêng bạn trước khi hành động.

Sự so sánh này cũng mang tính chất nhìn lại. Chúng tôi biết 145 tác vụ này đã diễn ra như thế nào. Trong thực tế, bạn không biết yêu cầu vừa đến là dễ hay khó, và việc chạy mô hình rẻ tiền trên mọi thứ đồng nghĩa với việc chấp nhận câu trả lời của nó trên cả những yêu cầu khó. Định tuyến là cái giá phải trả để không phải đoán, và nó cũng làm giảm trần chi phí của bạn: lần chạy định tuyến tệ nhất của chúng tôi tốn 3,61 đô la, khoảng một phần ba so với chỉ dùng Opus.

Vì vậy, nếu chi phí tối thiểu là ưu tiên của bạn và lưu lượng truy cập của bạn giống với khối lượng công việc này, thì chỉ dùng Nemotron 3.5 Lightning là lựa chọn tốt hơn. Định tuyến dành cho các đội ngũ cần khả năng của mô hình tiên tiến cho các yêu cầu khó mà không thể biết trước yêu cầu nào là khó.

Liệu sự đánh đổi này có đáng giá với khối lượng công việc của bạn

Sử dụng bộ định tuyến chỉ làm giảm tổng chi phí so với việc chỉ dùng mô hình tiên tiến khi tỷ lệ lượt bạn gửi đến mô hình nhỏ hơn vượt qua ngưỡng này:

minimum offload = chi phí mô hình đánh giá / (chi phí mô hình đắt - chi phí mô hình rẻ)

Mô hình đánh giá là một loại thuế cố định cho mỗi lần chạy. Nó chạy trên mọi lượt cho đến khi tác vụ leo thang, bất kể cuối cùng có leo thang hay không. Vì vậy, câu hỏi không bao giờ là "mô hình rẻ của tôi có đủ tốt không?" mà là "khoảng cách giá giữa hai mô hình của tôi có đủ lớn để trả cho mô hình đánh giá không?"

Với cặp mô hình của chúng tôi, mô hình đánh giá tốn 0,64 đô la mỗi lần chạy so với khoảng cách giá là 10,73 đô la, vì vậy chúng tôi cần giảm tải 5,9% số lượt. Chúng tôi đã giảm tải 93%, vượt ngưỡng 16 lần. Kết quả không hề sát sao, vì vậy với một cặp mô hình chênh lệch lớn như thế này, công thức chỉ mang tính hình thức. Công thức hữu ích hơn với mức chênh lệch hẹp hơn, nơi câu trả lời ít rõ ràng hơn.

Công thức cũng có thể loại trừ việc định tuyến. Nếu hai mô hình của bạn có giá gần bằng nhau, khoản tiết kiệm trên mỗi lượt giảm tải là rất nhỏ, và công thức yêu cầu bạn gửi hơn 100% số lượt đến mô hình rẻ tiền, điều đó là không thể. Không cấu hình mô hình đánh giá nào khắc phục được điều đó. Ngoại lệ là mô hình rẻ tiền được lưu trữ cục bộ. Hãy tự chạy nó trên thứ gì đó như NVIDIA DGX Spark và chi phí suy luận của nó gần bằng không, điều này làm rộng khoảng cách đủ để khiến việc định tuyến trở nên đáng giá.

Công thức không thể cho bạn biết liệu bộ định tuyến này có đưa ra lựa chọn tốt trên lưu lượng truy cập của bạn hay không. Nó chỉ cho bạn biết liệu những lựa chọn tốt có đáng để trả tiền hay không. Hãy sử dụng nó để loại trừ định tuyến dựa trên chi phí. Hãy chạy khối lượng công việc của riêng bạn để quyết định có nên sử dụng nó hay không.

Khi nào không nên sử dụng phương pháp này

Bắt đầu

Có hai cách để chạy Switchyard với Deep Agents, và chúng phù hợp với các mục tiêu khác nhau.

Tái tạo những gì chúng tôi đã đo lường

Các con số của chúng tôi đến từ chế độ leo thang, đây là một cấu hình định tuyến trên máy chủ Switchyard. Hãy khởi động máy chủ từ NVIDIA-NeMo/Switchyard, trỏ base_url của tác nhân của bạn vào đó và mô tả các mô hình của bạn trong tệp cấu hình.

Switchyard chuyển đổi giữa các định dạng, vì vậy ba mô hình ở trên nói ngôn ngữ OpenAI Chat, Anthropic Messages và OpenAI Chat trong khi tác nhân của bạn chỉ nói OpenAI Chat.

Định tuyến bên trong tác nhân của bạn

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.