Thủ thuật
Manifest khai tử tính năng định tuyến LLM: Dùng một mô hình duy nhất vẫn hiệu quả hơn
(giờ Việt Nam)
Tóm tắt AI
Sau 4 tháng thử nghiệm, Manifest quyết định ngừng hỗ trợ bộ định tuyến LLM vì nhận thấy việc dùng một mô hình ổn định mang lại hiệu suất, tính nhất quán và khả năng dự đoán tốt hơn so với việc phân luồng phức tạp.
Bản dịch AI

Chúng tôi không còn tin vào việc định tuyến mô hình (model routing) nữa. Đối với hầu hết các trường hợp sử dụng, việc gắn bó với một mô hình duy nhất đã được kiểm chứng qua thực tế là điều tốt nhất bạn có thể làm.
Gần đây, có một làn sóng cường điệu lớn xung quanh các bộ định tuyến mô hình AI (AI model routers) – những công cụ tự động chọn mô hình phản hồi yêu cầu của bạn ngay lập tức. Đã có rất nhiều sản phẩm được ra mắt trong những tuần gần đây với lời hứa tương tự về việc giảm chi phí suy luận (inference costs). Chúng tôi cũng từng có bộ định tuyến LLM của riêng mình và đã quyết định loại bỏ nó.
Trước hết, hãy nói về bối cảnh: chúng tôi đã ra mắt bộ định tuyến Manifest LLM vào tháng 3 như một tính năng chính trong cổng kết nối LLM (LLM gateway) của mình, sau đó chúng tôi đã ngừng hỗ trợ nó vào tháng 6 và chính thức đóng cửa hoàn toàn vào ngày 1 tháng 9. Bộ định tuyến của chúng tôi phân loại mỗi yêu cầu vào một trong bốn cấp độ phức tạp khác nhau: đơn giản, tiêu chuẩn, phức tạp và suy luận (reasoning).
Giống như hầu hết các bộ định tuyến LLM khác, sản phẩm của chúng tôi được tạo ra để cắt giảm chi phí. Tại sao phải gọi một mô hình mạnh mẽ, và do đó đắt đỏ, cho một tác vụ đơn giản? Việc định tuyến đến mô hình tiết kiệm chi phí nhất có vẻ là một giải pháp tự nhiên, phải không? Không đơn giản như vậy. Sau bốn tháng sử dụng với 7.000 người dùng trên nền tảng đám mây, chúng tôi nhận thấy kết quả không đồng nhất cùng rất nhiều vấn đề và thảo luận trên GitHub về nó. Hãy cùng đi sâu vào những vấn đề chính.
Không thể suy ra độ phức tạp chỉ từ prompt
Bản thân prompt không chứa toàn bộ tác vụ; nó chỉ là yếu tố kích hoạt. Rất nhiều ngữ cảnh quyết định độ phức tạp chỉ được khám phá sau đó thông qua các lệnh gọi công cụ (tool calls), tìm kiếm web, v.v.
Hãy lấy một ví dụ: “đánh giá các bài kiểm tra cho repo $GIT_REPO và cải thiện chúng” có thể là một tác vụ rất đơn giản nếu bạn đề cập đến một trang web cá nhân viết bằng HTML5 thuần; hoặc là một tác vụ cực kỳ phức tạp nếu bạn nhắm đến repo nhân Linux.
Bộ nhớ đệm (Cache) hiệu quả hơn định tuyến trong việc giảm chi phí
Đọc từ bộ nhớ đệm rẻ hơn từ 75% đến 90% so với đầu vào không có bộ nhớ đệm. Các system prompt và lịch sử hội thoại thường chiếm rất nhiều token. Prefix cache hoạt động cực kỳ hiệu quả cho những trường hợp này vì chúng nằm ở phần đầu của prompt.
Một bộ định tuyến mô hình có nhận biết bộ nhớ đệm (cache-aware) sẽ tính đến điều đó bằng cách tạo sự gắn kết với mô hình đã chọn ban đầu và tiếp tục truy vấn nó. Nói cách khác, bộ định tuyến sẽ hoàn thành công việc của mình bằng cách, trớ trêu thay, là không làm gì cả.
Các bộ định tuyến LLM phá vỡ tính nhất quán trong hành vi
Một số người nói rằng “các kỹ sư không nên bận tâm đến việc chọn LLM tốt nhất cho tác vụ của họ”. Chà, chúng tôi hoàn toàn không đồng ý với điều đó.
Cũng giống như một họa sĩ biết chính xác loại cọ họ cần sử dụng, và người thợ thủ công lựa chọn công cụ của họ một cách cẩn thận, các kỹ sư nên hiểu rõ những đánh đổi và sự tinh tế của các mô hình khác nhau. Tại Manifest, mỗi kỹ sư đều tự chọn mô hình và các tham số nỗ lực dựa trên mục đích của họ.
Việc nhảy từ mô hình này sang mô hình khác trong các phiên làm việc dẫn đến chất lượng công việc tổng thể thấp hơn và khiến con người không thể làm chủ được công cụ của mình.
Sự khó dự đoán luôn đi kèm với cái giá phải trả
Không ai thích sự khó dự đoán, đặc biệt là các kỹ sư phần mềm.
Trong các quy trình làm việc tự động (agentic workflows) hoặc các tác nhân tự hành (autonomous agents), việc quản lý thêm lớp không chắc chắn đó có thể tốn kém hơn cả số tiền tiết kiệm được. Hãy nghĩ đến các bài đánh giá (evals), system prompt, khả năng quan sát (observability), v.v. Mọi thứ đột nhiên trở nên khó bảo trì hơn.
Việc cô lập các yêu cầu khác nhau và thiết lập đúng mô hình, tham số và prompt cho từng yêu cầu dường như là giải pháp vượt trội hơn trong hầu hết các trường hợp.
Kết luận
Có lẽ có nhiều trường hợp sử dụng mà việc định tuyến LLM có thể hữu ích, và các công ty ra mắt những sản phẩm đó có lẽ đều có lý do chính đáng.
Tuy nhiên, dựa trên kinh nghiệm của mình, chúng tôi kết luận rằng trong hầu hết các trường hợp sử dụng mà chúng tôi thấy, việc đó là không đáng. Số tiền tiết kiệm được lại bị tiêu tốn ở một nơi khác, và chi phí đó lại khó ước tính hơn.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.