Tin ngành
Chi phí mô hình lớn và sự trỗi dậy của mã nguồn mở thúc đẩy nhu cầu về điều hướng AI
(giờ Việt Nam)
Tóm tắt AI
CEO Glean, Arvind Jain, giải thích cách điều hướng mô hình (model routing) giúp doanh nghiệp tối ưu chi phí AI và tận dụng phản hồi từ người dùng để cải thiện hệ thống.
Bản dịch AI


Với sự cạnh tranh gay gắt giữa các công ty phát triển mô hình tiên phong (frontier model), cùng với sức mạnh ngày càng tăng của các mô hình mã nguồn mở (open-weight) như Kimi K3 và Qwen3.8-Max, định tuyến mô hình (model routing) đã trở thành một phần quan trọng trong việc triển khai AI. Chúng ta vừa chứng kiến Stripe mua lại OpenRouter với giá hơn 7 tỷ USD, nhưng xu hướng này cũng đang nóng không kém trong khối doanh nghiệp.
Glean, được đồng sáng lập và dẫn dắt bởi cựu Kỹ sư ưu tú của Google là Arvind Jain, chuyên mang AI đến các tổ chức lớn. Công ty được định giá 7,2 tỷ USD sau vòng gọi vốn Series F trị giá 150 triệu USD vào tháng 6 năm ngoái. Năm nay, công ty đã đạt mức doanh thu định kỳ hàng năm (ARR) là 300 triệu USD — tăng gấp ba lần trong vòng 15 tháng.
Một phần sứ mệnh của Glean là lựa chọn mô hình nào để sử dụng cho từng tác vụ — hoặc thậm chí xác định xem liệu có thực sự cần đến LLM hay không.
“Một mục tiêu lớn của Glean là tránh sử dụng LLM cho những tác vụ mà chúng ta không cần đến chúng,” Jain chia sẻ với Latent Space. “Đôi khi bạn sẽ thấy các truy vấn trong Glean mà người dùng chỉ đang cộng hoặc nhân hai con số. Họ hoàn toàn có thể dùng máy tính bỏ túi để làm việc đó.”
Nhưng điều mà Glean chủ yếu hướng tới là mang đến thứ mà Jain gọi là “một cộng sự cá nhân thực sự mạnh mẽ” cho nhân viên doanh nghiệp. Và điều đó đồng nghĩa với việc trở thành một dạng khung điều phối (meta-harness) cho các LLM hàng đầu.
“Bạn có thể coi Glean ngày nay là một tập hợp bao trùm (superset) của ChatGPT, Claude, Gemini, Grok,” Jain nói. “Tất cả những sản phẩm AI khác nhau mà chúng ta vẫn sử dụng hàng ngày, Glean kết hợp sức mạnh của tất cả chúng vào trong một trải nghiệm duy nhất.”
Đối với các doanh nghiệp, việc đưa công nghệ AI vào tổ chức chỉ mới là một nửa thách thức. Nửa còn lại là đưa tri thức của tổ chức vào các hệ thống AI.
“Cuối cùng, công việc của chúng tôi là hiểu sâu sắc dữ liệu, tri thức và thông tin của bạn, nhưng cũng phải hiểu cách công việc diễn ra bên trong công ty của bạn,” Jain cho biết.
Vậy định tuyến mô hình có ý nghĩa gì trong thực tế? Về cơ bản, Glean cung cấp ba cấp độ lựa chọn mô hình:
Nhân viên có thể tự chọn mô hình một cách rõ ràng.
Quản trị viên có thể hạn chế các mô hình hoặc áp đặt giới hạn sử dụng.
Chế độ tự động của Glean sẽ chọn mô hình một cách linh hoạt cho từng tác vụ.
Hóa ra, chế độ tự động chủ yếu được khách hàng của Glean lựa chọn vì lý do kinh tế.
“Tại sao mọi người lại nói về định tuyến mô hình? Tại sao họ lại hào hứng với nó? Chủ yếu là vì chi phí,” Jain nói với chúng tôi.
Một đồng sáng lập khác của Glean, trưởng bộ phận kỹ thuật Tony Gentilcore, gần đây khẳng định rằng Glean “tiết kiệm chi phí hơn gấp 4 lần” so với Claude Code, “trung bình 0,45 USD mỗi tác vụ so với 1,84 USD của Claude Cowork.” Ông cho rằng điều này là nhờ vào “các khả năng điều phối và định tuyến” của Glean.
Cá nhân mỗi người trong chúng ta đang nhận được giá trị lớn từ gói đăng ký hàng tháng 20, 100 hoặc 200 USD cho một nhà cung cấp LLM. Nhưng đối với một doanh nghiệp, chi phí trên mỗi người dùng có thể dễ dàng vượt khỏi tầm kiểm soát.
“Các mô hình AI đang ngày càng trở nên đắt đỏ,” Jain nói. “Ví dụ, nếu bạn nhìn vào Opus hoặc các mô hình mới nhất của GPT, những mô hình tiên tiến nhất. Chúng không chỉ rất mạnh mẽ, có thể thực hiện các tác vụ phức tạp hơn nhiều so với các mô hình trước đây. Nhưng tính trên mỗi token, chúng đắt hơn — đôi khi gấp đôi hoặc gấp bốn lần so với các mô hình cũ. Và người dùng thực tế lại sử dụng chúng để thực hiện các tác vụ dài hơn nhiều. Vì vậy, bạn đang chi tiêu gấp 10, 20 lần so với những gì bạn đã làm vào năm ngoái. Do đó, chi phí đã tăng lên rất nhiều.”
Một yếu tố then chốt khác trong sự trỗi dậy của Glean là việc nó có thể quan sát cách người dùng doanh nghiệp thông thường sử dụng AI. Sản phẩm này có khả năng được triển khai cho mọi nhân viên như một “cộng sự”, và nó cũng được sử dụng để xây dựng và triển khai các tác nhân (agent) trên tất cả các phòng ban và chức năng.
Trong số các khách hàng của mình, Zillow báo cáo tỷ lệ áp dụng 80% trên tổng số 7.000 nhân viên, trong khi tại Booking.com, “Glean đã trở thành nền tảng AI đầu tiên được áp dụng trên toàn công ty.” Mức độ thâm nhập đó mang lại cho Glean một cái nhìn đáng ghen tị về cách AI đang được sử dụng trong các doanh nghiệp.
“Vì vậy, chúng tôi có cơ hội quan sát những gì mọi người thực sự đang làm với AI trên một phạm vi rất rộng,” Jain nói. “Chúng tôi thấy được khi họ thực hiện các loại tác vụ khác nhau với AI, họ chọn mô hình nào đầu tiên, và khi họ không hài lòng, khi nào họ thực sự nâng cấp lên một mô hình khác [mà] thực sự mang lại cho họ kết quả đúng.”
Vòng lặp phản hồi từ con người này, ở quy mô lớn, giúp cải thiện hệ thống định tuyến mô hình.
Một phần khác trong kiến trúc của Glean là một mô hình có tên là Waldo, mà Jain mô tả là nằm trên các mô hình ngôn ngữ lớn. Waldo được giới thiệu vào tháng 4 như là “mô hình tìm kiếm tác nhân (agentic search model) đầu tiên của Glean.”

Trong một bài đăng trên blog kỹ thuật, Waldo được mô tả như một quy trình lọc cho các truy vấn của người dùng: nó “quyết định cách chia nhỏ câu hỏi, công cụ nào cần sử dụng, đọc gì tiếp theo và khi nào thì có đủ bằng chứng để chuyển giao cho một mô hình tiên phong nhằm đưa ra câu trả lời chất lượng cao.”
Điều này có nghĩa là việc định tuyến mô hình diễn ra sau khi Glean đã xác định được những gì Jain gọi là “nguyên liệu thô” cần thiết cho tác vụ đó.
“Chúng tôi có thể tập hợp các nguyên liệu thô cần thiết để thực hiện công việc mà không cần đốt cháy các token LLM,” ông nói thêm.
Một hệ quả của điều này là một mô hình rẻ hơn với ngữ cảnh tốt hơn có thể vượt trội hơn một mô hình tiên phong chứa đầy dữ liệu không liên quan.
Jain xác nhận rằng hiện nay các doanh nghiệp đang quan tâm đáng kể đến các mô hình mã nguồn mở, chủ yếu do lo ngại về chi phí. Nhưng điều này chỉ mới xảy ra trong vài tháng gần đây.
“Năm ngoái, việc sử dụng [các LLM mã nguồn mở] là rất nhỏ và không ai thực sự cân nhắc nghiêm túc về mã nguồn mở,” ông nói. Một phần là do “định kiến” rằng nhiều mô hình mã nguồn mở này được phát triển bên ngoài nước Mỹ.
Nhưng đột nhiên, sự quan tâm từ các khách hàng doanh nghiệp đã tăng lên.

“Vì vậy, trong ba tháng qua, do AI trở nên quá đắt đỏ, các doanh nghiệp bắt đầu thấy việc duy trì các khoản đầu tư AI này là không bền vững,” Jain nói. “Với việc mã nguồn mở rẻ hơn gấp nhiều lần để thực hiện các tác vụ, nó đã tạo ra rất nhiều sự quan tâm. Ngày nay, tôi có thể nói rằng ở hầu hết các doanh nghiệp, họ đang coi các mô hình mã nguồn mở là một phần quan trọng trong chiến lược AI của mình.”
Hơn thế nữa, các tổ chức có xu hướng không còn dựa vào chỉ một hoặc hai nhà cung cấp nữa — và sự trỗi dậy của các mô hình mã nguồn mở đang thúc đẩy xu hướng này.
“Không ai còn sẵn sàng dựa vào chỉ một nhà cung cấp mô hình, hoặc hai, và không ai nghĩ rằng họ có thể tồn tại mà không có mã nguồn mở,” Jain nói.
Bạn không thể có một cuộc trò chuyện nghiêm túc về AI vào năm 2026 mà không thảo luận về các đánh giá (evals) — việc đánh giá chất lượng kết quả từ các LLM. Tôi đã hỏi Glean thực hiện các đánh giá như thế nào và làm thế nào để phản hồi điều đó vào hệ thống định tuyến mô hình.
Jain cho biết họ có “các hệ thống kiểm thử nội bộ”, nơi họ so sánh khối lượng công việc thực tế, trên các lớp truy vấn khác nhau, với các tùy chọn thay thế. Vì vậy, họ để mô hình chọn một lộ trình và song song đó, họ cố gắng hoàn thành cùng một tác vụ với “một số mô hình khác có thể rẻ hơn một chút hoặc đắt hơn một chút.”
Sau đó, Glean sử dụng “các giám khảo dựa trên AI” để xác định “bộ định tuyến mô hình đã chính xác đến mức nào.”
“Vì vậy, có một quá trình học hỏi liên tục được cập nhật với lưu lượng truy cập thực tế mới, nơi về cơ bản những gì đang xảy ra là bạn để bộ định tuyến mô hình thực hiện công việc cho người dùng, nhưng đằng sau hậu trường, bạn chạy cùng một tác vụ đó,” Jain giải thích.
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.