OpenRouter: Announcements
85

Thủ thuật

OpenRouter công bố hướng dẫn chọn mô hình Embedding tốt nhất năm 2026

(giờ Việt Nam)

Tóm tắt AI

OpenRouter đã kiểm chứng 37 mô hình embedding thông qua 28 bài kiểm tra hiệu năng thực tế, cung cấp cái nhìn toàn diện giúp người dùng lựa chọn mô hình phù hợp nhất cho dự án.

Bản dịch AI

Best Embedding Models in 2026

Một mô hình embedding quyết định những gì hệ thống truy xuất của bạn có thể tìm thấy. Nó chuyển đổi mỗi đầu vào thành một vector và đặt các đầu vào có liên quan gần nhau, nhờ đó ứng dụng của bạn có thể truy xuất theo ý nghĩa thay vì từ ngữ chính xác.

Lựa chọn tốt nhất phụ thuộc vào tài liệu bạn cần tìm kiếm. Một cơ sở tri thức tiếng Anh, một kho lưu trữ hỗ trợ đa ngôn ngữ, một kho lưu trữ mã nguồn, và một bộ sưu tập văn bản-hình ảnh có những yêu cầu khác nhau. Kích thước vector, độ dài ngữ cảnh, trọng số công khai và giá cả cũng có thể làm thay đổi quyết định này.

Chúng tôi đã lập danh sách rút gọn các mô hình cho RAG tiếng Anh, truy xuất đa ngôn ngữ, tìm kiếm mã nguồn, truy xuất văn bản-hình ảnh và lập chỉ mục chi phí thấp, sau đó gửi các yêu cầu trực tiếp đến từng mô hình thông qua endpoint embeddings của chúng tôi.

Xác minh lần cuối: 11 tháng 9 năm 2026. Danh mục mô hình embedding của chúng tôi đã trả về 37 mục vào ngày đó, bao gồm cả các biến thể batch và preview của một số mô hình.

Các nhà cung cấp có thể thêm hoặc xóa các tuyến đường (routes), và giá prompt có thể thay đổi. Hãy kiểm tra trang mô hình hiện tại trước khi bắt đầu một công việc lập chỉ mục hoặc lập chỉ mục lại quy mô lớn. Nếu trang mô hình khác với hướng dẫn này, hãy sử dụng thông tin trên trang mô hình.

Tóm tắt (TL;DR)

Các mô hình embedding tốt nhất theo trường hợp sử dụng

Chọn mô hình theo loại đầu vào

Hãy bắt đầu với tài liệu bạn cần tìm kiếm. Biểu đồ được sắp xếp theo loại đầu vào trước, sau đó là việc bạn có cần trọng số công khai hay không, và cuối cùng là theo ràng buộc chính của bạn.

Biểu đồ cung cấp cho bạn một điểm khởi đầu. Hãy so sánh ít nhất hai ứng viên với các truy vấn và tài liệu từ ứng dụng của bạn, đồng thời theo dõi tần suất mỗi mô hình truy xuất được các đoạn (chunks) liên quan trước khi bạn xây dựng hoặc xây dựng lại một chỉ mục lớn.

Cách chúng tôi chọn các mô hình này

Chúng tôi đã sử dụng danh mục trực tiếp của mình để xác nhận tính khả dụng, cửa sổ ngữ cảnh, loại đầu vào và giá prompt. Chúng tôi đã kiểm tra tài liệu của các nhà cung cấp mô hình về khả năng và kết quả benchmark, sau đó gửi các yêu cầu trực tiếp thông qua endpoint embeddings của chúng tôi để xác nhận hành vi yêu cầu và phản hồi.

Chúng tôi đã gửi một yêu cầu batch gồm hai chuỗi đến 19 mô hình và thực hiện tổng cộng 28 lần kiểm tra, bao gồm đầu vào batch, kích thước có thể cấu hình, đầu vào hình ảnh, đầu vào văn bản-hình ảnh và xử lý lỗi. 16 mô hình trả phí đã trả về một vector cho mỗi đầu vào. Các phản hồi xác nhận kích thước mặc định trong bảng dưới đây và cho thấy tham số dimensions hoạt động với OpenAI Text Embedding 3 Small, Gemini Embedding 2 và Voyage 4 Large. Một yêu cầu cho một mô hình không tồn tại đã trả về lỗi 400 với thông báo Model openai/does-not-exist does not exist.

Ba tuyến đường miễn phí đã trả về lỗi 404 từ tài khoản thử nghiệm của chúng tôi vì cài đặt quyền riêng tư của nó không cho phép định tuyến đến các nhà cung cấp có thể huấn luyện trên các prompt của mô hình miễn phí. Chúng tôi mô tả cài đặt đó trong phần các tùy chọn miễn phí bên dưới. Kích thước mặc định mà chúng tôi liệt kê cho các mô hình đó đến từ thẻ mô hình (model cards) của chúng, không phải từ phản hồi của chúng tôi.

Các yêu cầu này xác nhận khả năng tương thích API. Chúng không đo lường chất lượng truy xuất. Chúng tôi đã loại trừ thời gian phản hồi vì mỗi mô hình nhận được một yêu cầu nhỏ trong các điều kiện phục vụ khác nhau. Chúng tôi đã khớp từng trường hợp sử dụng với một khả năng được ghi nhận, sau đó sử dụng phạm vi ngôn ngữ, độ dài ngữ cảnh, kích thước đầu ra, trọng số công khai và giá prompt để thu hẹp các ứng viên. Các đánh giá được công bố, bao gồm MTEB và CoIR, đã giúp chúng tôi xác định các mô hình để thử nghiệm. Kết quả truy xuất được gắn nhãn của bạn nên là yếu tố quyết định mô hình nào bạn triển khai.

So sánh các mô hình embedding trong danh sách rút gọn

Giá bên dưới là giá prompt được liệt kê trong danh mục của chúng tôi vào ngày 11 tháng 9 năm 2026, và giá hình ảnh cho Gemini Embedding 2 là giá trị trong danh mục vào ngày 18 tháng 9 năm 2026. Kích thước mặc định đến từ các phản hồi trực tiếp của chúng tôi, ngoại trừ mô hình NVIDIA miễn phí, có giá trị mặc định đến từ thẻ mô hình của nó.

Cột kích thước (dimensions) ảnh hưởng đến kích thước chỉ mục thô. Xem phần “Tính toán lưu trữ vector” bên dưới để biết công thức và ví dụ.

Danh mục của chúng tôi chứa nhiều mô hình hơn bảng hiển thị. baai/bge-m3 bổ sung thêm một tùy chọn đa ngôn ngữ mở, mistralai/mistral-embed-2312 cung cấp một giải pháp thay thế văn bản chung, và mistralai/codestral-embed-2505 nhắm mục tiêu truy xuất mã nguồn. Cả ba đều trả về vector trong bài kiểm tra yêu cầu văn bản của chúng tôi. Danh mục cũng liệt kê một bộ các mô hình mở 512-token từ BAAI, E5, GTE và Sentence Transformers với giá từ $0.005 đến $0.01 mỗi triệu token, mà chúng tôi chưa thử nghiệm cho hướng dẫn này.

Lựa chọn mặc định tốt nhất cho RAG tiếng Anh

Hãy bắt đầu với openai/text-embedding-3-small khi bạn cần một mô hình được quản lý cho cơ sở tri thức tiếng Anh. Vector mặc định của nó có 1.536 giá trị, bằng một nửa so với mặc định từ openai/text-embedding-3-large. Với cùng định dạng số, Small sử dụng ít hơn một nửa dung lượng lưu trữ vector thô. Hãy giữ giá trị mặc định 1.536 cho lần đánh giá đầu tiên và chỉ giảm nó nếu mặc định đáp ứng mục tiêu truy xuất nhưng chi phí lưu trữ hoặc tìm kiếm vẫn là một ràng buộc.

Bạn có thể rút ngắn các vector của nó bằng tham số dimensions. Yêu cầu của chúng tôi với "dimensions": 256 đã trả về một vector với 256 giá trị. Các vector nhỏ hơn sử dụng ít dung lượng lưu trữ cơ sở dữ liệu hơn và giảm khối lượng công việc cần thiết cho tìm kiếm tương đồng, nhưng chúng cũng có thể làm giảm chất lượng truy xuất. Hãy kiểm tra kích thước nhỏ hơn trước khi thay đổi một chỉ mục hiện có.

OpenAI mô tả text-embedding-3-large là mô hình embedding có khả năng tốt nhất cho các tác vụ tiếng Anh và không phải tiếng Anh. Hãy thử nghiệm nó khi Small bỏ lỡ các kết quả liên quan, đặc biệt là khi người dùng tìm kiếm giữa các ngôn ngữ. Việc chuyển sang Large sẽ làm thay đổi kích thước vector và giá prompt, vì vậy hãy so sánh cả hai mô hình trên các câu hỏi giữ lại (held-out questions) trước khi thực hiện embedding lại toàn bộ kho dữ liệu.

Nếu đầu vào của bạn vượt quá giới hạn 8.192 token của Small, hãy thử nghiệm Voyage 4 Large. Đối với các đầu vào ngắn hơn, hãy so sánh cả hai mô hình bằng cách sử dụng cùng các đoạn, truy vấn và nhãn liên quan.

Dòng Voyage 4 cho các đầu vào dài hơn

Hãy thử nghiệm voyageai/voyage-4-large khi bạn cần một mô hình được quản lý với 32.000 token, có kích thước có thể điều chỉnh và khả năng tương thích giữa các tầng Voyage 4. Nó chấp nhận tối đa 32.000 token và hỗ trợ các kích thước 256, 512, 1.024 và 2.048. Trong kiểm tra API của chúng tôi, việc đặt dimensions thành 512 đã trả về một vector với 512 giá trị.

Dòng này bao gồm voyageai/voyage-4 và voyageai/voyage-4-lite, sử dụng cùng một cửa sổ ngữ cảnh. Voyage tuyên bố rằng tất cả các embedding được tạo bằng dòng 4 đều tương thích với nhau. Điều này cho phép bạn thử nghiệm một tầng Voyage 4 khác so với chỉ mục hiện có. Hãy xác thực việc thay đổi tầng trên một mẫu đại diện trước khi triển khai. Một không gian vector tương thích giúp loại bỏ yêu cầu xây dựng lại, nhưng nó không đảm bảo kết quả truy xuất giống hệt nhau.

Chạy Large và ít nhất một tầng Voyage 4 thấp hơn trên cùng một tập đánh giá. Nếu chúng truy xuất cùng các đoạn liên quan tại cùng một điểm cắt (cutoff), tầng thấp hơn có thể đáp ứng yêu cầu của bạn.

Các mô hình Voyage là các dịch vụ được quản lý. Nếu bạn cần trọng số công khai để tự lưu trữ hoặc kiểm soát triển khai, Qwen3 Embedding 8B là giải pháp thay thế có trọng số mở trong danh sách rút gọn này.

Mô hình có trọng số mở tốt nhất cho truy xuất đa ngôn ngữ

qwen/qwen3-embedding-8b là lựa chọn đa ngôn ngữ có trọng số mở của chúng tôi. Nó hỗ trợ hơn 100 ngôn ngữ và bạn có thể tải xuống trọng số từ Hugging Face hoặc gọi mô hình được lưu trữ thông qua API của chúng tôi. Yêu cầu API mặc định của chúng tôi trả về 4.096 giá trị. Với cùng định dạng số, một vector 4.096 giá trị sử dụng gấp bốn lần dung lượng lưu trữ thô so với vector 1.024 giá trị. Hãy tính đến sự khác biệt đó khi ước tính kích thước chỉ mục. Các kiểm tra API của chúng tôi không xác định liệu Qwen3 Embedding 8B có truy xuất tốt hơn nvidia/nemotron-3-embed-1b:free hay không. Khi chi phí tuyến đường và kích thước vector ảnh hưởng đến quyết định, hãy thử nghiệm cả hai trên cùng một tập dữ liệu được gắn nhãn trước khi cam kết.

Thẻ mô hình Qwen báo cáo điểm số đa ngôn ngữ là 70,58 trên Massive Text Embedding Benchmark (MTEB) tính đến ngày 5 tháng 6 năm 2025. Đây là kết quả benchmark công khai do nhà cung cấp báo cáo. Hãy sử dụng nó để đưa Qwen vào danh sách rút gọn, sau đó kiểm tra mọi ngôn ngữ và lĩnh vực mà ứng dụng của bạn hỗ trợ, vì kho dữ liệu của bạn có thể tạo ra một thứ hạng khác.

Trang mô hình liệt kê cửa sổ ngữ cảnh 32.768 token, nhưng giới hạn được đặt theo từng endpoint. Vào ngày 11 tháng 9 năm 2026, các endpoint DeepInfra và SiliconFlow cho Qwen3 Embedding 8B liệt kê 32.768 token và endpoint Nebius liệt kê 32.000. Nếu bạn gửi đầu vào dài hơn 32.000 token, hãy kiểm tra danh sách endpoint và ghim một nhà cung cấp có giới hạn lớn hơn, hoặc giữ đầu vào ở mức hoặc dưới 32.000 token.

Phiên bản 4B sử dụng cùng cửa sổ ngữ cảnh ở cấp độ mô hình và trả về 2.560 giá trị trong kiểm tra của chúng tôi. Nó yêu cầu ít tài nguyên hơn để tự chạy. Giá lưu trữ phụ thuộc vào các nhà cung cấp khả dụng, vì vậy hãy so sánh các trang mô hình hiện tại cho Qwen3 Embedding 8B và 4B trước khi chọn.

baai/bge-m3 cung cấp cho bạn một mô hình đa ngôn ngữ mở thứ hai để so sánh với Qwen3 trên tập dữ liệu của riêng bạn. Thẻ mô hình của nó bao phủ hơn 100 ngôn ngữ và đầu vào lên đến 8.192 token, và yêu cầu của chúng tôi trả về một vector 1.024 giá trị. Mô hình gốc có thể trả về một vài loại biểu diễn, bao gồm vector dày (dense) và vector thưa (sparse). Phản hồi embedding tiêu chuẩn của chúng tôi trả về vector dày. Hãy sử dụng triển khai gốc nếu thiết kế truy xuất của bạn phụ thuộc vào các loại biểu diễn khác của nó.

Các mô hình embedding tốt nhất cho tìm kiếm mã nguồn

Sử dụng voyageai/voyage-code-4 khi một truy vấn cần truy xuất một hàm, tệp hoặc một đoạn tài liệu mã nguồn. Voyage đã xây dựng mô hình này cho các tác vụ truy xuất mã nguồn và tác nhân lập trình (coding-agent). Cửa sổ ngữ cảnh 32.000 token của nó có thể chấp nhận các tệp hoặc truy vấn dài, mặc dù các đoạn chỉ mục vẫn nên đại diện cho các đơn vị mã nguồn hữu ích khi được truy xuất.

mistralai/codestral-embed-2505 là giải pháp thay thế chuyên biệt cho mã nguồn chính trong danh mục của chúng tôi. Nó trả về 1.536 giá trị trong kiểm tra yêu cầu văn bản của chúng tôi. Cửa sổ ngữ cảnh của nó là 8.192 token, so với 32.000 của Voyage Code 4. Hãy thử nghiệm Voyage Code 4 trước và sử dụng Codestral Embed làm mô hình so sánh.

Các đánh giá công khai có thể giúp bạn so sánh các ứng viên. Code Information Retrieval Benchmark (CoIR) chứa mười tập dữ liệu bao gồm tám tác vụ truy xuất mã nguồn trên bảy lĩnh vực. Hãy sử dụng nó để so sánh các mô hình trước khi thử nghiệm các ứng viên mạnh nhất trên công việc từ các kho lưu trữ của riêng bạn. Một đánh giá nội bộ hữu ích là ánh xạ các mô tả vấn đề hoặc câu hỏi của nhà phát triển tới các tệp và đoạn cần thiết để giải quyết chúng.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ OpenRouter: Announcements. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

OpenRouter công bố hướng dẫn chọn mô hình Embedding tốt nhất năm 2026 | AIHOT.vn