Ovis-Embedding là mô hình nhúng đa phương thức tiên tiến, tích hợp văn bản, hình ảnh, video và âm thanh vào một không gian biểu diễn chung nhờ kiến trúc backbone thống nhất và phương pháp huấn luyện tập trung vào dữ liệu chất lượng cao.
OpenRouter đã kiểm chứng 37 mô hình embedding thông qua 28 bài kiểm tra hiệu năng thực tế, cung cấp cái nhìn toàn diện giúp người dùng lựa chọn mô hình phù hợp nhất cho dự án.
Vì sao đáng đọc: Tác giả đã thử nghiệm thực tế 19 mô hình qua API và đưa ra các ứng viên, giá cả cùng các tiêu chí theo trường hợp sử dụng, giúp độc giả đối chiếu lựa chọn trực tiếp dựa trên loại đầu vào và giới hạn lưu trữ.
Linkup Research vừa phát hành mã nguồn mở SPARSEUP, mô hình nhúng dựa trên ModernBERT với 149M tham số. Đây hiện là mô hình mã hóa thưa mạnh nhất trong phân khúc dưới 150M tham số, đạt điểm nDCG@10 là 56.4 trên benchmark BEIR-13.
Mô hình Nemotron 3 Embed 8B vừa chiếm lĩnh vị trí số 1 trên bảng xếp hạng Q2D-Web, vượt qua các bài kiểm tra trên 190 triệu tài liệu web và 70.000 truy vấn đa ngôn ngữ.
Nghiên cứu mới giới thiệu vec2vec, phương pháp đầu tiên cho phép chuyển đổi các vector nhúng giữa các mô hình khác nhau mà không cần dữ liệu cặp hay bộ mã hóa, mở ra khả năng khôi phục văn bản gốc từ cơ sở dữ liệu vector.
Perplexity chia sẻ chi tiết về hạ tầng kỹ thuật tối ưu hóa hiệu suất cho các mô hình nhúng (embedding), giúp tăng tốc độ và giảm chi phí vận hành cho hệ thống tìm kiếm AI.
Join us if you want to work on hard inference and infrastructure engineering problems!
DịchPerplexity vừa công bố kiến trúc phục vụ mô hình pplx-embed, giúp tăng tốc đáng kể các tác vụ embedding và reranking trên quy mô dữ liệu khổng lồ, vượt xa hiệu năng của vLLM.
ExecRetrieval là bộ benchmark mới giúp kiểm tra xem các mô hình embedding có phân biệt được mã nguồn đúng và mã nguồn lỗi có cấu trúc tương tự hay không, thay vì chỉ dựa vào sự tương đồng về từ vựng.
ByteByteGo phân tích vai trò then chốt của mô hình nhúng trong RAG, nhấn mạnh rằng dù LLM có mạnh đến đâu cũng không thể bù đắp cho việc truy xuất dữ liệu sai lệch. Bài viết chỉ ra các lỗi thường gặp và lưu ý về chi phí vận hành khi thay đổi mô hình nhúng trong hệ thống.
WeChat vừa ra mắt WeMM-Embedding, mô hình đa phương thức tối ưu cho tìm kiếm hỗn hợp và nhận diện hình ảnh. Với phiên bản 2B mạnh mẽ, mô hình này cho phép chạy mượt mà trên card đồ họa phổ thông, hỗ trợ đắc lực cho các ứng dụng như tìm kiếm thông minh, bộ nhớ dài hạn cho AI Agent và gắn nhãn nội dung.
Google Cloud tích hợp hỗ trợ TPU vào vLLM, tối ưu hóa cho dòng mô hình Qwen3 để xử lý suy luận Embedding đa phương thức với ngữ cảnh dài (4K+ token văn bản, 15K+ token đa phương thức).
Sentence Transformers v6.0 ra mắt MultiVectorEncoder, hỗ trợ truy xuất hậu tương tác kiểu ColBERT cùng quy trình huấn luyện toàn diện giúp tối ưu hiệu suất RAG.
New Harvard + Stanford paper says, don't replace your embedding model with an LLM. Use embeddings fo…
DịchNghiên cứu mới chỉ ra rằng LLM đắt gấp 1.431 lần nhưng không vượt trội đáng kể so với mô hình Embedding trong tìm kiếm. Các chuyên gia khuyên nên dùng Embedding để lọc dữ liệu thô và chỉ dùng LLM cho các tác vụ suy luận chuyên sâu ở bước cuối.
Nghiên cứu so sánh toàn diện cho thấy dù LLM có hiệu suất ngang ngửa mô hình nhúng chuyên dụng, nhưng chi phí vận hành lại đắt gấp 1.400 lần và tốc độ xử lý chậm hơn đáng kể.
Vì sao đáng đọc: Nghiên cứu thực nghiệm giá trị, giải quyết bài toán tối ưu chi phí và hiệu năng thực tế cho kỹ sư AI khi lựa chọn giữa LLM và mô hình nhúng.
Phiên bản Sentence Transformers v6.0 bổ sung MultiVectorEncoder, cho phép tích hợp trực tiếp các mô hình ColBERT và ColPali để tối ưu hóa khả năng truy xuất thông tin (RAG) với cơ chế tương tác muộn.
Vì sao đáng đọc: Đây là bản cập nhật quan trọng cho cộng đồng phát triển RAG, giúp đơn giản hóa việc triển khai các mô hình tìm kiếm đa vector vốn đang là xu hướng hiện nay.
Code retrieval for coding agents has a new option on OpenRouter. Voyage Code 4 from @VoyageAI by Mo…
DịchOpenRouter vừa bổ sung Voyage Code 4 từ Voyage AI (thuộc MongoDB), hỗ trợ linh hoạt các kích thước vector nhúng Matryoshka từ 256 đến 2048 chiều, tối ưu hóa hiệu suất cho các tác nhân AI lập trình.
Code retrieval for coding agents has a new option on OpenRouter. Voyage Code 4 from Voyage AI by Mo…
DịchOpenRouter vừa bổ sung Voyage Code 4 từ Voyage AI, hỗ trợ các vector nhúng Matryoshka linh hoạt với nhiều tùy chọn chiều và định dạng lượng tử hóa, tối ưu hóa hiệu suất cho các tác nhân lập trình AI.
The @latentspacepod team and I will be speaking at Mongodb's.local buildfest today 10a-4pmish, come…
Dịchswyx cùng các chuyên gia từ Voyage AI và MongoDB sẽ chia sẻ về hạ tầng AI Agent, kỹ thuật embedding/re-ranking, AI đeo tay và MCP tại sự kiện MongoDB.local.