Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
88

Sản phẩm

Mixedbread ra mắt Toast 1: AI tìm kiếm hiệu năng vượt trội với chi phí tối ưu

(giờ Việt Nam)

Tóm tắt AI

Mixedbread giới thiệu Toast 1, tác nhân AI chuyên dụng cho các tác vụ tri thức với hiệu năng ngang ngửa các mô hình hàng đầu, đồng thời giảm chi phí gấp 10 lần và tăng tốc độ xử lý lên 12 lần.

Bản dịch AI

Introducing Toast 1

Toast 1, tác nhân tìm kiếm chuyên biệt đầu tiên của chúng tôi, đã chính thức ra mắt. Nó cung cấp chất lượng tìm kiếm ở cấp độ tiên phong, ngang bằng hoặc vượt trội hơn Claude Opus 5 và GPT-5.6 Sol, trong khi chi phí rẻ hơn tới 10 lần và tốc độ nhanh hơn 12 lần. Toast 1 đạt hiệu suất tốt nhất khi kết hợp với Mixedbread Search, nhưng vẫn có thể hoạt động với bất kỳ hệ thống tìm kiếm backend nào.

Ngày nay, các mô hình tiên phong (frontier models) đã có khả năng thực hiện các công việc tri thức thực thụ. Chúng có thể suy luận, phân tích và tìm kiếm thông tin trong các tập hợp tài liệu phức tạp. Tuy nhiên, đây cũng là những mô hình đắt đỏ nhất trong hệ thống. Khi trí tuệ nhân tạo ngày càng được tính phí theo mức độ sử dụng, nhu cầu về các tác nhân chuyên biệt có khả năng đạt được năng lực tương đương với chi phí thấp hơn đang trở nên cấp thiết hơn bao giờ hết.

Toast 1 có thể chạy như một tác nhân truy xuất chuyên biệt độc lập, hoặc như một trong nhiều tác nhân phụ mà mô hình tiên phong của bạn đã biết cách tận dụng. Nó đảm nhận toàn bộ vòng lặp tìm kiếm: từ một truy vấn ban đầu, nó phân tách thành các truy vấn con, thu thập bằng chứng, kiểm tra nguồn và chọn lọc ngữ cảnh liên quan trước khi trả về kết quả. Điều này cho phép tác nhân của bạn dành tài nguyên ngữ cảnh và tính toán cho các tác vụ đòi hỏi một mô hình tổng quát, cấp độ tiên phong: suy luận, hành động và đưa ra câu trả lời cuối cùng.

Sự chuyên biệt hóa trong lao động tác nhân này dẫn đến việc tìm kiếm rẻ hơn đáng kể, đồng thời mang lại kết quả cuối cùng tốt hơn trên nhiều tác vụ thực tế. Chúng tôi nhận thấy rằng Toast 1 thiết lập một đường biên Pareto mới cho các khối lượng công việc tác nhân xét trên cả chi phí và tốc độ cho mỗi tác vụ.

Phân tích Tài chính: OfficeQA Pro V2

OfficeQA Pro V2, được phát hành bởi Databricks, đánh giá độ chính xác của câu trả lời trên 90 câu hỏi trong các tình huống tài chính doanh nghiệp phức tạp và thực tế.

GPT‑5.6 Sol kết hợp với Toast 1 dưới dạng tác nhân phụ trong Codex đạt độ chính xác 70% với chi phí khoảng 1,15 USD mỗi tác vụ: đây là điểm số cao nhất trong số các hệ thống được Databricks đánh giá trong bản phát hành OfficeQA v2, thiết lập hiệu suất tiên tiến mới về cả chất lượng lẫn hiệu quả.

Để so sánh, hệ thống đạt kết quả tốt nhất trước đó là Claude Fable 5 trên Databricks Genie chỉ đạt 60% độ chính xác với chi phí khoảng 4 USD mỗi tác vụ, trong khi GPT-5.6 Sol trong Codex nếu không có Toast 1 chỉ đạt 33% độ chính xác.

Sự cải thiện này bắt nguồn từ việc tái cấu trúc kinh tế học trong quá trình thu thập bằng chứng. Sự chuyên biệt của Toast 1 cho phép nó tạo ra các gói bằng chứng chất lượng cao, tối ưu hóa token, để lại nguồn lực dồi dào cho quá trình suy luận nhằm đạt được câu trả lời cuối cùng.

Điểm chuẩn Tác nhân Pháp lý - Kiến thức Công ty Luật

Điểm chuẩn Law Firm Knowledge của Harvey LAB nhằm đánh giá khả năng tìm kiếm và sử dụng kiến thức pháp lý tổ chức của một tác nhân ở quy mô lớn và thực tế.

Công việc pháp lý, theo bản chất, đòi hỏi nhiều ngữ cảnh. Bạn không thể tranh luận thắng ai đó nếu họ có quyền truy cập vào các tiền lệ và chi tiết tốt hơn, phù hợp hơn. Nhưng nó cũng rất nhiễu: nhiều tình huống tương tự nhau nhưng lại khác biệt ở những chi tiết nhỏ, khiến việc thu thập các gói bằng chứng chất lượng cao mà không bị nhiễu (false positives) trở nên khó khăn.

Trên một tập hợp con gồm 33 tác vụ được chọn ngẫu nhiên, chúng tôi nhận thấy chất lượng câu trả lời của GPT-5.6 Sol vẫn ổn định bất kể phương pháp tìm kiếm nào.

Tuy nhiên, việc tăng chất lượng tìm kiếm đã làm tăng đáng kể hiệu quả sử dụng token: thay thế tìm kiếm hệ thống tệp (filesystem search) thông thường bằng Mixedbread Search đã cắt giảm mức sử dụng token từ 80,6 triệu xuống 47 triệu với cùng một điểm số tác vụ. Sau đó, việc thêm Toast 1 làm tác nhân phụ tìm kiếm chuyên dụng đã giảm con số này xuống còn 23 triệu và cho phép hoàn thành tác vụ chỉ với một nửa số lượt truy vấn so với tác nhân thông thường.

Việc giới thiệu Toast 1 được hỗ trợ bởi Mixedbread Search đã bảo toàn chất lượng câu trả lời, trong khi tiêu tốn ít hơn 3,5 lần số token, dẫn đến giảm chi phí hơn 60%. Toast 1 giải phóng cửa sổ ngữ cảnh của các mô hình tiên phong để chúng có thể dành token cho việc tìm ra câu trả lời đúng.

Các điểm chuẩn và con số chỉ kể được một phần câu chuyện. Để thực sự hiểu cách Toast 1 hoạt động, không có cách nào tốt hơn là quan sát nó tìm kiếm trong thực tế. Tại Mixedbread, chúng tôi rất thích podcast của Dwarkesh và nghĩ rằng việc có thể tìm kiếm sâu vào các bản ghi của nó sẽ rất thú vị.

Bạn có thể tự mình trải nghiệm tại đây.

Mặc dù là một tác nhân phụ có năng lực cho các tác vụ phức tạp, Toast 1 cũng là một mô hình độc lập mạnh mẽ, được đào tạo chuyên biệt cho tìm kiếm chuyên sâu. Nó đại diện cho bước tiếp theo trong phương pháp đồng thiết kế đằng sau các mô hình nhúng (embedding models) và Silo của chúng tôi: mô hình, khung tác nhân và các nguyên hàm truy xuất được thiết kế để hoạt động cùng nhau.

Trên nhiều điểm chuẩn tìm kiếm chuyên sâu, nó đạt hiệu suất của mô hình tiên phong, đứng cùng đẳng cấp với GPT-5.6 Sol và vượt trội hơn hẳn các mô hình như Kimi K3 hoặc GLM-5.2.

Nó vẫn giữ được sự nhẹ gọn khi thực hiện điều đó. Một lần chạy Toast 1 tiêu chuẩn có chi phí khoảng 0,016 - 0,023 USD mỗi truy vấn và có độ trễ trung bình là tám giây. Cấu hình kết hợp chất lượng cao nhất của chúng tôi có chi phí khoảng 0,05 - 0,07 USD mỗi truy vấn và có độ trễ trung bình là mười một giây. Trong thực tế, trong số các hệ thống đạt hiệu suất tương đương trong đánh giá của chúng tôi, Toast 1 rẻ hơn từ 7–11 lần và nhanh hơn đáng kể: các tác nhân truy xuất dựa trên mô hình tiên phong mất từ 20 giây đến bốn phút cho cùng một đánh giá.

Toast 1 hiện đã có sẵn thông qua Mixedbread API với mức giá ưu đãi khi ra mắt:

Mixedbread search được kích hoạt bởi Toast 1 được tính theo mức giá đặc biệt.

Với Hệ thống Truy xuất Hiện có của Bạn

Toast 1 được đồng thiết kế với các nguyên hàm của Mixedbread Search và sẽ đạt hiệu suất mạnh mẽ nhất khi sử dụng cùng nhau. Tuy nhiên, chúng tôi đặc biệt chú trọng đảm bảo rằng nó vẫn tương thích với mọi backend: nó có thể chạy trên các chỉ mục truy xuất hiện có của bạn mà không yêu cầu di chuyển backend hiện tại. Chúng tôi đã tiến hành kiểm thử kỹ lưỡng để đảm bảo Toast 1 vẫn cạnh tranh với hiệu suất của các mô hình tiên phong trong các điều kiện tương tự với chi phí và độ trễ thấp hơn, bất kể chỉ mục được cung cấp là gì.

Bạn có thể sử dụng Toast 1 với Chat Completions API của chúng tôi và thêm nó như một công cụ truy xuất vào các quy trình tác nhân hiện có của bạn chỉ trong vài phút. Đây là khung mẫu (golden harness) bạn có thể sử dụng trực tiếp.

Với các Tác nhân Lập trình

Hãy để các tác nhân lập trình của bạn xử lý việc tích hợp với npx skills add mixedbread-ai/skills. Hoặc sử dụng Toast 1 trực tiếp như một tác nhân phụ với tích hợp OpenCode của chúng tôi.

Với các Mixedbread Stores của Bạn

Nhận API key với 5 USD tín dụng đi kèm để dùng thử.

Chúng tôi đã đánh giá một tập hợp con gồm 33 tác vụ được chọn ngẫu nhiên để đảm bảo các lần chạy so sánh có thể thực hiện được. Mọi cấu hình đều sử dụng cùng các tác vụ và thiết lập đánh giá; chỉ có hệ thống truy xuất là thay đổi.

Toast 1 là một phần trong khối lượng công việc ngày càng tăng về các tác nhân tìm kiếm chuyên biệt, cùng với SID-1 và Context-1 của Chroma. Mặc dù mỗi bên có cách tiếp cận khác nhau, họ đều chia sẻ mục tiêu mang khả năng truy xuất cấp độ tiên phong vào sản xuất với chi phí và độ trễ thấp hơn.

AI tìm kiếmMixedbreadToast 1Tối ưu chi phíTác nhân AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.