Hacker News: AI bài nổi bật
85

Mô hình

Inception ra mắt Mercury 2.5: Mô hình ngôn ngữ khuếch tán mạnh mẽ với tốc độ vượt trội

(giờ Việt Nam)

Tóm tắt AI

Inception giới thiệu Mercury 2.5, mô hình ngôn ngữ khuếch tán thông minh hơn 40% so với bản tiền nhiệm, đạt tốc độ 1.107 tokens/giây trên GPU NVIDIA và hỗ trợ ngữ cảnh lên tới 260K tokens với mức giá cạnh tranh.

Bản dịch AI

Introducing Mercury 2.5 – Inception

Hôm nay, chúng tôi ra mắt Mercury 2.5, mô hình thương mại mạnh mẽ nhất từ trước đến nay của chúng tôi. Đây là bước tiến đáng kể về chất lượng so với Mercury 2, trong khi vẫn duy trì cấu hình phục vụ với độ trễ thấp và chi phí thấp như cũ.

Kể từ khi Mercury 2 ra mắt, hàng ngàn nhà phát triển đã xây dựng ứng dụng dựa trên nó, hàng chục doanh nghiệp đã đưa nó vào môi trường thực tế và mức độ sử dụng đã tăng hơn một bậc độ lớn. Hiện tại, nó đang phục vụ các khối lượng công việc nhạy cảm về độ trễ trong các sản phẩm tìm kiếm, giọng nói và lập trình.

Những khối lượng công việc đó đã cung cấp cho chúng tôi tín hiệu rõ ràng hơn so với các bài kiểm tra đánh giá (benchmarks) đơn thuần. Chúng tôi đã sử dụng phản hồi của khách hàng và các trường hợp lỗi trong thực tế để tinh chỉnh các đánh giá và tập trung vào quá trình huấn luyện. Mercury 2.5 là kết quả đầu tiên của vòng lặp đó.

Những thay đổi

Mercury 2.5 là LLM khuếch tán (diffusion LLM) mạnh mẽ nhất trên thị trường. Theo hiểu biết của chúng tôi, đây là mô hình ngôn ngữ khuếch tán lớn nhất từng được huấn luyện.

Chất lượng: Tăng 40% về trí thông minh so với Mercury 2. Tương đương với các mô hình tiên phong tối ưu hóa chi phí như GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite và Claude Haiku 4.5.

Tốc độ: 1.107 token mỗi giây trên các GPU NVIDIA phổ biến.

Ngữ cảnh: 260K token.

Giá: 0,20 USD cho mỗi triệu token đầu vào và 0,75 USD cho mỗi triệu token đầu ra.

Trong thời điểm ra mắt, Mercury 2.5 được giảm giá 80%, chỉ còn 0,04 USD cho mỗi triệu token đầu vào và 0,15 USD cho mỗi triệu token đầu ra.

Khả năng: Suy luận có thể điều chỉnh, gọi công cụ song song và JSON chuẩn hóa theo lược đồ (schema-aligned).

Speed BenchmarkMercury 2.5 vs Mercury 2.0

Kể từ khi Mercury 2 ra mắt, chúng tôi đã chứng kiến Inception thúc đẩy các mô hình ngôn ngữ dựa trên khuếch tán tiến xa hơn trên hạ tầng AI của NVIDIA. Bước tiến về trí thông minh của Mercury 2.5, kết hợp với tốc độ bền bỉ và chi phí thấp, phản ánh tốc độ mà các kiến trúc mới có thể trưởng thành thành các hệ thống sẵn sàng cho sản xuất trên nền tảng NVIDIA.

Shruti Koparkar, Giám đốc cấp cao về Sản phẩm, Nhóm Điện toán Tăng tốc tại NVIDIA

Mercury trong môi trường thực tế

Các tác nhân tìm kiếm (Search Agents) và đường ống RAG

Một yêu cầu tìm kiếm có thể kích hoạt hàng chục lệnh gọi mô hình: lập kế hoạch tìm kiếm, viết lại truy vấn, xếp hạng lại kết quả, cấu trúc dữ liệu, tóm tắt nguồn và kiểm tra câu trả lời. Mercury giữ cho các lệnh gọi đó đủ nhanh để nằm gọn trong một tương tác duy nhất của người dùng. Một số công ty hạ tầng tìm kiếm hàng đầu hiện đang vận hành nó trong môi trường thực tế.

Query Rewrite Latency Benchmark

Các tác nhân giọng nói và ứng dụng tương tác

Trong lĩnh vực giọng nói, độ trễ không phải là một chi tiết hạ tầng. Đó chính là khoảng lặng mà người gọi nghe thấy.

OpenCall xây dựng các tác nhân điện thoại AI xử lý các cuộc gọi khách hàng trực tiếp. Trên khối lượng công việc thực tế của họ, Mercury đã đưa độ trễ phản hồi trung vị của mô hình xuống gần 170 mili giây.

Sau khi chuyển sang Mercury, thời gian phản hồi P99 của chúng tôi đã giảm từ vài phút xuống chỉ còn một giây, và P50 của chúng tôi giảm từ 0,4 giây xuống dưới 0,2 giây — nhanh hơn đáng kể so với bất kỳ nhà cung cấp nào khác mà chúng tôi từng thấy, và đó là đã bao gồm cả quá trình suy luận.

Oliver Silverstein, Đồng sáng lập và CEO, OpenCall

Các tác nhân phụ và trợ lý lập trình

Các tác nhân lập trình đã chia nhỏ công việc giữa các mô hình. Một tác nhân có thể lập kế hoạch hoặc viết mã trong khi các tác nhân khác tìm kiếm, chạy công cụ, định tuyến yêu cầu, tóm tắt trạng thái hoặc nén một phiên làm việc dài. Các lệnh gọi hỗ trợ đó diễn ra lặp đi lặp lại, vì vậy độ trễ và chi phí sẽ tăng lên rất nhanh.

Augment Code sử dụng Mercury để nén ngữ cảnh, định tuyến mô hình và tìm kiếm công cụ MCP. Việc chuyển quá trình nén sang Mercury đã cắt giảm 82% độ trễ, từ khoảng 150 giây xuống còn 27 giây, đồng thời giảm 90% chi phí mà vẫn duy trì được chất lượng. Các bản tóm tắt tìm kiếm công cụ được trả về trong chưa đầy một giây.

Tốc độ tương tự cũng áp dụng cho việc phát triển ứng dụng web. Hãy xem Mercury 2.5 tạo ra một ứng dụng web nhật ký khám phá âm nhạc hoạt động từ một vài câu lệnh trong bản demo bên dưới.

Bản xem trước Mercury Voice và Mercury Router

Cùng với Mercury 2.5, chúng tôi công bố bản xem trước của Mercury Voice và Mercury Router.

Mercury Voice mang lại thời gian phản hồi token đầu tiên (TTFT) dưới 170 mili giây và là một dLLM được tối ưu hóa cho các tác nhân giọng nói với ngân sách độ trễ khắt khe nhất.

Mercury Router hiểu các câu lệnh đầu vào bằng dLLM và định tuyến chúng đến các mô hình tốt nhất (cả mô hình mở và đóng) cung cấp sự kết hợp tối ưu giữa chất lượng, tốc độ và chi phí.

Bắt đầu

Các mô hình Mercury có sẵn thông qua Inception API, Baseten và OpenRouter của chúng tôi. Các triển khai doanh nghiệp hỗ trợ dung lượng chuyên dụng, tự động mở rộng, kiểm soát tuân thủ và lưu giữ dữ liệu có thể cấu hình.

Thử nghiệm Mercury 2.5 trong trò chuyện · Thử nghiệm API với 100 triệu token miễn phí · Đọc tài liệu API

Khách hàng của Baseten: Triển khai Mercury 2.5 thông qua thiết lập Baseten hiện tại của bạn.

Các công ty thuộc Y Combinator: Nhận quyền lợi triển khai trị giá 500.000 USD.

InceptionMercury 2.5Mô hình ngôn ngữAI hiệu năng caoLLM
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.