Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
75

Mô hình

Multiverse Computing ra mắt Quasar 438B: Mô hình suy luận hàng đầu châu Âu

(giờ Việt Nam)

Tóm tắt AI

Multiverse Computing vừa giới thiệu Quasar 438B, mô hình AI chuyên biệt cho tác vụ lập trình và đại lý thông minh doanh nghiệp, hỗ trợ song ngữ Anh - Tây Ban Nha.

Bản dịch AI

Introducing Quasar 438B: Europe's Leading AI Model

Quasar 438B là mô hình suy luận chủ lực của chúng tôi, được xây dựng cho các tác nhân (agents) quy mô doanh nghiệp và lập trình. Đây là mô hình lớn đầu tiên mà Multiverse Computing phát hành, hỗ trợ tiếng Anh và tiếng Tây Ban Nha, đồng thời đạt 43 điểm trên Artificial Analysis Intelligence Index, kết quả cao nhất trong số các mô hình châu Âu trong lĩnh vực này.

Intelligence Index v4.1.1 kết hợp chín đánh giá: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience và AA-LCR. Với 43 điểm, Quasar vượt trên Mistral Medium 3.5 (30 điểm), NVIDIA Nemotron 3 Ultra (38 điểm) và Inkling (42 điểm), trong một lĩnh vực dẫn đầu bởi Claude Opus 5 với 63 điểm.

Quasar không chỉ thông minh mà còn rất nhanh. Mô hình này phản hồi 500 token, bao gồm cả thời gian suy nghĩ, trong 15,3 giây. Chỉ có ba mô hình trong bảng so sánh nhanh hơn, và chỉ một trong số đó, Gemini 3.7 Flash, đạt điểm số cao hơn trên chỉ số này. Trong số các mô hình vượt điểm Quasar, chỉ có hai mô hình trả lời dưới 25 giây. Những mô hình còn lại mất từ 38 đến 156 giây.

Multiverse Computing đã xây dựng vị thế của mình dựa trên việc làm cho AI trở nên hiệu quả và dễ triển khai hơn. Quasar mang nỗ lực đó vào phân khúc mô hình trên 400 tỷ tham số: một mô hình suy luận cho các tác vụ đa bước cần lập kế hoạch, sử dụng công cụ, thực thi mã và ngữ cảnh lớn mà không gặp phải độ trễ thường thấy ở phân khúc này.

Mô hình hiện đã có sẵn thông qua CompactifAI API, vì vậy các đội ngũ có thể thử nghiệm mà không cần thiết lập cơ sở hạ tầng.

Mô hình châu Âu đạt điểm cao nhất

Hình 1. Artificial Analysis Intelligence Index v4.1.1, một chỉ số tổng hợp từ chín đánh giá. Điểm càng cao càng tốt.

Quasar đạt 43 điểm trên chỉ số tổng hợp. Con số này cao hơn 13 điểm so với Mistral Medium 3.5 và cao hơn 5 điểm so với Nemotron 3 Ultra, dù mô hình này có nhiều hơn 112 tỷ tham số.

Tốc độ đẳng cấp tiên phong

Hình 2. Thời gian phản hồi toàn trình: số giây để xuất 500 token, bao gồm cả thời gian suy luận. Thời gian càng thấp càng tốt.

Quasar hoàn thành phản hồi 500 token trong 15,3 giây. Ba mô hình nhanh hơn trong bảng so sánh là Nemotron 3.5 Lightning với 9,4 giây (đạt 24 điểm trên chỉ số), Gemini 3.5 Flash-Lite với 10,8 giây (đạt 37 điểm) và Gemini 3.7 Flash với 11,5 giây (đạt 56 điểm). Chỉ có mô hình cuối cùng là vừa nhanh hơn vừa có năng lực cao hơn.

Xét theo hướng ngược lại, khoảng cách còn lớn hơn. Quasar đạt 43 điểm và mất 15,3 giây. Mistral Medium 3.5 đạt 30 điểm và mất 18,8 giây. Nemotron 3 Ultra đạt 36 điểm và mất 25,7 giây, Inkling đạt 42 điểm và cần 48,3 giây, gấp hơn hai lần so với Quasar 438B.

Khi so sánh với Mistral Medium 3.5, kết quả nghiêng về một phía trên cả hai trục: Quasar đạt điểm cao hơn (43 so với 30) và trả lời nhanh hơn (15,3 giây so với 18,8 giây).

Suy luận ngữ cảnh dài

Hình 3. Điểm số AA-LCR. Điểm càng cao càng tốt.

Quasar đạt 75,0 điểm trên AA-LCR, bài kiểm tra khả năng trích xuất, kết nối và suy luận dựa trên thông tin trải dài trong các tài liệu dài. Kết quả này ngang bằng với Grok 4.6 (high) ở mức 75,0, và chỉ kém Claude Opus 5 (75,7) và Qwen3.8 2.4T A95B (75,3) chưa đầy một điểm. Nó dẫn trước Nemotron 3 Ultra 4,0 điểm và Mistral Medium 3.5 là 9,7 điểm.

Khả năng xử lý ngữ cảnh dài là nền tảng cho nghiên cứu doanh nghiệp, phân tích tài liệu và các quy trình làm việc của tác nhân (agentic workflows), và đây là nơi Quasar tiến gần nhất đến nhóm dẫn đầu.

Lập trình tác nhân và làm việc trên terminal

Hình 4. Điểm số Terminal-Bench v2.1. Điểm càng cao càng tốt.

Quasar đạt 69,3 điểm trên Terminal-Bench v2.1, bài kiểm tra đưa các tác nhân vào làm việc trong môi trường terminal thực tế. Nó dẫn trước Mistral Medium 3.5 là 18,7 điểm và Nemotron 3 Ultra là 15,4 điểm, đồng thời bám đuổi nhóm dẫn đầu với Claude Opus 5 đạt 89,1 điểm. Đây là đánh giá có nhiều dư địa phát triển nhất cho Quasar, và cũng là mục tiêu cho vòng phát triển tiếp theo.

Bốn kết quả trong một cái nhìn

Bảng 1. Quasar 438B trên bốn biểu đồ của Artificial Analysis. Nguồn: Artificial Analysis.

Được xây dựng cho các tác nhân và lập trình quy mô doanh nghiệp

Quasar được xây dựng cho các tổ chức đang vận hành các tác nhân phát triển phần mềm, trợ lý kỹ thuật (technical copilots), hệ thống nghiên cứu và tự động hóa quy trình làm việc. Các kết quả từ Terminal-Bench và ngữ cảnh dài hỗ trợ các tác nhân cần duy trì ngữ cảnh, phối hợp hành động và thực hiện các tác vụ đa bước. Thời gian phản hồi giúp các vòng lặp này đủ nhanh để tích hợp vào một sản phẩm tương tác thay vì chỉ là một tác vụ xử lý hàng loạt (batch job).

Việc hỗ trợ tiếng Anh và tiếng Tây Ban Nha biến Quasar thành nền tảng thiết thực cho các doanh nghiệp châu Âu và quốc tế, những đơn vị cần khả năng suy luận mà không bị giới hạn việc triển khai trong một ngôn ngữ duy nhất. Các đội ngũ có thể đưa mô hình vào làm việc trong lĩnh vực kỹ thuật, vận hành và công việc tri thức, bất cứ nơi nào mà độ chính xác, ngữ cảnh và khả năng hoàn thành tác vụ đáng tin cậy quyết định kết quả.

Nhiều bản cập nhật sẽ sớm ra mắt cho Quasar. Hãy đón chờ.

Bắt đầu ngay

CompactifAI API. Đăng ký và bắt đầu gửi yêu cầu tại: dashboard.compactif.ai

Artificial Analysis. Xem các bảng xếp hạng (benchmarks)

Liên hệ. Kết nối với đội ngũ của chúng tôi tại [email protected]

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.