QbitAI
85

Mô hình

Mô hình RSI nội địa Trung Quốc ra mắt: Đối thủ đáng gờm thách thức các dòng flagship

(giờ Việt Nam)

Tóm tắt AI

Mô hình RSI mới từ Trung Quốc chính thức trình làng với ưu đãi tặng miễn phí 100 triệu Tokens cho người dùng, hứa hẹn cạnh tranh trực tiếp với các dòng model flagship hiện nay.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-09-17 11:26:21 Nguồn: QbitAI

Tặng miễn phí 100 triệu Tokens cho tất cả mọi người

RSI, thực sự đã trở thành cơn sốt.

Từ Thung lũng Silicon lan rộng đến trong nước, "để mô hình tự tham gia huấn luyện phiên bản kế tiếp của chính mình" gần như chỉ sau một đêm đã trở thành chủ đề nóng nhất trong giới AI.

Tuy nhiên, dù sôi động là vậy, nhưng hiện tại số lượng đơn vị thực sự đưa ra được sản phẩm từ mô hình này vẫn chỉ đếm trên đầu ngón tay.

Và ngay tại thời điểm này, "cổ phiếu AGI đầu tiên trên sàn chứng khoán Hồng Kông" Unisound đã chính thức ra mắt U2-Flash, tiên phong đưa ra bản báo cáo sớm về RSI nội địa.

△ Nguồn ảnh: Unisound

Trong vòng lặp hậu huấn luyện (post-training) của U2-Flash, mô hình đã bắt đầu tham gia sâu vào quá trình tự tiến hóa của chính nó:

Từ việc tạo dữ liệu huấn luyện, phân tích quỹ đạo thực thi, cho đến kiểm tra và sửa lỗi hệ thống huấn luyện.

Sau đó, phần đi ngược lại với lẽ thường xuất hiện.

Theo thông lệ ngành, Flash thường được mặc định là "phiên bản thay thế giá rẻ của dòng flagship", thường nhanh hơn, rẻ hơn nhưng năng lực lại bị cắt giảm.

Vậy kết quả của U2-Flash thì sao?

Tốc độ và khả năng tiết kiệm chi phí thực sự không hề nói suông. So với U2, tốc độ tạo văn bản của nó tăng 2,1 lần, thời gian hoàn thành tác vụ Agent rút ngắn 35%, số bước lặp tác vụ và mức tiêu thụ Token cũng giảm từ 20% đến 30%.

Nhưng năng lực không những không bị cắt giảm mà còn bỏ xa thế hệ U2 tiền nhiệm:

Và điều đáng chú ý hơn cả việc vượt qua thành tích cũ chính là mật độ thông minh mà U2-Flash thể hiện.

Nó sử dụng kiến trúc MoE thưa (sparse MoE), tổng tham số khoảng 266B, mỗi lần suy luận chỉ kích hoạt khoảng 10B, chưa đến 4% tổng tham số, nhưng trong các tác vụ như lập trình, Agent, nó đã mang lại kết quả đủ sức đối đầu trực diện với các mô hình chủ lực, thậm chí một số hiệu suất còn lọt vào phân khúc của các mô hình có quy mô nghìn tỷ tham số.

Chà, điều này tương đương với việc phá vỡ trực tiếp "tam giác bất khả thi" của dòng Flash:

Nhanh hơn, tiết kiệm hơn, mà năng lực còn vượt hẳn một thế hệ.

Không nói nhiều nữa, bắt tay vào kiểm tra thực tế ngay thôi.

Coi Flash là công cụ làm việc chủ lực, câu trả lời lần này là: yes!

Mở nền tảng MaaS của Unisound, U2-Flash đã được đặt ngay trên trang chủ, nền tảng hỗ trợ trải nghiệm trực tuyến và đăng ký gọi API.

Tôi đặc biệt chú ý đến API, nó tương thích đồng thời với hai giao thức chính là OpenAI và Anthropic. Các công cụ phổ biến như Claude Code, Trae, Cursor, Cline đều được cung cấp cách kết nối chính thức. Với những công cụ còn lại, chỉ cần Harness hỗ trợ mô hình tùy chỉnh, bạn chỉ cần thay đổi Base URL, API Key và ID mô hình là có thể kết nối.

Không làm mất thời gian, tôi chọn ngay WorkBuddy đang có sẵn, chưa đầy một phút đã hiển thị gọi thành công.

Nhân tiện, U2-Flash còn cung cấp 4 mức cường độ suy nghĩ: none, low, high và max, có thể chuyển đổi giữa tốc độ và độ sâu suy luận tùy theo độ khó của tác vụ. Tuy nhiên, lần này WorkBuddy không mở tính năng chuyển đổi thủ công nên tôi không ép buộc kiểm tra chéo.

Vừa định nạp chút tiền vào mô hình thì nhìn vào bảng điều khiển, bất ngờ xuất hiện:

U2-Flash hiện đang giảm giá 40% trong thời gian giới hạn.

Giá đầu vào 0,6 tệ/triệu Tokens, giá đầu ra 1,2 tệ/triệu Tokens, giá cache hit 0,12 tệ/triệu Tokens.

Là người quen thuộc với giá API của các mô hình chính thống trong nước, tôi biết U2-Flash về cơ bản có thể xếp vào nhóm "giá rẻ".

Chưa kịp nạp tiền thì trang quản trị đột nhiên nhảy ra một trang sự kiện, ừm??

Từ ngày 15 tháng 9 đến ngày 30 tháng 9, ai cũng có thể nhận miễn phí hạn mức sử dụng 100 triệu Tokens.

100 triệu Tokens, tính theo mức tiêu thụ vài trăm nghìn đến một triệu Tokens cho một lần phân tích kho mã nguồn hoặc tác vụ tài liệu dài, thì cũng đủ để chạy liên tục hàng chục đến hàng trăm lần.

Vậy còn chờ gì nữa.

Tôi lập ngay một bảng so sánh U2 và U2-Flash, sau đó chọn ra ba điểm cần kiểm tra trọng tâm.

1. U2-Flash có thể làm việc vừa nhanh vừa tốt không?

2. Khi gặp sự cố bất ngờ, nó có thể tự cứu vãn tình hình không?

3. Cửa sổ ngữ cảnh 512K rốt cuộc là năng suất thực tế, hay chỉ là một con số đẹp đẽ?

RSIAI Trung QuốcMô hình ngôn ngữCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.