Thủ thuật
Điểm tin mô hình mở (#23): Laguna S2.1, Inkling và Kimi K3 định nghĩa lại hiệu suất tối ưu
(giờ Việt Nam)
Tóm tắt AI
Thinking Machines ra mắt Inkling, mô hình đa phương thức MoE 975B hỗ trợ văn bản, hình ảnh và âm thanh, cùng phiên bản rút gọn 276B, khẳng định vị thế mới của các mô hình mã nguồn mở.
Bản dịch AI

Hợp nhất là một trong những kịch bản mà nhiều nhà quan sát nhạy bén đã dự đoán cho tương lai gần của các phòng thí nghiệm đào tạo mô hình. Nó được coi là điều tất yếu khi chi phí đào tạo tăng theo cấp số nhân mỗi năm. Tuy nhiên, với tư cách là một người từng dự đoán vào năm 2024 rằng sự hợp nhất sẽ thực sự bùng nổ vào năm 2026 hoặc 2027, chúng ta đang ở đâu? Chúng ta đang ở thời điểm mà ngày càng có nhiều công ty đào tạo các mô hình mạnh mẽ — vẫn dễ dàng đầu tư hàng trăm triệu đến hàng tỷ đô la cho tổng nỗ lực này — và ngày càng có nhiều tổ chức phát hành các mô hình này một cách công khai.
Nhu cầu về token đang cực kỳ cao và có khả năng sẽ còn tăng khi các mô hình trở nên hiệu quả hơn và mở ra nhiều trường hợp sử dụng khả thi hơn. Tất cả các phòng thí nghiệm mà chúng ta từng nghĩ sẽ cần phải hợp nhất đang nhận ra rằng xây dựng các "cỗ máy tạo token" là một con đường dẫn đến giá trị, và theo thời gian, sẽ có thêm nhiều công ty xác định được nguồn giá trị đó.
Ví dụ điển hình là Thinking Machines — khi họ công bố công ty vào tháng 2 năm 2025, rất ít người xếp họ vào nhóm các công ty mô hình mở, bao gồm cả tôi. Hiện nay, dịch vụ tinh chỉnh mô hình mở của họ đang mang lại doanh thu hàng trăm triệu đô la mỗi năm và họ đang phát hành những mô hình trọng số mở (open-weight) tốt nhất được xây dựng tại Hoa Kỳ — vượt lên trước những đơn vị dẫn đầu ban đầu là NVIDIA với Nemotron và Arcee với Trilogy.
Chia sẻ
Ở phía bên kia của hệ sinh thái là tốc độ duy trì từ các phòng thí nghiệm Trung Quốc, với những cái tên mới gia nhập như Xiaomi vẫn đang tích lũy được sự quan tâm trong nền kinh tế AI rộng lớn hơn. Sau khi dự đoán về sự hợp nhất trong một thời gian dài, giờ đây có vẻ như một lựa chọn an toàn hơn là dự đoán về sự chấp nhận liên tục, và cố gắng hình dung vai trò của các mô hình mở trong đó. Các giấy phép chia sẻ doanh thu như Kimi K3 có thể tồn tại được bao lâu? Các mô hình mở có thể chiếm được bao nhiêu thị phần? Chúng ta đang bước vào kỷ nguyên quyết định.
Đây là một trong những bản tóm tắt đầy đủ nhất về các mô hình mở mà chúng tôi từng thực hiện, chúng tôi rất hào hứng!
Inkling của Thinking Machines: Mô hình đầu tiên từ Thinking Machines là một mô hình MoE đa phương thức 975B-A41B, hỗ trợ đầu vào là văn bản, hình ảnh và âm thanh, đồng thời tạo ra đầu ra là văn bản. Mặc dù không phải là mô hình mạnh nhất trong cùng phân khúc kích thước (tại Trung Quốc), nhưng nó được định vị là nền tảng tuyệt vời để tinh chỉnh, ví dụ như thông qua dịch vụ thương mại Tinker của họ. Họ cũng phát hành một phiên bản nhỏ hơn (276B-A12B), vốn rất cạnh tranh so với kích thước của nó.
Hy3 của Tencent: Một mô hình MoE 295B-A21B từ Tencent. Nó cải thiện so với phiên bản tiền nhiệm trên tất cả các chỉ số. Tuy nhiên, đáng chú ý nhất là sự thay đổi về giấy phép: Trong khi phiên bản trước (được đề cập trong Artifacts 21) sử dụng giấy phép tùy chỉnh và khá hạn chế, Tencent đã chuyển sang Apache 2 cho bản phát hành này. Mô hình này cũng đã chứng minh được khả năng giải một bài toán toán học 50 năm tuổi (với một bộ công cụ chuyên dụng và Sol đóng vai trò giám khảo, mặc dù chưa rõ vai trò của Sol quan trọng đến mức nào).

Laguna-S-2.1 của poolside: Poolside nhanh chóng nổi lên từ hư không để trở thành khách mời thường xuyên tại Artifacts, đánh dấu lần xuất hiện thứ ba trong ba tháng liên tiếp. S2.1 là phiên bản mới được tiền huấn luyện và hậu huấn luyện của mô hình MoE 118B-A8B, có thể chạy trên DGX Spark, điều này đã thu hút rất nhiều sự chú ý. Poolside cũng áp dụng giấy phép OpenMDW, một loại giấy phép miễn phí tương tự Apache 2.0 nhưng có sự hỗ trợ pháp lý tốt hơn dành riêng cho các mô hình AI. Công ty cũng đi sâu vào chi tiết hơn trong blog của mình, bao gồm tất cả các quỹ đạo đánh giá. Đây là mức độ minh bạch rất lớn cho một bản phát hành mô hình mở!
DeepSeek-V4-Flash-0731 của deepseek-ai: Chỉ một ngày sau khi OpenAI giảm giá mô hình nhỏ nhất của họ xuống 80%, "ông lớn" này đã tung ra bản cập nhật cho mô hình V4 Flash, đánh bại Luna tại biên Pareto. Mô hình lớn hơn vẫn chưa được cập nhật, vì vậy vẫn còn phải xem nó sẽ đạt được hiệu suất như thế nào. Đối với các bản phát hành V4 ban đầu, phiên bản Flash là ngôi sao về hiệu suất trên mỗi tham số, trong khi bản Pro khá mờ nhạt.

Kimi-K3 của moonshotai: Đây là bản phát hành mô hình mở lớn nhất trong thời gian gần đây, và chúng tôi đã đề cập đến nó trong một bài viết riêng và một tập podcast. Nó được phát hành theo giấy phép phi thương mại, yêu cầu các nhà cung cấp dịch vụ suy luận và tinh chỉnh phải ký kết thỏa thuận thương mại. Kevin Xu và Graham Webster lập luận trong một bài viết rằng các giấy phép này tạo điều kiện cho các hành động chính phủ trong tương lai nhắm vào các thực thể Hoa Kỳ đang kinh doanh với các công ty AI Trung Quốc:
Nhưng nếu một công ty Hoa Kỳ cần hợp đồng với Moonshot để cung cấp các token suy luận mà Kimi K3 tạo ra, thì bức tranh sẽ khác. Một số công cụ chính sách mà các quan chức Hoa Kỳ và những người khác đã tranh luận như các đòn bẩy tiềm năng để hạn chế việc sử dụng mô hình mở của Trung Quốc sẽ được áp dụng rõ ràng hơn.
LongCat-2.0 của meituan-longcat: "DoorDash của Trung Quốc" đã trở lại. Lần này, công ty đã phát hành một mô hình MoE lớn khác với 1,6 nghìn tỷ tham số. Mặc dù bản thân mô hình này không phải là mạnh nhất so với kích thước của nó nếu xét ngoài các bài kiểm tra chuẩn, nhưng nó được đào tạo hoàn toàn trên Ascend 910, khiến nó trở thành mô hình phi Huawei, không phải mô hình thử nghiệm đầu tiên được đào tạo hoàn toàn trên các bộ tăng tốc của Trung Quốc. Các chip khác của Trung Quốc chủ yếu chỉ được sử dụng cho suy luận (nếu có).
Laguna-XS-2.1 của poolside: Bản cập nhật cho mô hình MoE nhỏ (33B-A3B) từ Poolside.
Motif-3-Beta của Motif-Technologies: Bản xem trước của mô hình MoE 314B-A13B từ công ty Motif của Hàn Quốc. Đây là mô hình tham vọng nhất của công ty cho đến nay, vì nó lớn hơn đáng kể và giới thiệu một số cải tiến về kiến trúc như GDLA và mHC.
Apertus-v1.5-70B của swiss-ai: Một bản tiền huấn luyện tiếp nối của Apertus 1.0 hoàn toàn mã nguồn mở, sử dụng thêm 2 nghìn tỷ token.
Instella-MoE-16B-A3B-Think của amd: Một mô hình MoE 16B-A3B được AMD đào tạo trên các card Instinct. AMD cũng cung cấp tất cả các giai đoạn khác nhau, từ cơ sở đến các checkpoint SFT, cũng như MidTrain và DPO.

Bài viết được AI dịch và tổng hợp tự động từ Nathan Lambert: Interconnects. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.