Interconnects (Nathan Lambert)
85

Mô hình

Điểm tin mô hình mở (#24): Motif-3, GLM-5.3, Hy4-preview và xu hướng cấp phép

(giờ Việt Nam)

Tóm tắt AI

Hệ sinh thái mô hình mã nguồn mở tiếp tục mở rộng mạnh mẽ với sự xuất hiện của nhiều kiến trúc mới và những thay đổi đáng chú ý trong quy định cấp phép.

Bản dịch AI

Latest open artifacts (#24): Motif-3, GLM-5.3, Hy4-preview and open model licenses

Những độc giả thường xuyên của Artifacts đều biết rằng chúng tôi đã theo dõi không chỉ các mô hình mà còn cả giấy phép của chúng trong một thời gian khá dài. Đã có một giai đoạn mà các giấy phép tùy chỉnh trở nên cực kỳ phổ biến, ví dụ như giấy phép tùy chỉnh của Qwen2.5 72B-Instruct hay các giấy phép của Llama. DeepSeek từng có một giấy phép tùy chỉnh cho DeepSeek V3 trước khi R1 chuyển sang MIT, điều này đã dẫn đến việc nhiều nhà phát triển mô hình (Trung Quốc) áp dụng giấy phép MIT hoặc Apache 2.0 trong năm 2025.

Năm 2026, các mô hình mở trở nên cạnh tranh hơn bao giờ hết, dẫn đến hai diễn biến thú vị: Các nhà phát triển mô hình phương Tây áp dụng giấy phép mở, với cả Google và Meta đều chuyển sang Apache 2.0. Tuy nhiên, các nhà phát triển mô hình hàng đầu tại Trung Quốc lại đang trở nên hạn chế hơn: Kimi K3 đi kèm với giấy phép yêu cầu thỏa thuận thương mại đối với những ai vận hành dịch vụ suy luận hoặc tinh chỉnh, và MiniMax M3 yêu cầu các thỏa thuận nếu vượt quá ngưỡng doanh thu nhất định và cấm một số trường hợp sử dụng cụ thể.

Sự bổ sung mới nhất là GLM-5.3 của Zhipu, vốn đã chuyển từ MIT (trên GLM-5.2 và các phiên bản trước đó) sang một giấy phép tùy chỉnh với điều khoản sau dành cho các nhà cung cấp dịch vụ suy luận và tinh chỉnh:

Nếu Bên được cấp phép hoặc bất kỳ chi nhánh nào của họ vận hành doanh nghiệp Mô hình dưới dạng Dịch vụ (Model as a Service), và tổng doanh thu của Bên được cấp phép cùng các chi nhánh vượt quá 10 tỷ đô la Mỹ (hoặc giá trị tương đương bằng các loại tiền tệ khác) trong bất kỳ khoảng thời gian 12 tháng liên tục nào, Bên được cấp phép phải vượt qua quy trình đánh giá bảo mật của Z.AI trước khi sử dụng Phần mềm hoặc các tác phẩm phái sinh của nó cho bất kỳ mục đích thương mại nào. Phạm vi và phương thức đánh giá bảo mật sẽ do Z.AI quyết định một cách hợp lý.

Mặc dù ngưỡng 10 tỷ đô la Mỹ là rất cao so với các giấy phép cùng loại khác, nhưng thuật ngữ “chi nhánh” (affiliates) lại không được định nghĩa trong giấy phép, điều này làm tăng thêm sự không chắc chắn và tạo ra rào cản cho việc áp dụng. Hơn nữa, giấy phép được cung cấp bằng cả tiếng Anh và tiếng Trung, trong đó văn bản tiếng Trung sử dụng từ “” (bên liên quan) – vốn đã có định nghĩa trong luật pháp Trung Quốc.

Chúng tôi không phải là chuyên gia pháp lý và có những lý do rõ ràng khiến các giấy phép như vậy được tạo ra. Tuy nhiên, chúng tôi muốn làm nổi bật những vấn đề nảy sinh khi tạo ra các giấy phép như vậy, đặc biệt là trong một thế giới có rất nhiều lựa chọn thay thế mở và đóng hợp lệ.

Chia sẻ

Motif-3 của Motif-Technologies: Motif là một trong số ít những "viên ngọc ẩn" hiện nay, thể hiện sự đổi mới trong quá trình huấn luyện mô hình với nguồn lực rất hạn chế so với các đối thủ khác. Motif-3 đi kèm với giấy phép MIT và đạt điểm số ấn tượng so với kích thước của nó. Xét theo lộ trình phát hành mô hình từ Motif 2.6B mà chúng tôi đã đưa tin vào năm 2025 và Motif-2-12.7B, những cải tiến này thực sự rất ấn tượng.

dots3-note-prev của dots-studio: RedNote/Xiaohongshu, nền tảng Instagram của Trung Quốc, cũng đang trở nên nghiêm túc hơn trong việc huấn luyện mô hình, mặc dù họ không hẳn là người mới khi đã phát hành các mô hình từ đầu năm 2025. dots3 cũng đã giành chiến thắng tại IMO 2026 với điểm số tuyệt đối nhờ sử dụng một hệ thống đánh giá nội bộ. Chúng tôi kỳ vọng nhiều hơn từ họ trong tương lai gần.

General Reasoning and Agent evaluation results

Qwen3.8-Flash-Next của Qwen: Bản xem trước của phiên bản mô hình Qwen tiếp theo về mặt kiến trúc: 125B-A6B với 51B n-gram embeddings. Nó sử dụng GDN và Qwen Sparse Attention. Tương tự như Qwen3-Next-80B-A3B-Instruct, chúng tôi kỳ vọng các kiến trúc tương tự sẽ trở nên phổ biến hơn và hệ sinh thái sẽ hoàn thiện các tích hợp trước khi Qwen4 ra mắt.

GLM-5.3-Flash của zai-org: Bản phát hành này đã hoàn thiện phiên bản "cẩm nang mô hình Trung Quốc" mà chúng tôi đã viết vào năm 2025: Mô hình được phát hành dưới dạng "mô hình ẩn danh" miễn phí sử dụng với tên gọi "Ox-Alpha" trên OpenRouter và OpenCode, điều này khiến mọi người hào hứng dùng thử ngay từ đầu. Sau đó, họ suy đoán về người tạo ra và kích thước của nó, cho rằng đó là một mô hình >1T từ Cursor/xAI, Gemini hoặc một mô hình tiền huấn luyện mới từ các phòng thí nghiệm mã nguồn mở. Vì mô hình có hiệu suất tương đối tốt, mọi người đã tiếp tục suy đoán trong nhiều ngày về tác giả của nó, từ đó tạo nên sự cường điệu (hype). Điều này cũng làm giảm bớt những cáo buộc về "benchmaxxing" (tối ưu hóa chỉ để đạt điểm cao) vốn đi kèm với mọi bản phát hành mô hình (mở).

bench_53

Hy4-preview của tencent: Tencent đang trở thành một đối thủ đáng gờm trong không gian mô hình mở, tăng kích thước mô hình chủ lực của họ trong khi vẫn duy trì vòng lặp hậu huấn luyện (post-training). Kết quả là Hy4-preview, một mô hình có năng lực nhưng hiện đang gặp vấn đề về việc "suy nghĩ quá mức" (overthinking). Tuy nhiên, nếu lộ trình từ Hy3-preview đến Hy3 là một dấu hiệu, thì mô hình cuối cùng có thể là một ứng cử viên thực sự cho các vị trí hàng đầu trong thế giới mô hình mở.

Xem thêm chi tiết về tất cả các mô hình trong số này tại Artifacts Hub của chúng tôi.

Truy cập artifactshub.ai

NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 của nvidia: Một bản cập nhật cho Nemotron, mang đến những cải tiến về hiệu suất – đặc biệt là tốc độ – trên toàn diện.

bench_53

Ling-3.0-flash của inclusionAI: Ant Ling là khách mời thường xuyên tại Artifacts Log; họ hiện đang ở phiên bản mô hình thứ ba, áp dụng thiết kế lai (KDA + Gated MLA), tương tự như các mô hình khác. Họ cũng phát hành một phiên bản nhỏ 7.9B-A1.3B.

Qwen3.8-2.4T-A95B của Qwen: Trong một diễn biến khá bất ngờ, Alibaba cũng bắt đầu công khai phát hành các phiên bản lớn nhất của Qwen. Tuy nhiên, nó đi kèm với một giấy phép tùy chỉnh và hiệu suất của nó vẫn đứng sau các mô hình khác cùng kích thước.

mô hình mởAIcông nghệcấp phépcập nhật
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Interconnects (Nathan Lambert). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.