smol.ai AI News
85

Mô hình

Alibaba ra mắt Qwen3.8-Max: Cuộc đua mô hình mã nguồn mở nóng lên tại Trung Quốc

(giờ Việt Nam)

Tóm tắt AI

Alibaba vừa trình làng Qwen3.8-Max, mô hình 2.4 nghìn tỷ tham số với khả năng lập trình và xử lý đa phương thức vượt trội, thách thức trực tiếp các đối thủ từ Mỹ. Sự trỗi dậy của các phòng lab Trung Quốc đang định hình lại cuộc chơi mô hình mở với hiệu suất và chi phí tối ưu.

Bản dịch AI

not much happened today | AINews

Một ngày yên ắng.

Tin tức AI từ 25/7/2026 đến 27/7/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn đăng ký/hủy đăng ký nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

Sự ra mắt của Qwen3.8-Max, xu hướng chuyển dịch sang open-weights và vị thế đánh giá ban đầu

Làn sóng mô hình mở từ Trung Quốc: Kimi, DeepSeek, GLM và khoảng cách đang dần thu hẹp

Khung tác nhân (agent harnesses), các hệ thống tầm nhìn xa (long-horizon systems) và lý do tại sao chất lượng mô hình đơn thuần là chưa đủ

Nghiên cứu tự động, hậu huấn luyện (post-training) và thiết kế benchmark đang trở thành các ngành kỹ thuật nghiêm túc hơn

Hệ thống đa phương thức và video: MiniMax H3, mô hình thế giới (world models) và tạo nội dung cục bộ

Hệ thống suy luận, trình biên dịch, giọng nói thời gian thực và các cơ sở hạ tầng khác đáng theo dõi

Các tweet hàng đầu (theo mức độ tương tác)

Tóm tắt AI trên Reddit

Tóm tắt từ /r/LocalLlama + /r/localLLM

1. Ra mắt Qwen3.8-Max và phiên bản 27B Open-Weight

Qwen3.8-Max ngang hàng với Kimi K3 và DeepSeek V4 Flash (Hoạt động: 541): Hình ảnh là trang BenchmarkList cho Qwen3.8-Max, cho thấy một mô hình Qwen open-weights với ECI thực nghiệm đạt 143.33, xếp hạng #12 chung cuộc và #3 trong số các mô hình open-weight; biểu đồ đặt nó gần với Kimi K3 và DeepSeek V4 Flash, phù hợp với tuyên bố của bài đăng rằng nó hoạt động cạnh tranh trên các danh mục benchmark. Bài đăng bổ sung rằng Qwen3.8-Max là mô hình 2.4T tham số với trọng số dự kiến ra mắt "vào tuần tới", giá 2 USD/1 triệu token đầu vào, 6 USD/1 triệu token đầu ra và 0,25 USD/1 triệu token cho bộ nhớ đệm ẩn (implicit caching), đồng thời khẳng định hiệu suất đặc biệt mạnh mẽ trong các tác vụ lập trình/phần mềm. Hình ảnh: So sánh BenchmarkList Qwen3.8-Max. Người bình luận đặt câu hỏi liệu sự so sánh này là về khả năng hay hiệu năng/giá thành, lưu ý rằng DeepSeek-V4-Flash với khoảng 284B tham số trông ấn tượng hơn nếu nó gần bằng Qwen3.8-Max/Kimi K3 mặc dù nhỏ hơn khoảng 10 lần. Một luồng thảo luận khác quan tâm hơn đến Qwen3.8-27B sắp ra mắt và các mô hình dày đặc (dense models) nhỏ hơn có thể chạy trên thiết lập GPU tiêu dùng hoặc dual-24GB, thay vì một mô hình 300B+ hoặc quy mô nghìn tỷ tham số khác.

Có ai thực sự đọc blog về Qwen 3.8-Max không? (Hoạt động: 515): Bài đăng làm nổi bật Qwen 3.8-Max từ blog của Qwen, tuyên bố đây là mô hình flagship 2.4T tham số cùng với phiên bản 27B open-weight, tập trung vào các khối lượng công việc kỹ thuật tác nhân (agentic engineering) thay vì chỉ cải tiến khả năng trò chuyện. Các khả năng được trích dẫn bao gồm hơn 10 ngày phát triển phần mềm tự chủ từ một kho lưu trữ trống, vòng lặp phản hồi hình ảnh gốc để thực thi/sửa lỗi lặp lại và tối ưu hóa thiết kế chip vòng lặp kín qua hơn 500 lượt sử dụng Iverilog, Yosys và OpenROAD, được cho là đã giảm một bộ tăng tốc crypto từ 8.298 xuống còn 678 cổng trong khi vẫn đạt được thời gian đóng (timing closure). Người bình luận có ý kiến trái chiều: một người phản bác rằng cách diễn đạt nghe như "những lời sáo rỗng đầy thuật ngữ" mặc dù họ vẫn hào hứng với Qwen3.8, trong khi những người khác chỉ bày tỏ sự nhiệt tình chung chung thay vì phê bình kỹ thuật.

Daniel Han từ Unsloth xác nhận Qwen3.8-27B sẽ chỉ chạy trên 17GB VRAM (Hoạt động: 2096): Hình ảnh là một bài đăng trên LinkedIn của Daniel Han / Unsloth AI làm nổi bật Qwen3.8-27B và Qwen3.8-Max, với các biểu đồ benchmark cho lập trình, tác nhân, suy luận, thị giác và tác vụ web; tuyên bố kỹ thuật chính được tiêu đề/nội dung Reddit nhắc lại là Qwen3.8-27B có thể chạy cục bộ trong khoảng 17GB RAM/VRAM (hình ảnh). Người bình luận suy đoán điều này có khả năng ám chỉ một bản phát hành QAT (quantization-aware-trained - huấn luyện có nhận thức về lượng tử hóa), "tương tự như DeepSeek V4 Flash", thay vì triển khai 27B độ chính xác đầy đủ. Cuộc tranh luận chính là sự phấn khích về một mô hình Qwen open-weight nhỏ mạnh mẽ tiềm năng so với sự thất vọng khi 17GB loại trừ các GPU 16GB VRAM phổ biến; một người bình luận gọi đây là "tin tức thú vị nhất trong nhiều tháng", trong khi một người khác đùa từ góc độ của người dùng 16GB.

Sẽ có thêm các kích thước Qwen 3.8 (Hoạt động: 372): Hình ảnh là ảnh chụp màn hình phản hồi trên X từ Shuai Bai của Qwen, cho biết họ "vẫn đang hoàn thiện dòng sản phẩm cho nhiều kích thước và kiến trúc hơn" sau khi một người dùng hỏi về khả năng có biến thể Qwen 3.8 35 A3B sau khi phát hành bản 27B. Về mặt kỹ thuật, đây không phải là một benchmark hay ghi chú phát hành, nhưng nó báo hiệu rằng dòng Qwen 3.8 có thể mở rộng ngoài mô hình 27B hiện tại với các quy mô tham số bổ sung và/hoặc các biến thể kiến trúc. Các bình luận chủ yếu là sự cường điệu/suy đoán, với nhiều người dùng hy vọng vào một bản phát hành Qwen 122B lớn hơn và một người gợi ý rằng Qwen "lẽ ra nên dẫn đầu với điều này".

2. Benchmark và hỗ trợ Runtime của DeepSeek V4 Flash

DeepSeek V4 Flash vừa vạch ra một "lằn ranh tử thần" khá tàn khốc trên biểu đồ này (Hoạt động: 944): Hình ảnh là biểu đồ phân tán từ Artificial Analysis Intelligence Index v4.1 cho thấy chất lượng mô hình so với chi phí ước tính trên mỗi tác vụ có trọng số trên thang log; DeepSeek V4 Flash 0731 được làm nổi bật ở mức khoảng 0,03 USD/tác vụ và điểm chỉ số ~50, dường như tạo thành một biên Pareto chi phí thấp mới so với nhiều mô hình giá cao hơn. Bài đăng lập luận rằng bản cập nhật này rất quan trọng vì điểm DeepSeek V4 Flash trước đó nằm ở mức ~40 với chi phí gần như tương đương, đồng thời lưu ý rằng benchmark này là tiếng Anh, chỉ văn bản, tổng hợp và không nhất thiết dự đoán chính xác chi phí lập trình, ngữ cảnh dài hoặc khối lượng công việc sản xuất. Người bình luận phản bác cách diễn đạt "lằn ranh tử thần", lưu ý rằng các biểu đồ biên Pareto không thực sự làm cho tất cả các mô hình bị thống trị trở nên lỗi thời vì các triển khai thực tế có những hạn chế ngoài giá cả/điểm chỉ số. Một bình luận cũng chỉ ra rằng biểu đồ sẽ chỉ "giết chết" một tập hợp nhỏ các mô hình theo cách giải thích nghiêm ngặt đó.

DeepSeek-V4-Flash-0731: vượt qua Fable-5, Sol & Kimi-K3 trên Benchmark Cờ vua (Hoạt động: 663): Hình ảnh là bảng xếp hạng benchmark kỹ thuật cho AI chơi cờ vua: deepseek-v4-flash-0731 được đánh dấu "MỚI" và xếp hạng #1 với 80% thắng, 8% hòa, 12% thua, Elo 1538, độ chính xác 83,2% và tỷ lệ thắng 84%, vượt qua gpt-5 một chút và đứng trên o3, gpt-5.6-sol, kimi-k3 và claude-fable-5. Nguồn được trích dẫn là AI Chess Leaderboard và hình ảnh được đăng có sẵn tại đây. Người bình luận đặt câu hỏi về độ tin cậy của benchmark, lưu ý các thứ hạng kỳ lạ như gpt-3.5-turbo-instruct xuất hiện trước gpt-5.6-terra và gợi ý rằng việc xử lý các mô hình cũ có thể đáng ngờ. Những người khác cho rằng thứ tự thế hệ hiện tại nhìn chung giống với kết quả Kaggle Game Arena của Google, đồng thời lưu ý sức mạnh đáng ngạc nhiên của Gemini và sự thoái lui khả năng rõ ràng theo thời gian.

llama.cpp vừa thêm hỗ trợ MTP / DSpark cho DeepSeek V4 Flash (Hoạt động: 757): llama.cpp đã hợp nhất PR #25784 thêm hỗ trợ DeepSeekV4 cho giải mã suy đoán MTP (speculative decoding) và đầu DSpark, tác động đến 14 tệp với khoảng 1,5k dòng thêm vào. Các benchmark DGX Spark được báo cáo cho thấy mức tăng thông lượng khoảng ~50% với --spec-draft-n-max 2 sử dụng MTP, từ mức cơ sở ~16,4–16,5 tok/s lên ~25–28 tok/s, với tỷ lệ chấp nhận dự thảo khoảng 0,61–0,76; tuy nhiên, người bình luận lưu ý rằng các GGUF hiện tại có thể chưa bao gồm trình dự thảo (drafter) và các checkpoint DeepSeek 20260731/0731 được cho là chỉ xuất xưởng DSpark, không phải MTP—ví dụ: sử dụng am17an/DeepseekV4-Flash-20260731-DSpark. Người bình luận nhìn chung đánh giá cao người đóng góp am17an, trong khi lưu ý kỹ thuật chính là tránh các giả định MTP cho các bản phát hành DeepSeek mới nhất và sử dụng các chuyển đổi dành riêng cho DSpark cho đến khi các GGUF trình dự thảo tương thích tồn tại.

DeepSeek-V4-Flash 284B trên 5,3GB bộ nhớ (Hoạt động: 425): Một công cụ suy luận cục bộ dựa trên MLX mới, Mference, mở rộng ý tưởng truyền phát trọng số MoE của TurboFieldfare: giữ lõi chia sẻ + bộ nhớ đệm KV thường trú, sau đó chỉ truyền phát các chuyên gia (experts) được chọn từ SSD. Kết quả Apple M5 Pro được báo cáo bao gồm Gemma 4 26B-A4B ở mức ~2 GB RAM và 31–35 tok/s, Qwen 3.6 35B-A3B ở mức ~1,45 GB và 19–23 tok/s, và DeepSeek-V4-Flash 284B-A13B ở mức ~5,3–6,8 GB RAM, ~91 GB đĩa với lượng tử hóa động 2-bit và lên đến 4,8 tok/s; quá trình giải mã hiện bị giới hạn I/O khoảng 53% do đọc chuyên gia tuần tự. Dự án cũng bao gồm một ứng dụng trò chuyện Mac gốc, máy chủ tương thích OpenAI, tệp đính kèm tài liệu cục bộ và kế hoạch cho nhiều dòng mô hình hơn, I/O/tính toán chồng lấp và ngữ cảnh vượt quá 4K. Người bình luận coi các mô hình MoE lớn cộng với truyền phát trọng số SSD là một con đường đầy hứa hẹn cho suy luận cục bộ, nhưng yêu cầu các cải tiến tốc độ theo kiểu MTP/suy đoán và hỗ trợ Windows/Linux rộng rãi hơn, có khả năng thông qua GGUF thay vì MLX, đặc biệt là đối với các hệ thống VRAM thấp với GPU 8–12 GB và 16 GB RAM.

3. Các phòng thí nghiệm Open-Weight của Trung Quốc và Chiến lược

Các phòng thí nghiệm Trung Quốc mà mọi người thường gộp chung đang thực hiện bốn vụ đặt cược khá khác nhau. Tôi làm việc tại một trong số đó. (Hoạt động: 771): Hình ảnh là một đồ họa thông tin theo ngữ cảnh, "Các phòng thí nghiệm AI mã nguồn mở của Trung Quốc: Không phải là một khối", minh họa tuyên bố cốt lõi của bài đăng rằng các phòng thí nghiệm AI Trung Quốc như Ant Ling, Alibaba Qwen, DeepSeek, Moonshot/Kimi, Zhipu/GLM, MiniMax và StepFun đang theo đuổi các chiến lược riêng biệt thay vì hành động như một danh mục duy nhất. Tác giả, người cho biết họ làm việc tại Ant Ling, đối chiếu chiến lược hệ sinh thái ưu tiên phân phối của Qwen, chiến lược kiến trúc/bài báo+trọng số của DeepSeek và sự tập trung vào chi phí phục vụ của Ant, trích dẫn Ling-3.0-flash là 124B tổng tham số, ~5,1B hoạt động mỗi token, chú ý lai KDA + MLA và ngữ cảnh 262k cho các vòng lặp tác nhân dài giá rẻ thay vì tối đa hóa bảng xếp hạng. Người bình luận tranh luận liệu danh tính phòng thí nghiệm có quan trọng trong thực tế hay không: một số người lập luận rằng trọng số mở từ Qwen/DeepSeek/GLM đã thúc đẩy đáng kể suy luận cục bộ, trong khi những người khác nói rằng họ chủ yếu quan tâm đến sự cởi mở, chi phí và hành vi kiểm duyệt thay vì chiến lược công ty. Một thách thức kỹ thuật được đặt ra là liệu Ant có thể tạo sự khác biệt về phục vụ tầm nhìn xa giá rẻ khi DeepSeek cũng đang thúc đẩy các mô hình "flash" chi phí thấp, điểm benchmark cao hay không.

MiniMax-H3 hiện đã có trên Hugging Face (Hoạt động: 759): MiniMax-H3 đã được phát hành trên Hugging Face như một hệ thống tạo đa phương thức toàn diện cho mục đích chung để hiểu và tạo văn bản/hình ảnh/video/âm thanh thống nhất, bao gồm tạo video với âm thanh nổi gốc ở độ phân giải lên đến 2K và thời lượng 15 giây. Bài đăng tuyên bố thiết kế hướng tới tổng quát hóa tác vụ, giai đoạn tiền huấn luyện của H3 cho phép tuân thủ hướng dẫn đa phương thức phức tạp trên các ngữ cảnh hỗn hợp; một người bình luận báo cáo chạy nó trên RTX 5090 và nói rằng nó xử lý hình ảnh/video tham chiếu cộng với các sự kiện âm thanh không phải lời nói, âm thanh không gian và hành động với sự tuân thủ lời nhắc mạnh mẽ bất thường. Phản hồi ban đầu của người dùng cực kỳ tích cực nhưng mang tính giai thoại, gọi nó là "hoàn toàn không bị kiểm duyệt" và có khả năng là tiêu chuẩn cơ sở lâu dài tiếp theo sau Wan 2.2. Một người bình luận khác gắn cờ rằng giấy phép của mô hình là bất thường/có vấn đề, nhưng không có điều khoản giấy phép cụ thể nào được thảo luận trong các bình luận được cung cấp.

GLM 5.3 đã xuất hiện (Hoạt động: 556): Hình ảnh là ảnh chụp màn hình GitHub kỹ thuật, không phải meme: nó hiển thị nhánh glm-5.3 của zai-org/z-ai-sdk-java với các cam kết lặp đi lặp lại bởi tomsun28 như "feat: cập nhật các mô hình mới glm-5.3, hỗ trợ json schema", gợi ý về hỗ trợ SDK/API sắp tới cho GLM 5.3 và xử lý đầu ra có cấu trúc JSON Schema. Lịch sử cam kết được liên kết trong bài đăng trỏ đến nhánh liên quan: github.com/zai-org/z-ai-sdk-java/commits/glm-5.3; ảnh chụp màn hình ở đây: hình ảnh. Người bình luận giải thích đây là dấu hiệu cho thấy một mô hình mở hiệu suất cao mới của Trung Quốc có thể sắp ra mắt, với một số người lưu ý rằng tốc độ phát hành mô hình hiện tại nhanh đến mức việc tải xuống/đánh giá một mô hình có thể cảm thấy lỗi thời gần như ngay lập tức.

Tóm tắt các Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

AlibabaQwenAI nguồn mởLLMCông nghệ Trung Quốc
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.