smol.ai AI News
85

Mô hình

Điểm tin AI: Qwen3.8-Max ra mắt, NVIDIA nâng cấp xe tự lái và làn sóng mô hình tối ưu hóa phần cứng

(giờ Việt Nam)

Tóm tắt AI

Thị trường AI sôi động với sự xuất hiện của Qwen3.8-Max, các mô hình chuyên biệt từ Mistral, Pokee và DeepGrove, cùng những đột phá về tối ưu chi phí vận hành và hạ tầng huấn luyện MoE.

Bản dịch AI

not much happened today | AINews

một ngày yên ắng.

Tin tức AI từ 3/8/2026 đến 4/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận hoặc hủy nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

Các mô hình Frontier mới ra mắt: Qwen 3.8-Max, Alpamayo 2 Super, Pokee-Isaac, Maple-Preview và Shieldstral

Kinh tế học về suy luận (Inference), định tuyến (Routing) và cơ sở hạ tầng Kernel/Serving

Các bộ khung Agent (Agent Harnesses), vòng lặp tự cải thiện và công cụ cho Agent trong môi trường thực tế (Production)

An ninh mạng, lỗ hổng Eval (Eval Escapes) và rủi ro chuỗi cung ứng

Hệ thống đa phương thức và video: FLUX 3, MiniMax H3 và các giao diện người dùng mới

Khả năng diễn giải (Interpretability), quy trình nghiên cứu và các nền tảng nghiên cứu mới

Các tweet hàng đầu (theo mức độ tương tác)

Tóm tắt AI trên Reddit

Tóm tắt từ /r/LocalLlama + /r/localLLM

1. Các bản demo video từ MiniMax H3 (Open-Weights)

Will Smith ăn mì Ý - Minimax H3 (Hoạt động: 2931): Một bài đăng trên Reddit có tiêu đề “Will Smith ăn mì Ý - Minimax H3” dường như trình diễn một video được tạo từ Minimax H3, sử dụng bài kiểm tra áp lực định tính quen thuộc “Will Smith ăn mì Ý” dành cho các mô hình chuyển văn bản thành video. Video được liên kết trên Reddit (v.redd.it/6elfdqs9k3hh1) không thể truy cập do lỗi 403 Forbidden, vì vậy không thể xác minh được mức độ khung hình hoặc tính nhất quán về chuyển động/thời gian. Những người bình luận coi clip này như một tiêu chuẩn đánh giá không chính thức mới và một người khẳng định rằng, nếu được tạo từ một câu lệnh cơ bản trên mô hình gốc, Minimax H3 “vượt xa LTX 2.3”.

Chúng tôi đang vào việc đây (trọng số full precision của H3) (Hoạt động: 2332): Bài đăng làm nổi bật một video trên Reddit được cho là hiển thị kết quả từ trọng số full-precision của H3, thu hút sự chú ý vào các chi tiết tạo đa phương thức tinh vi: âm thanh biểu cảm và một chiếc bàn rung/ổn định khác nhau tùy thuộc vào trọng lượng rõ ràng/vật thể đặt trên đó trong khi đối thoại. Phương tiện được liên kết không thể được kiểm tra độc lập tại đây do lỗi 403 Forbidden của Reddit, vì vậy các tuyên bố kỹ thuật chỉ giới hạn ở quan sát của người đăng và người bình luận. Những người bình luận nhìn chung rất ấn tượng với độ chân thực cảm nhận được—đặc biệt là khả năng biểu cảm của âm thanh và tính nhất quán của vật thể/vật lý—nhưng một người lưu ý rằng khả năng chất lượng này có khả năng “thu hút nhiều vấn đề”, ngụ ý lo ngại về việc lạm dụng hoặc rủi ro xã hội sau này.

Tất cả các redditor khi lần đầu dùng thử MiniMax H3 (Hoạt động: 1185): Bài đăng trên Reddit trình diễn một video MiniMax H3 được tạo cục bộ, được cho là sản xuất trên GPU laptop RTX 4090 với 16 GB VRAM và 64 GB RAM hệ thống ở độ phân giải khoảng 0.4 MP. Video được liên kết trên Reddit (v.redd.it/3p57uvspf3hh1) không thể truy cập do bị chặn bởi HTTP 403, vì vậy chất lượng đầu ra thực tế, cài đặt, thời gian chạy và quy trình làm việc không thể được xác minh độc lập. Các bình luận hàng đầu chủ yếu là phản ứng, nhưng một người dùng ngụ ý rằng chất lượng đầu ra của MiniMax H3 khiến LTX2 trở nên lỗi thời đối với họ, trong khi một người khác hỏi liệu có sử dụng tham chiếu âm thanh hay không, cho thấy sự quan tâm đến việc tạo dựa trên âm thanh hoặc quy trình đồng bộ môi/âm thanh.

2. Các nguyên mẫu thế giới trò chơi (Game-World) được tạo bởi Agent

Nỗ lực đầu tiên với GTA 6. Còn lâu mới hoàn hảo, nhưng thật ấn tượng với những gì bộ khung (harness) và các vòng lặp agent phù hợp có thể xây dựng. (Hoạt động: 1790): Một Redditor báo cáo việc sử dụng Gauntlet Loop của Matt Shumer cùng với các quy trình làm việc agent bổ sung để tạo lặp đi lặp lại một nguyên mẫu 3D giống GTA chạy trên trình duyệt, sau khi lần chạy đầu tiên bị đình trệ ở một thế giới 3D cơ bản. Họ nhấn mạnh rằng khả năng suy luận video dựa trên trích xuất khung hình của Claude Code kém hiệu quả hơn so với việc xuất dữ liệu đo từ xa (telemetry) trạng thái trò chơi dưới dạng JSON có cấu trúc, và báo cáo nguyên mẫu hiện tại mất 22 giờ và 86 agent; họ đang cân nhắc cải tiến bộ khung và chuyển từ Three.js sang Babylon.js. Những người bình luận tỏ ra hoài nghi về khoảng cách giữa một nguyên mẫu ấn tượng và một trò chơi có thể phát hành—được tóm tắt là “80% đầu tiên là phần dễ. 99% công việc nằm ở 20% còn lại.” Những người khác đặt câu hỏi về chi phí và giá trị môi trường của việc sử dụng các hệ thống AI trả phí để tái tạo các trò chơi hiện có.

Claude đã xây dựng một khu rừng có thể đi bộ mà không cần tài nguyên nào, chỉ bằng mã (Hoạt động: 1173): Một dự án GitHub, StarKnightt/jungle-trail, được giới thiệu là một cảnh khu rừng có thể đi bộ được tạo hoàn toàn bằng mã mà không có tài nguyên bên ngoài, được cho là của prasenx. README được cho là tuyên bố có 12.000 dòng “mã viết tay”, nhưng video trên Reddit không thể xác minh được vì phương tiện v.redd.it trả về lỗi 403 Forbidden. Các bình luận hàng đầu chủ yếu là hoài nghi hoặc hài hước: một người bình luận chế giễu tuyên bố “mã viết tay” trong bối cảnh tạo bằng AI, trong khi những người khác coi đó là một sự thay đổi khả năng trong kỷ nguyên hậu ChatGPT hoặc nói đùa, “Nhưng nó có xây được Crysis không?”

3. Chất lượng mô hình Claude trong các tác vụ lập trình dài

Opus 5 là một mô hình thực tế không thể sử dụng được (Hoạt động: 1135): Một người dùng Reddit báo cáo rằng Claude Opus 5 bị thoái hóa so với các bản phát hành Opus trước đó, tuyên bố rằng nó thường xuyên quên hướng dẫn/ngữ cảnh và gây ra lỗi trong quá trình thực hiện tác vụ dài hơn, ngay cả khi chỉ ở mức 100–150K token ngữ cảnh; họ đối chiếu điều này với Opus 4.8, vốn được cho là vẫn sử dụng tốt cho đến khoảng 350K token. Bài đăng lập luận rằng các tiêu chuẩn đánh giá (benchmarks) đã không nắm bắt được những lỗi quy trình này và cho biết Fable 5 hiện là mô hình duy nhất có thể sử dụng được trong Claude Code, nhưng các hạn chế về hạn ngạch/chi phí khiến nó không thực tế. Những người bình luận hàng đầu phần lớn đồng ý, mô tả Opus 5 là “sai một cách tự tin”, dễ mắc lỗi sửa vấn đề này nhưng lại gây ra vấn đề khác, khiến người dùng rơi vào tình thế đánh đổi khi Opus 5 không đáng tin cậy còn Fable 5 thì đắt đỏ/giới hạn hạn ngạch.

7 ngày không có bản cập nhật Claude Code, họ đang viết lại nó bằng Rust hay gì đó à? (Hoạt động: 1005): Một người dùng lưu ý rằng Claude Code vẫn ở phiên bản v2.1.220 trong 7 ngày mặc dù mong đợi các bản cập nhật kênh ổn định thường xuyên, được minh họa bằng ảnh chụp màn hình phiên bản; bài đăng mang tính mỉa mai rõ ràng (“rất đáng lo ngại /s”). Một bình luận mang tính kỹ thuật cho biết Boris Cherny gần đây đã nói rằng Claude đã tự động viết lại ứng dụng Claude Code trên macOS từ Electron sang Swift, nhưng không có liên kết nguồn nào được cung cấp trong luồng. Những người bình luận chủ yếu coi mối lo ngại này là vô lý: một người nói đùa rằng Anthropic “đã hết hạn sử dụng”, trong khi một người khác lưu ý rằng việc người dùng coi khoảng cách chỉ một tuần giữa các bản cập nhật phần mềm là đáng lo ngại là điều bất thường.

Tóm tắt các Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

1. Ra mắt Qwen 3.8 Max/27B Open-Weights

Qwen3.8-Max ngang hàng với Kimi K3 và DeepSeek V4 Flash (Hoạt động: 750): Hình ảnh là trang mô hình BenchmarkList cho Qwen3.8-Max, một mô hình Qwen open-weight 2.4 nghìn tỷ tham số đã được công bố, cho thấy ECI thực nghiệm là 143.33, xếp hạng SOTA toàn cầu #12/374 và #2 trong số các mô hình open-weight. Nó hỗ trợ trực quan cho tuyên bố của bài đăng rằng các tiêu chuẩn đánh giá của Qwen3.8-Max gần với các biến thể Kimi K3 và DeepSeek V4 Flash/Pro, với các bảng danh mục cho thấy hiệu suất tác vụ lập trình/phần mềm đặc biệt mạnh mẽ; các trọng số được cho là sẽ phát hành vào tuần tới, với giá API được liệt kê là $2/M đầu vào, $6/M đầu ra và $0.25/M cho bộ nhớ đệm ẩn (implicit caching). Những người bình luận hình ảnh tranh luận liệu sự so sánh này có làm đẹp lòng Qwen3.8-Max hay thay vào đó làm nổi bật hiệu quả của DeepSeek-V4-Flash, vì nó được cho là chỉ có 284 tỷ tham số so với 2.4T–2.8T của Qwen/Kimi. Những người khác quan tâm hơn đến Qwen3.8-27B sắp tới, lập luận rằng các mô hình đơn GPU hoặc dual-24GB-GPU thực tế có tác động lớn hơn là một bản phát hành open-weight quy mô frontier khổng lồ khác.

Có ai thực sự đọc blog Qwen 3.8-Max không? (Hoạt động: 567): Bài đăng làm nổi bật Qwen 3.8-Max, được mô tả trong blog Qwen được liên kết là một mô hình 2.4T tham số cùng với mô hình open-weights 27B, nhấn mạnh vào các quy trình làm việc agent thay vì các tiêu chuẩn đánh giá chatbot. Các khả năng được tuyên bố bao gồm hơn 10 ngày phát triển phần mềm tự động từ một kho lưu trữ trống, vòng lặp phản hồi trực quan gốc để thực thi/sửa lỗi và quy trình tối ưu hóa thiết kế chip vòng lặp kín sử dụng Iverilog, Yosys và OpenROAD qua hơn 500 lượt, được cho là đã giảm bộ tăng tốc tiền điện tử từ 8.298 xuống 678 cổng trong khi vẫn đạt được đóng thời gian (timing closure). Các bình luận hàng đầu chủ yếu không mang tính kỹ thuật: một người bình luận chỉ trích cách đặt vấn đề của bài đăng là “những lời lẽ dựa trên thuật ngữ chuyên môn”, trong khi những người khác bày tỏ sự hào hứng/ủng hộ hoặc nói đùa về tải GPU.

Daniel Han của Unsloth xác nhận Qwen3.8-27B sẽ chỉ chạy trên 17GB VRAM (Hoạt động: 2277): Hình ảnh cho thấy Daniel Han / Unsloth AI nói rằng Qwen3.8-27B sẽ chạy cục bộ trong khoảng 17GB RAM/VRAM và Unsloth có kế hoạch hỗ trợ nó, cùng với các tham chiếu đến các tiêu chuẩn đánh giá Qwen3.8-Max. Ý nghĩa kỹ thuật chính là mô hình 27B có thể được phát hành ở dạng hiệu quả bộ nhớ cao—những người bình luận suy đoán nó có thể là một mô hình QAT / quantization-aware trained tương tự như DeepSeek V4 Flash—nhưng bài đăng lưu ý rằng các tiêu chuẩn đánh giá Qwen3.8-27B vẫn chưa có sẵn. Những người bình luận chia rẽ giữa sự phấn khích rằng một mô hình Qwen open-weight nhỏ cuối cùng có thể xuất hiện và sự thất vọng/thú vị rằng 17GB loại trừ sát nút các GPU 16GB VRAM phổ biến. Một người bình luận coi đó là “tin tức thú vị nhất trong nhiều tháng”, trong khi một người khác giảm phản ứng xuống điểm đau thực tế: “Tôi với 16gb VRAM.”

Qwen3.8-27B được công bố cùng với Qwen3.8-Max (Hoạt động: 4005): Alibaba Qwen đã công bố Qwen3.8-27B cùng với Qwen3.8-Max qua X/Twitter. Những người bình luận nhấn mạnh bản phát hành 27B là có khả năng tác động lớn dựa trên kinh nghiệm trước đây với Qwen 3.6 27B Q8 như một mô hình thực thi, bao gồm một thiết lập được báo cáo kết hợp DeepSeek v4 Flash Q2KXL để lập kế hoạch với Qwen để thực thi mà “cảm giác không tệ hơn các mô hình frontier”. Có sự nhiệt tình mạnh mẽ đối với mô hình 27B, với một số người dùng vẫn đang chờ đợi một biến thể 35B A3B được đồn đại/mong đợi. Một người bình luận lập luận rằng Qwen 3.8 có thể là một “kẻ thay đổi cuộc chơi” dựa trên những cải tiến chất lượng cảm nhận được từ Qwen 3.6.

2. Các tiêu chuẩn đánh giá suy luận cục bộ Frontier MoE

DeepSeek V4-Flash (284B MoE) ở mức 33 tok/s đơn / 68 tok/s tổng hợp trên 2× RTX 3090 + một máy chủ quad-Xeon DDR4 cũ — cấu hình đầy đủ (Hoạt động: 530): OP báo cáo chạy checkpoint DeepSeek V4-Flash-0731 đầy đủ (284B MoE / ~13B hoạt động, 156 GB, safetensors chính thức với các chuyên gia MXFP4 gốc) trên một chiếc Dell R940 cũ với 4× Xeon Platinum 8268, 768 GB DDR4-2933 và 2× RTX 3090, sử dụng fork Lvllmds4-x bắt nguồn từ vLLM với thực thi chuyên gia lai CPU-GPU lk_moe, nhân Marlin chỉ dành cho trọng số cho Ampere, các tuyến tính FP8, fp8_ds_mla KV và giải mã suy đoán DSpark. Giải mã đạt 33 tok/s luồng đơn và 53–68 tok/s tổng hợp ở 4 người dùng đồng thời, so với 12.2 tok/s trên ik_llama.cpp; tuy nhiên prefill lạnh có mức sàn cố định ~9 giây, ổn định quanh 420–480 tok/s, tuần tự hóa dưới các câu lệnh đồng thời và đưa ra TTFT như 18.3 giây cho ~8K và 61.5 giây cho ~30K câu lệnh lạnh, trong khi các đường dẫn bộ nhớ đệm tiền tố ấm có thể giảm TTFT 30K xuống 2.9–9.0 giây. Dữ liệu tài nguyên chỉ ra rằng nút thắt cổ chai là băng thông DRAM CPU, không phải tính toán GPU: các GPU ngồi ở mức sử dụng khoảng 25%, việc giới hạn công suất 3090 từ 350 W xuống 250 W không có tác dụng, khung máy tiêu thụ ~1 kW khi giải mã và OP lập luận rằng thiết lập này tốt nhất cho tổng hợp ngữ cảnh dài theo hàng đợi/lô hơn là lập trình ngữ cảnh mới tương tác. Những người bình luận hàng đầu tập trung vào điểm yếu thông thường của các hệ thống MoE lai CPU-GPU: các con số giải mã thường được quảng cáo trong khi xử lý câu lệnh/TTFT bị bỏ qua, và trong trường hợp này, dữ liệu prefill bổ sung xác nhận việc sử dụng tương tác lạnh là kém. Một người bình luận khác tóm tắt kiến trúc này thực sự là suy luận song song đường ống nơi các GPU chờ đợi luồng chuyên gia phía CPU, trong khi một người đặt câu hỏi về tính hữu ích của chỉ 22K ngữ cảnh ngoài các khối lượng công việc chứng minh khái niệm.

“Trung tâm dữ liệu trong hộp (trên bánh xe)” Đánh giá vận hành 6-8 tháng cho máy chủ AI 256Gb VRAM/512Gb RAM, Viết về độ ổn định, Tiêu chuẩn đánh giá (Hoạt động: 452): OP báo cáo một máy trạm AI một nút có bánh xe trị giá ~$17k được xây dựng xung quanh Threadripper Pro 3995WX / ASUS WRX80E-SAGE, 512GB ECC RAM và 256GB VRAM tổng hợp từ 8× RTX 3090 24GB + 2× RTX 5090 32GB, chạy Open WebUI + llama.cpp/koboldcpp + ComfyUI trên Ubuntu; hệ thống dành cho suy luận MoE lớn cộng với tạo hình ảnh đồng thời, không phải đào tạo hoặc phục vụ độ đồng thời cao. Các phát hiện ổn định chính: cấu hình thủ công các cài đặt phân nhánh PCIe/Gen/lane, bật Above 4G, ReBAR và SR-IOV, và giảm thiểu đặt lại tạm thời đa GPU bằng cách khóa xung nhịp qua nvidia-smi—ví dụ: 3090 ở 1200 MHz, 5090 ở 2000 MHz, với giới hạn công suất tùy chọn 200W/400W—vì tải LLM duy trì chỉ tiêu thụ khoảng 1400–1600W do các nút thắt cổ chai PCIe/sharding. Các tiêu chuẩn đánh giá trên tất cả 10 GPU trên các câu lệnh an ninh mạng lớn cho thấy suy luận mô hình lớn có thể sử dụng cho các lượng tử GGUF ~160–217GB: Qwen 3.5 397B IQ4XS đạt khoảng 30–34 tok/s tạo, GLM 4.7 358B Q4KXL khoảng 13–24 tok/s, Nemotron Ultra 3 550B IQ2XXS khoảng 16–17 tok/s, trong khi Deepseek V4 Flash 294B Q8KXL chậm hơn nhiều ở ~4–7 tok/s nhưng chủ quan mạnh về chất lượng đầu ra. Sự phản đối kỹ thuật chính trong các bình luận là liên quan đến luồng không khí: một người bình luận lập luận rằng vỏ máy dường như chủ yếu có quạt hút và không đủ khí thải định hướng, có khả năng gây ra tuần hoàn không khí nóng, khuyến nghị hút trước với các đường dẫn khí thải bên/trên/sau, đặc biệt là xung quanh các GPU gắn dọc; ảnh xây dựng/luồng bình luận được liên kết của OP ở đây. Các bình luận khác chủ yếu là phản ứng không mang tính kỹ thuật đối với mật độ của GPU.

Mô hình đầy đủ Kimi K3 chạy trên cụm 16x GB10 ở tốc độ 20+tps (Hoạt động: 920): Hình ảnh (jpeg) cho thấy một cụm 16 nút NVIDIA GB10 / ASUS mini-PC được cho là đang chạy mô hình Kimi K3 đầy đủ qua dspark, với bảng điều khiển hiển thị trung bình khoảng 20+ token/s giải mã, 38 tps đỉnh và khoảng 750 tps prefill trên một tập dữ liệu nhất quán llama-benchy. Người đăng nói đây là lần chạy mô hình đầy đủ thành công đầu tiên trên cụm của họ và có kế hoạch xuất bản hình ảnh vLLM và hướng dẫn thiết lập sau khi tinh chỉnh thêm; thêm ngữ cảnh được liên kết trong luồng Diễn đàn Nhà phát triển NVIDIA. Những người bình luận tập trung ít hơn vào bản thân tiêu chuẩn đánh giá và nhiều hơn vào kinh tế thực tế và thiết kế phần cứng: một người hỏi về chi phí thiết bị so với điểm hòa vốn, trong khi một người khác chỉ trích thiết kế GB10 của NVIDIA là không ấn tượng. Cũng có một quan sát hài hước rằng một chiếc Raspberry Pi nhỏ dường như đang cung cấp năng lượng cho bảng điều khiển cho một cụm đắt tiền hơn nhiều.

V4-Flash-0731 - cảm nhận sau cuối tuần đầu tiên sử dụng (Hoạt động: 395): Người dùng Reddit báo cáo DeepSeek V4-Flash-0731 rất nhạy cảm với lượng tử hóa bit thấp: các biến thể Q2/Q3 được cho là cho thấy sự sụt giảm khả năng lớn so với mô hình được phục vụ chính thức/độ chính xác đầy đủ, với một người bình luận trích dẫn kết quả KL-divergence của Unsloth cho thấy sự phân kỳ kém ngay cả đối với các lượng tử IQ4_XS/NL. OP thấy Q3 có khả năng vượt trội hơn Qwen3.6-27B Q8 cho các khối lượng công việc lập trình kho lưu trữ lớn/agent với các câu lệnh nặng về công cụ (~30k token hệ thống), trong khi Q2 hoạt động kém đến mức họ thích Qwen3.6-27B Q8 hơn; độ chính xác đầy đủ được mô tả là gần với chất lượng GLM 5.2 với chi phí thấp hơn nhiều nhưng vẫn không vượt qua các mô hình hàng đầu như Opus/Fable. Một người bình luận cũng đã chia sẻ một fork xử lý câu lệnh nhanh hơn cho các triển khai VRAM đầy đủ: vektorprime/working_ds4_speed, trong khi những người khác thảo luận về các lượng tử antirez imatrix Q2/Q2-Q4 và thiết lập unsloth IQ3_XXS với lệnh llama-server được liên kết. Cuộc tranh luận chính là liệu trải nghiệm lượng tử hóa cục bộ có mang tính đại diện hay không: OP và một người bình luận lập luận rằng Q2/Q3 bị suy giảm đáng kể dựa trên hành vi và KLD, trong khi một người khác nói rằng IQ3_XXS ổn định và chủ quan “gần…với Claude Opus” hơn các mô hình cục bộ trước đây cho kiến trúc phần mềm. Cũng có sự quan tâm đến việc liệu các lượng tử hỗn hợp imatrix trên Apple Silicon có thu hẹp khoảng cách đủ để tránh mua phần cứng có khả năng chạy mô hình đầy đủ hay không.

3. Các bản phát hành và lộ trình của phòng thí nghiệm mô hình mở Trung Quốc

Các phòng thí nghiệm Trung Quốc mà mọi người gộp chung lại đang đặt bốn cược khá khác nhau. Tôi làm việc tại một trong số đó. (Hoạt động: 943): Hình ảnh, “Các phòng thí nghiệm AI nguồn mở của Trung Quốc — Không phải một khối”, là một đồ họa giải thích ngữ cảnh thay vì biểu đồ tiêu chuẩn đánh giá: nó tách biệt trực quan Ant/Ling, Alibaba/Qwen, DeepSeek, Moonshot/Kimi, Zhipu/GLM, MiniMax và StepFun để hỗ trợ lập luận của bài đăng rằng các phòng thí nghiệm AI open-weight Trung Quốc đang theo đuổi các chiến lược riêng biệt. Tuyên bố kỹ thuật chính là Ling-3.0-flash của Ant được tối ưu hóa cho kinh tế phục vụ—tổng cộng 124B tham số, ~5.1B tham số hoạt động/token, chú ý lai KDA + MLA và 262k ngữ cảnh—trong khi Qwen được đóng khung là sự phổ biến phân phối/thời gian chạy, DeepSeek là các bản phát hành mở ưu tiên kiến trúc và Moonshot là các cược dài hạn hơn. Các bình luận tranh luận liệu những khác biệt phòng thí nghiệm này có quan trọng đối với người dùng hay không: một số thấy sự khác biệt chiến lược có ý nghĩa, trong khi những người khác chủ yếu quan tâm đến những gì là mở so với độc quyền, chi phí suy luận, hành vi kiểm duyệt và tính sẵn có của thời gian chạy. Một người bình luận cũng thách thức sự khác biệt của Ant, lưu ý rằng DeepSeek cũng đang thúc đẩy suy luận chi phí thấp trong khi vẫn duy trì tính cạnh tranh trên các tiêu chuẩn đánh giá.

MiniMax-H3 hiện đã có trên huggingface (Hoạt động: 806): MiniMax-H3 đã được phát hành trên Hugging Face như một hệ thống tạo đa phương thức toàn diện mục đích chung hỗ trợ hiểu thống nhất qua các đầu vào văn bản, hình ảnh, video và âm thanh, với việc tạo video bao gồm âm thanh nổi gốc lên đến độ phân giải 2K và thời lượng 15 giây. Một người bình luận báo cáo thử nghiệm cục bộ trên RTX 5090, tuyên bố khả năng tuân theo câu lệnh mạnh mẽ bất thường, hành vi cho phép/“không kiểm duyệt”, điều hòa hình ảnh/video tham chiếu và tạo chất lượng cao các tín hiệu âm thanh không lời nói như âm thanh vị trí/hành động. Những người bình luận rất nhiệt tình, với một người gọi nó là “wan2.2 mới” tiềm năng trong một thời gian dài, nhưng cũng có lo ngại rằng giấy phép của mô hình này hạn chế bất thường hoặc có vấn đề khác.

GLM 5.3 đã được phát hiện (Hoạt động: 621): Hình ảnh (ảnh chụp màn hình GitHub) cho thấy các commit trên nhánh zai-org/z-ai-sdk-java glm-5.3 thêm hỗ trợ cho glm-5.3 và đầu ra lược đồ JSON, cộng với sửa lỗi ZhipuAiClient liên quan. Đây không phải là một bản phát hành tiêu chuẩn đánh giá hoặc thẻ mô hình, nhưng nó là một tín hiệu cấp SDK hợp lý rằng GLM 5.3 có thể sắp có sẵn công khai/API. Các bình luận chủ yếu là cường điệu/suy đoán: người dùng coi đây là một phần của làn sóng nhanh chóng các mô hình mở Trung Quốc hiệu suất cao, trong khi lưu ý rằng nhịp độ phát hành đã trở nên quá nhanh đến mức việc tải xuống các mô hình mới có thể cảm thấy lỗi thời gần như ngay lập tức.

AIMô hình ngôn ngữCông nghệTối ưu hóaPhần cứng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.