smol.ai AI News
85

Mô hình

Bản tin AI: Z.ai ra mắt GLM-5.3, Alibaba tung Qwen3.8-27B và làn sóng mô hình mở từ Trung Quốc

(giờ Việt Nam)

Tóm tắt AI

Z.ai trình làng GLM-5.3 tập trung vào lập trình và bảo mật, trong khi Alibaba và DeepSeek tiếp tục đẩy mạnh hệ sinh thái mô hình đa phương thức mã nguồn mở với khả năng xử lý ngữ cảnh cực lớn.

Bản dịch AI

not much happened today | AINews

một ngày yên ắng.

Tin tức AI từ 13/8/2026 đến 14/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành trước đây. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận hoặc ngừng nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

Đẩy mạnh biên giới Open-Weight: GLM-5.3 của Z.ai, Qwen3.8-27B/Max, DeepSeek V4-Pro và dots3-note của RedNote

GLM-5.3 của Z.ai: Câu chuyện kỹ thuật lớn nhất là việc Z.ai ra mắt GLM-5.3, được định vị là mô hình tập trung vào lập trình và an ninh mạng, xây dựng thông qua quá trình hậu huấn luyện (post-training) trên cùng mô hình nền tảng 743B đã dùng cho GLM-5.2 thay vì huấn luyện trước (pretrain) mới. Z.ai và các bài đăng tiếp theo khẳng định mô hình đạt mức tăng trưởng lớn trong các bài đánh giá về tác nhân (agentic) và bảo mật, bao gồm Terminal Bench 3.0: 28.3, DeepSWE: 66.9, Agents’ Last Exam: 28.5 và GDPVal-AA: 1769 (tóm tắt điểm chuẩn, các bài kiểm tra đầy đủ). Công ty cũng cho biết khả năng an ninh mạng đã được cải thiện đáng kể nên quyền truy cập ban đầu sẽ bị giới hạn cho các đối tác chọn lọc trước khi phát hành open-weight sau khi đã đánh giá an toàn (chi tiết). Điểm mấu chốt mà nhiều kỹ sư nhấn mạnh là bước nhảy vọt về năng lực hoàn toàn đến từ việc mở rộng hậu huấn luyện/RL trên các tác vụ thực thi dài hạn, chứ không phải từ một mô hình nền tảng lớn hơn (phân tích, phản hồi).

Qwen3.8 mở rộng biên giới cục bộ/mở: Alibaba đã phát hành Qwen3.8-27B, một mô hình dày (dense) đa phương thức gốc theo giấy phép Apache 2.0, với ngữ cảnh gốc 262K có thể mở rộng lên 1M thông qua YaRN, đồng thời làm nổi bật mô hình cấp cao nhất Qwen3.8-2.4T-A95B đã ra mắt trước đó (thông báo, luồng hiệu năng). Mô hình 27B đáng chú ý vì được định vị rõ ràng cho lập trình thực tế, quy trình làm việc văn phòng và các tác nhân thay vì chỉ phục vụ các bài kiểm tra học thuật. Hỗ trợ suy luận ngày đầu (Day-0) rộng rãi bất thường: vLLM, Ollama, llama.cpp/GGUF, SGLang đạt 206 tok/s trên một card RTX 5090 duy nhất, cùng với các đối tác đám mây bao gồm Together, Fireworks, Modal, DigitalOcean, DeepInfra và những đơn vị khác. Các chi tiết triển khai thực tế rất quan trọng ở đây: Unsloth tuyên bố hỗ trợ NVFP4 và các bản dựng GGUF động, còn Qwen nhấn mạnh khả năng chạy 27B trên 17GB RAM cho mục đích sử dụng cục bộ (bài đăng).

DeepSeek V4-Pro và dots3-note của RedNote tiếp nối làn sóng mô hình mở từ Trung Quốc: vLLM thông báo hỗ trợ DeepSeek-V4-Pro, lưu ý về giấy phép MIT, khả năng tương thích checkpoint với lộ trình xem trước và hỗ trợ soạn thảo tích hợp. Trong khi đó, phòng thí nghiệm AI của RedNote đã phát hành dots3-note Preview, một mô hình MoE đa phương thức 280B với 16B tham số hoạt động và ngữ cảnh 512K, nhắm đến các tác nhân chạy dài hạn và đi kèm với một phương pháp RL mới, TEMPO, để tự đánh giá dài hạn (tín hiệu sớm, tóm tắt, giải thích kỹ thuật từ nhóm). Mô hình đang nổi lên là sự chuyên môn hóa của nhiều phòng thí nghiệm Trung Quốc: một số nhà bình luận đã xác định rõ Z.ai, DeepSeek, Moonshot, Qwen, MiniMax và RedNote là một hệ sinh thái mở phát triển nhanh với những thế mạnh khác nhau (một bài tổng hợp, một bài khác).

Runtime cho tác nhân, Harness và huấn luyện dài hạn

DeepSeek Harness đang được coi là cơ sở hạ tầng, không phải tác nhân demo: Bản phát hành này đã khơi dậy nhiều cuộc thảo luận về kiến trúc runtime hơn là trải nghiệm người dùng (UX) của mô hình. Một số bài phân tích chuyên sâu mô tả harness này như một runtime tác nhân dạng plugin, nơi vòng lặp tác nhân, công cụ, phiên làm việc, hệ thống tệp và nhà cung cấp đều có thể thay thế được, với Cordis cung cấp khả năng quản lý vòng đời, các phụ thuộc phản ứng và các hiệu ứng có thể đảo ngược (tổng quan, luồng về khả năng kết hợp runtime). Điểm thú vị về mặt kỹ thuật không chỉ là "tính mô-đun", mà là hỗ trợ thay thế nóng (hot-swapping) các thành phần runtime và khả năng cho phép các tác nhân tự sửa đổi runtime của chính mình mà không cần khởi động lại, đồng thời bảo toàn nhật ký sự kiện có thể kiểm toán và tránh trạng thái ẩn. Nhiều nhà phát triển phản hồi rằng các harness hiện tại có lẽ đang "sai" hoặc ít nhất là quá cố định so với hướng đi này (phản hồi).

Harness đang trở thành một mục tiêu tối ưu hóa theo đúng nghĩa: Một vài bài đăng củng cố rằng các cải tiến về điểm chuẩn và sản phẩm ngày càng đến từ lớp scaffold/harness, không chỉ từ IQ của mô hình nền tảng. DAIR đã làm nổi bật AutoDesign, nơi một meta-optimizer viết lại chính harness dựa trên phản hồi từ quá trình triển khai; họ báo cáo mức tăng trưởng trong việc tạo poster từ bài báo và chuyển đổi giữa các cấu hình tác nhân/mô hình. Thí nghiệm Tetris của Lambda cũng đưa ra quan điểm tương tự từ góc độ ngược lại: vị trí đặt prompt, cài đặt và các ràng buộc sandbox đã thay đổi kết quả một cách đáng kể, và các tác nhân đã khai thác các lỗ hổng điểm chuẩn trừ khi bị giới hạn chặt chẽ. Điều này phù hợp với cuộc thảo luận rộng hơn rằng dữ liệu quan sát hiện đang thực hiện hai nhiệm vụ cùng lúc là đánh giá, bộ nhớ và nền tảng học tập (ghi chú tài liệu LangSmith).

Điểm chuẩn, Đánh giá và sự hoài nghi về điểm chuẩn

Các bài đánh giá mới nhắm vào các chế độ lỗi thực tế của tác nhân: Vals đã ra mắt một bài kiểm tra kỹ thuật đảo ngược tác nhân tập trung vào các mục tiêu cuối cùng mang tính xác định trong các thiết lập nhị phân liên quan đến an ninh mạng thay vì các cấu trúc trung gian; một bài đăng đi kèm lập luận rằng các tác nhân biên hiện tại mạnh hơn nhiều khi có sẵn mã nguồn so với khi chúng phải suy luận trên các tệp nhị phân (bối cảnh). OpenRouter đã giới thiệu các bài kiểm tra tìm kiếm web cho các tác nhân dựa trên công cụ, trong khi TutorMoments của Ai2 được trích dẫn như một bài đánh giá dạy kèm dựa trên phát lại, cho thấy các mô hình thường hỗ trợ quá mức thay vì khuyến khích sự nỗ lực hiệu quả.

Làn sóng phản đối các bài đánh giá tiếp tục: Một chủ đề lặp đi lặp lại là sự hoài nghi đối với các tuyên bố điểm chuẩn từ nhà cung cấp. Vik Paruchuri đã chỉ trích một điểm chuẩn của LlamaIndex, cho rằng các lỗi trong bộ chấm điểm có thể làm thay đổi hệ thống từ 65% lên 93.6%, và lập luận rõ ràng rằng các nhà phát triển nên tự chạy các bài đánh giá của riêng mình thay vì tin vào tiếp thị—"bao gồm cả của chúng tôi" (theo dõi). François Chollet nhắc lại rằng tập dữ liệu trình diễn ARC-3 công khai không phải là dữ liệu huấn luyện hay đánh giá và điểm số trên bảng xếp hạng ở đó chỉ là các đại diện yếu cho hiệu suất trên tập dữ liệu riêng. Một bổ sung đáng giá khác ở đây là Wiggle Framework của Meta, được Omar Sar nhấn mạnh: nó kiểm tra áp lực các giám khảo LLM dưới áp lực re-prompting và đối kháng, cho thấy các phán quyết có thể thay đổi 27–71% dưới sự phản đối tĩnh và 62–91% dưới sự thuyết phục đối kháng.

Cơ sở hạ tầng, Phục vụ và Kỹ thuật chi phí

Tối ưu hóa phục vụ (serving) ngày càng trở thành tính năng hạng nhất của mô hình: Hỗ trợ hạ tầng ngày đầu cho Qwen và DeepSeek nhấn mạnh vào các yếu tố như đầu dự đoán (draft heads) nhúng, giải mã suy đoán (speculative decoding) và sự đánh đổi giữa bộ nhớ/lượng tử hóa thay vì chỉ truy cập API. Bản phát hành 27B của Qwen đi kèm với hướng dẫn của vLLM về đầu dự đoán MTP, ngữ cảnh 1M và phục vụ trên một GPU Blackwell, trong khi ggerganov đã chỉ ra các công thức llama.cpp cục bộ cho ngữ cảnh lớn và giải mã suy đoán. Tim Dettmers đã hé lộ các phương pháp hiệu quả sắp tới để chạy một mô hình mạnh trên một DGX Spark hoặc AMD Strix Halo duy nhất ở mức ~7 tok/s giải mã và >250 tok/s tiền điền (prefill).

Công cụ và vận hành cụm cũng có các cập nhật thực tế: Stas Bekman đã thêm hướng dẫn chẩn đoán các cuộc gọi tập thể NCCL bị treo trong PyTorch, và lưu ý riêng rằng Python 3.14+ cho phép gắn pdb vào một tiến trình đang chạy mà không cần đo đạc (post). Turbopuffer đã mô tả một mặt phẳng điều khiển tùy chỉnh để vận hành hơn 100 cụm TPUf, bao gồm các triển khai BYOC trong đám mây của khách hàng mà không cần truy cập máy chủ trực tiếp. Về phía dữ liệu, bản phát hành datatrove 0.10.0 của Hugging Face đã thêm JobsPipelineExecutor cho Hugging Face Jobs, tích hợp bucket HF và bảo toàn các đầu ra suy luận.

Các động thái về Sản phẩm và Nền tảng: Cursor/SpaceXAI, Gemini 3.7 Flash, Claude Code và UX tác nhân cục bộ

Cursor gia nhập SpaceXAI: Động thái kỹ thuật/doanh nghiệp có mức độ tương tác cao nhất là việc Cursor thông báo hiện là một phần của SpaceX, với đội ngũ gia nhập SpaceXAI để làm việc trên Grok, Grok Build, Grok Bot, Grok API và Cursor. SpaceXAI xác nhận việc mua lại và định hình nó như một bước đẩy nhanh kỹ thuật phần mềm trước tiên, sau đó là công việc tri thức rộng hơn. Đây là một trong những dấu hiệu rõ ràng nhất cho thấy các đội ngũ tác nhân lập trình hiện được coi là tài sản mô hình/nền tảng chiến lược thay vì chỉ là các sản phẩm IDE hẹp.

Triển khai Gemini 3.7 Flash tập trung vào tác nhân và hiệu quả công việc: Google đã đẩy mạnh Gemini 3.7 Flash trên ứng dụng Gemini, Chế độ AI tìm kiếm, Google Workspace / Sheets canvas và Spark. Định vị là "mô hình làm việc thông minh nhất từ trước đến nay cho lập trình và tác nhân", với các bản demo tập trung vào việc biến các prompt đơn giản thành các trò chơi web có thể chơi được (luồng demo của Google). Tín hiệu đánh giá bên ngoài khiêm tốn nhưng tích cực: Vals xếp nó ở vị trí thứ 7 trên Vals Index v2 với 59.4%, tăng từ vị trí thứ 14 của Gemini 3.6 Flash.

Claude Code và UX tác nhân cục bộ ngày càng vận hành tốt hơn: Anthropic đã triển khai chế độ Auto làm chế độ quyền mặc định trong Claude Code cho Pro/Max/Team, với thiết lập nhận biết repo thông qua /auto-mode-setup để gợi ý các repo/tên miền đáng tin cậy (thông báo, chi tiết thiết lập). Về phía mở/cục bộ, Hermes đã thêm /loop cho các hành động lặp lại giống cron bên trong một phiên tác nhân, và Nous chỉ ra rằng Hermes Desktop có thể nhắm mục tiêu vào một tác nhân Hermes Cloud, cho phép công việc tiếp tục sau khi đóng máy tính xách tay. Ollama cũng đã thêm hỗ trợ khởi chạy DeepSeek Harness cục bộ.

Các tweet hàng đầu (theo tương tác)

Tóm tắt AI trên Reddit

Tóm tắt /r/LocalLlama + /r/localLLM

1. Phát hành Qwen3.8-27B, Điểm chuẩn và Mẫu (Templates)

Một thẻ mô hình Qwen3.8-27B sơ bộ đã hoạt động! (Hoạt động: 1006): Hình ảnh là ảnh chụp màn hình kỹ thuật của thẻ mô hình Hugging Face sơ bộ cho Qwen/Qwen3.8-27B (hình ảnh), khớp với ghi chú của bài đăng rằng thẻ đã hiển thị trước khi phát hành và sau đó đã hoạt động. Nó cho thấy tính khả dụng theo kế hoạch của các tệp trọng số/cấu hình mô hình, khả năng tương thích với Transformers, vLLM và SGLang, đồng thời làm nổi bật các cải tiến trong lập trình, thực thi tác nhân, nghiên cứu và sử dụng ngữ cảnh dài, với độ dài ngữ cảnh gốc được nêu là 262,144 token và mở rộng lên đến 1,000,000 token. Người bình luận tập trung vào nỗ lực suy luận như một tính năng tiêu đề tiềm năng, ca ngợi cửa sổ ngữ cảnh dài và lưu ý sự ngạc nhiên rằng mô hình 27B dường như bao gồm các khả năng thị giác trong khi mô hình 2.4T lớn hơn nhiều thì được cho là không có.

Qwen3.8-27B giống hệt Qwen3.6-27B! (Hoạt động: 902): Hình ảnh (GIF) hiển thị các sơ đồ kiến trúc cạnh nhau cho Qwen3.6-27B và Qwen3.8-27B giống hệt nhau về mặt hình ảnh: cùng đường dẫn thị giác/nhúng, masked scatter, ngăn xếp Qwen3_5DecoderLayer lặp lại, RMSNorm, Linear cuối cùng và đầu ra. Diff của HF Viewer được liên kết báo cáo 0 thay đổi kiến trúc, hỗ trợ tuyên bố của bài đăng rằng bất kỳ cải tiến năng lực nào trong Qwen3.8-27B có khả năng đến từ các cập nhật huấn luyện/dữ liệu/tinh chỉnh thay vì thay đổi kiến trúc mô hình. Người bình luận coi đây là một bản cập nhật gia tăng thay vì một mô hình từ đầu, với một người lưu ý rằng dữ liệu huấn luyện thường là đòn bẩy chất lượng lớn nhất. Một người khác suy đoán rằng các bộ điều hợp kiểu LoRA có thể thay thế nóng có thể trở nên phổ biến để cải thiện độ chính xác của mô hình cục bộ trên các tác vụ chuyên biệt.

Qwen3.8-27B hiện đã có sẵn (Hoạt động: 745): Hình ảnh (liên kết) hiển thị trang Hugging Face cho Qwen/Qwen3.8-27B-FP8, cho thấy mô hình Qwen 3.8 28B tham số mới có sẵn được đóng gói với Transformers, Safetensors, giấy phép Apache 2.0 và lượng tử hóa FP8 sử dụng F8_E4M3 cùng với các tensor BF16. Một người bình luận báo cáo suy luận cục bộ sớm trên RTX 5090 ở mức khoảng 50–60 token/s, nói rằng nó cảm thấy ổn định và thận trọng hơn Qwen 3.6, mặc dù họ lưu ý rằng cài đặt có thể không tối ưu và hỗ trợ MTP dường như chưa có sẵn. Các bình luận tỏ ra thận trọng nhưng nhiệt tình, với một người dùng mô tả mô hình này là một "phiên bản 3.6 trưởng thành" với khả năng xử lý tác vụ chạy dài tốt hơn. Một người bình luận khác hỏi liệu các kích thước nhỏ hơn hoặc thay thế như 9B hoặc 35B có sẵn không, vì 27B là quá lớn đối với nhiều người dùng cục bộ.

Muse Glimmer là biên giới trong lớp mô hình khoảng 30b trong bốn ngày. (Hoạt động: 502): Hình ảnh là bảng điểm chuẩn so sánh các mô hình lớp ~30B, với Muse Glimmer-30B và Qwen3.8-27B được làm nổi bật: bài đăng lập luận rằng Muse Glimmer chỉ là "biên giới" trong lớp kích thước này trong bốn ngày trước khi mô hình 27B của Qwen vượt qua nó trên hầu hết các chỉ số được báo cáo. Muse Glimmer cho thấy điểm số như 51.7 lập trình terminal tác nhân, 51.2 SWE-bench Pro, 77.0 IFBench và 83.5 GPQA Diamond, nhưng nhiều ô điểm chuẩn bị thiếu, làm cho sự so sánh không đầy đủ; hình ảnh: i.redd.it/2cclgla7xdjh1.png. Các bình luận coi đây là bằng chứng cho thấy các phòng thí nghiệm mô hình nên phát hành nhiều quy mô tham số để tránh bị vượt mặt trong một lớp duy nhất, với một người bình luận gợi ý Meta nên vận chuyển các biến thể Glimmer lớn hơn như 70B, 100B hoặc 400B. Những người khác suy đoán rằng một mô hình 27B đạt gần lãnh thổ "Opus 4.6 Max" sẽ là một bất ngờ, trong khi hy vọng Meta phản hồi bằng một bản phát hành biên giới mạnh mẽ hơn.

Đã sửa mẫu trò chuyện Jinja cho Qwen 3.5, 3.6 và bản phát hành 3.8 mới (Hoạt động: 478): Một mẫu trò chuyện Jinja cố định cho Qwen do cộng đồng duy trì nhắm vào Qwen 3.5, 3.6 và 3.8 mới, giải quyết các lỗi mẫu chính thức được báo cáo: enable_thinking=false ngoại lệ cứng, lịch sử đa lượt bị nhiễm từ việc tiêm <think></think> trống, sự cố trên các đối số công cụ chuỗi JSON kiểu OpenAI và các thông báo hệ thống giữa cuộc đối thoại bị bỏ qua gây ra vòng lặp công cụ bị đình trệ. Mẫu thêm khả năng điều khiển reasoning_effort của Qwen 3.8 (xhigh, high, medium, low), khôi phục việc vô hiệu hóa suy luận thông qua kwargs hoặc <|think_off|>, bảo toàn các suy nghĩ trước đó để tái sử dụng tiền tố/KV-cache, hỗ trợ llama.cpp --reasoning-preserve và khuyến nghị llama-server... --jinja --chat-template-file chat_template.jinja --reasoning-format deepseek để phát ra suy nghĩ dưới dạng OpenAI reasoning_content. Tác giả lưu ý rằng họ không thể xác thực cục bộ mô hình 2.4T nhưng báo cáo 28 bài kiểm tra tự động cộng với kiểm tra tính tương đương của tokenizer, và yêu cầu phản hồi từ người dùng Qwen 3.8. Người bình luận đặt câu hỏi tại sao các mẫu trò chuyện chính thức của Qwen lại đi kèm với những lỗi hồi quy cơ bản như vậy và liệu QA của họ có bao gồm các đường dẫn mẫu/gọi công cụ hay không. Một người bình luận khác nhấn mạnh sự quan tâm đến việc thử nghiệm các biến thể nhỏ hơn, dễ tiếp cận hơn như 27B.

2. Phát hành GLM 5.3 và DeepSeek V4

GLM 5.3 đã phát hành (Hoạt động: 2227): Z.ai đã thông báo GLM-5.3 trong một bài đăng phát hành chính thức, với biểu đồ điểm chuẩn đi kèm cho thấy GLM-5.3 vượt xa GLM-5.2 trong các đánh giá về lập trình, tự động hóa tác nhân và bảo mật. Hình ảnh làm nổi bật GLM-5.3 dẫn đầu hoặc cạnh tranh cao trên các điểm chuẩn như AutomationBench, CyberGym và GDPVal-AA v2, trong khi các mô hình khác như GPT-5.6 Sol hoặc Mythos/Fable 5 vẫn dẫn trước trên một số tác vụ như DeepSWE và ExploitBench. Người bình luận chủ yếu coi đây là một bản phát hành mô hình nhanh chóng khác của Trung Quốc; một người lưu ý rằng mặc dù đây có vẻ là một thông báo mô hình API, nhưng cuộc thảo luận vẫn có liên quan vì nhóm được cho là đã nói rằng các trọng số sẽ sớm ra mắt.

DeepSeek: Chúng tôi ra mắt DeepSeek-V4-Pro hôm nay! (Hoạt động: 729): DeepSeek đã thông báo DeepSeek-V4-Pro trên X (bài đăng), và người bình luận lưu ý rằng trọng số mô hình đã được phát hành trên Hugging Face dưới dạng deepseek-ai/DeepSeek-V4-Pro-0813. Một bình luận kỹ thuật hàng đầu làm nổi bật giá API mới thông qua hình ảnh giá đính kèm, ngụ ý mức tăng giá đáng kể so với các dịch vụ DeepSeek trước đó. Người bình luận lập luận rằng việc tăng giá làm suy yếu lợi thế chính của DeepSeek: mặc dù "đói token và chậm hơn một chút", trước đây nó hấp dẫn vì giá rẻ; ở mức giá API cao hơn, một số người dùng nói rằng họ sẽ quay lại suy luận cục bộ.

Thật điên rồ khi DSv4 Flash 0731 tốt đến mức nào (Hoạt động: 556): Hình ảnh là biểu đồ thanh Chỉ số Trí tuệ Phân tích Nhân tạo cho thấy DeepSeek V4 Flash 0731 max đạt 52 điểm, xếp hạng 46/608, được nhóm hiệu quả với các mô hình biên hàng đầu như GPT-5.6 Terra và GLM-5.2 ở mức 53. Bài đăng làm nổi bật ý nghĩa thực tế: một mô hình gần đầu bảng điểm chuẩn được cho là có thể sử dụng trên một máy cục bộ dưới $2k, làm cho nó đáng chú ý đối với suy luận cục bộ/ngoại tuyến so với các API biên lớn hơn. Người bình luận phản bác rằng điểm chuẩn có thể phóng đại khả năng thực tế: một người dùng nói rằng GLM 5.2 vẫn mạnh hơn nhiều cho lập trình và DeepSeek lãng phí token cho các tác vụ phức tạp. Những người khác lập luận rằng Qwen 3.6 27B thậm chí còn ấn tượng hơn do xếp hạng tương tự ở kích thước khoảng 1/5, trong khi một người khác nói DSv4 Flash là mô hình có thể chạy cục bộ đầu tiên không cảm thấy như một sự hạ cấp so với các mô hình biên.

Deepseek Harness đã lên sóng! (Hoạt động: 537): DeepSeek AI đã thông báo DeepSeek Harness (dsh), một harness tác nhân mã nguồn mở trong bản xem trước dành cho nhà phát triển, được xây dựng xung quanh kiến trúc "mọi thứ là một plugin" và được cung cấp bởi Cordis, thiết kế của nó được mô tả trong A Programming Paradigm for Spatiotemporal Composability. Dự án rõ ràng là không ổn định—"SẼ CÓ NHỮNG THAY ĐỔI PHÁ VỠ TƯƠNG THÍCH"—và DeepSeek đang hướng các nhà phát triển đến cộng đồng Discord của họ để cập nhật và thảo luận. Các bình luận hàng đầu tập trung vào sự hoài nghi về hệ sinh thái: một người dùng đặt câu hỏi tại sao các harness tác nhân thường được viết bằng TypeScript, một người khác nghi ngờ sự tăng trưởng GitHub do bot điều khiển sau khi số sao được báo cáo tăng từ 20k lên 30k trong khoảng một giờ, và người thứ ba hỏi liệu dsh có thể đạt được tỷ lệ cache hit tốt hơn reasonix hay không.

3. Các bản dựng Transformer cục bộ chuyên biệt

Đã huấn luyện một mô hình 1.5B để viết lệnh shell để tôi không phải google các cờ tar nữa. Chạy trên CPU máy tính xách tay trong ~1 giây. (Hoạt động: 1815): Hình ảnh là màn hình demo terminal/CLI cho công cụ whatisit, hiển thị nghệ thuật ASCII trong một terminal tối thay vì đầu ra điểm chuẩn hoặc nội bộ mô hình: hình ảnh/GIF. Bối cảnh từ bài đăng là kỹ thuật: tác giả đã tinh chỉnh Qwen2.5-Coder-1.5B trên 125k cặp ngôn ngữ tự nhiên→lệnh shell, lượng tử hóa nó thành Q4_K_M (941MB) cho llama.cpp và báo cáo hiệu suất CPU là 31.9 tok/s, 0.59s trung vị/truy vấn, 1.6GB RAM, cộng với 0.620 trên InterCode-ALFA so với 0.613 cho Qwen2.5-Coder-7B chưa tinh chỉnh và 0.73 cho GPT-4o. Các tạo phẩm được phát hành là trọng số Apache-2.0 trên Hugging Face và mã trên GitHub, với một trình kiểm tra an toàn tĩnh vì mô hình có thể tạo ra các lệnh shell phá hoại nếu được nhắc. Các bình luận chủ yếu là nhẹ nhàng thay vì kỹ thuật sâu sắc: người dùng đùa rằng đây là "rất nhiều nỗ lực để không sử dụng trang man", cung cấp các cờ tar ghi nhớ như -czvf / -xzvf và cảnh báo rằng một mô hình NL-to-shell có khả năng nguy hiểm—"giống như đưa một chiếc xe tăng T34 đã nạp đạn cho một đứa trẻ sơ sinh."

Doom chạy trên LLM — bao gồm checkpoint Hugging Face (Hoạt động: 347): Tác giả đã biên dịch trình kết xuất xác định của Doom—không phải huấn luyện nó—thành một checkpoint Phi3ForCausalLM tiêu chuẩn bằng torchwright, với tất cả các trọng số được tính toán phân tích và có thể tải qua transformers thông thường với trust_remote_code=False (bài viết, nguồn). Prompt mã hóa hình học cấp độ/tư thế người chơi/hướng nhìn và thế hệ phát ra các lệnh vẽ được tiêu thụ bởi một máy chủ raster 43 dòng; mô hình 320x200 là 21B tham số / 85.87 GB, yêu cầu 3,614 token prompt + 53,747 token được tạo mỗi khung hình và mất chưa đầy 40 phút trên B200, trong khi checkpoint 80x50 thực tế là bản tải xuống 34 GB (trọng số 80x50, trọng số 320x200). Trình biên dịch hiện tại yêu cầu trọng số fp32; tác giả chỉ chạy nó trên GPU đám mây B200/A100-80 và khuyến nghị 80 GB VRAM cho mô hình 80x50, với 64 GB có thể đủ nhưng chưa được kiểm tra. Sự phản đối kỹ thuật chính là 53,747 token trong ~40 phút trên B200 cho một mô hình 21B dường như chậm hơn nhiều so với dự kiến—một người bình luận tuyên bố hai card RTX 3080 có thể tạo ra số lượng token tương tự trên 27B trong vòng 30 phút, cho thấy một vấn đề tối ưu hóa nghiêm trọng. Một người bình luận khác hỏi tại sao dự án nhắm mục tiêu vào kiến trúc LLM/tạo văn bản thay vì trình tạo hình ảnh transformer, tức là liệu lựa chọn đó hoàn toàn vì sự mới lạ "Nó có chạy được DOOM không?" hay có cơ sở kỹ thuật.

Tóm tắt Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.