Mô hình
Meta ra mắt Muse Glimmer: Mô hình đa phương thức 30B tối ưu cho thiết bị cá nhân
(giờ Việt Nam)
Tóm tắt AI
Meta phát hành Muse Glimmer, mô hình 30B mã nguồn mở tối ưu cho phần cứng tiêu dùng với khả năng chạy cục bộ mượt mà. Đồng thời, một biến thể Claude của Anthropic cũng gây ấn tượng khi giải quyết thành công các bài toán toán học phức tạp.
Bản dịch AI
Một ngày yên ắng.
Tin tức AI từ 8/8/2026 đến 10/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành trước đây. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn đăng ký/hủy đăng ký nhận email theo tần suất mong muốn!
Tóm tắt AI trên Twitter
Meta quay trở lại với Open Weights cùng Muse Glimmer và Spark 1.2
Meta tái gia nhập cuộc đua open-weight: Câu chuyện nổi bật trong ngày là việc Meta phát hành Muse Glimmer, một mô hình 30B dense, đa phương thức, tập trung vào tác nhân (agent-focused) theo giấy phép Apache 2.0, cùng lời hứa sẽ sớm phát hành trọng số (weights) của Muse Spark 1.2. Thông báo được đưa ra bởi Mark Zuckerberg và Alexandr Wang, trong đó Meta coi đây là cam kết đổi mới đối với "siêu trí tuệ cá nhân" (personal superintelligence) có khả năng tiếp cận rộng rãi như đã nêu trong bài luận của Zuckerberg. Luồng thông tin sản phẩm của Meta định vị Glimmer là mô hình được tối ưu hóa cho các tác nhân cục bộ (local agents) hoạt động liên tục, có khả năng chạy trên phần cứng tiêu dùng, kèm theo các chi tiết chính thức và liên kết tải xuống.
Những điểm đáng chú ý về mặt kỹ thuật của Glimmer: Meta cho biết Glimmer được thiết kế cho các vòng lặp tác nhân dài hạn, sử dụng công cụ và triển khai cục bộ. Trong ngăn xếp phục vụ (serving stack), Meta đề cập rõ ràng đến việc lượng tử hóa (quantization) để đưa LM xuống dưới 20GB và sử dụng DFlash drafter gọn nhẹ để tạo văn bản nhanh hơn trên thiết bị, mang lại tương tác cục bộ "mượt mà" @AIatMeta. Các bản tóm tắt từ cộng đồng bổ sung thêm thông tin về kiến trúc: @eliebakouch lưu ý những điểm tương đồng với cơ chế hybrid attention kiểu Gemma 4 cộng với chuẩn hóa QK không phụ thuộc quy mô (scale-free QK norm), độ sâu thị giác lớn hơn và SWA dài hơn; @nrehiew_ nhấn mạnh rằng Glimmer được chưng cất logit (logit-distilled) từ Muse Spark và được huấn luyện ngay từ đầu trên các dấu vết tác nhân (agentic traces), tức là không phải kiểu phát hành "cơ sở rồi mới hậu huấn luyện" thông thường.
Các điểm chuẩn (benchmarks) và hệ sinh thái triển khai xuất hiện ngay lập tức: Phân tích từ bên thứ ba của Artificial Analysis xếp Muse Glimmer ở vị trí 35 trên Chỉ số Trí tuệ (Intelligence Index), ngay sau Qwen3.6-27B (38) và ngang tầm Kimi K2.5 (36), đồng thời đạt điểm cao về tính mở (Chỉ số Mở 44). Nhận định của họ là Glimmer mạnh so với kích thước của nó và đặc biệt đáng chú ý cho việc tự lưu trữ cục bộ: ~60GB BF16, ~18GB 4-bit, ngữ cảnh 128K và hybrid attention tiết kiệm bộ nhớ phù hợp cho các chi tiết triển khai trên một nút (single-node). Điểm yếu: khả năng hiệu chỉnh kiến thức/ảo tưởng (hallucination) còn tương đối kém và đi sau một số đối thủ về công việc kiến thức tác nhân, mặc dù nó hoạt động tốt trong việc sử dụng công cụ Tau3-Banking.
Hỗ trợ hạ tầng ngay từ ngày đầu (Day-0) rộng rãi bất thường: Glimmer có sự tích hợp ngay lập tức trên toàn bộ ngăn xếp mở: vLLM, llama.cpp, Ollama, Together AI, Hugging Face transformers + hỗ trợ llama.cpp + DFlash, và Unsloth. Các báo cáo từ cộng đồng cho thấy khả năng sử dụng thực tế trên máy tính xách tay và máy tính để bàn: @TimDarcet trích dẫn tốc độ ~50 tok/s trên MacBook M5 Max với kỹ thuật lượng tử hóa + giải mã suy đoán (speculative decoding), trong khi @redp314 so sánh các tùy chọn phục vụ trên Mac hiện tại và ghi nhận ~29 tok/s thông qua Ollama MLX.
Anthropic và OpenAI thúc đẩy khả năng tiên phong: Toán học và An ninh mạng
Claude của Anthropic cải thiện một giới hạn liên quan đến giả thuyết Riemann: Anthropic báo cáo rằng một biến thể nghiên cứu chưa được phát hành của Claude, khi được giao nhiệm vụ với Giả thuyết Riemann, dù không giải được giả thuyết nhưng đã cải thiện một giới hạn dưới lâu đời: tỷ lệ các số không zeta trên đường tới hạn đã tăng từ 41,6% lên 67,2% trong thông báo kết quả được tạo ra. Bài đăng nhanh chóng trở thành câu chuyện lớn thứ hai trong ngày, với Jarred Sumner bổ sung rằng mô hình đã sử dụng các lần thử lại lặp đi lặp lại và khám phá quy mô lớn trên 31 triệu token đầu ra. Các kỹ sư coi đây không hẳn là "đã giải được RH" mà là một ví dụ nổi bật về việc tìm kiếm định lý và lặp lại chứng minh có sự hỗ trợ của AI; xem phản hồi từ @jdlichtman và @kimmonismus.
OpenAI ra mắt GPT-5.6-Cyber dưới quyền truy cập hạn chế: OpenAI đã công bố GPT-5.6-Cyber và mở rộng sáng kiến an ninh mạng Daybreak, định vị rõ ràng mô hình này cho công việc phòng thủ nâng cao, được ủy quyền @OpenAI. OpenAI cho biết mô hình đã được sử dụng trong nghiên cứu lỗ hổng thực tế, bao gồm việc tìm ra các lỗi chưa từng biết trong phần mềm mã nguồn mở và thậm chí cả các chi tiết về Chrome V8. Quyền truy cập bị giới hạn cho các "nhà phòng thủ được phê duyệt", với các biện pháp kiểm soát và giám sát bổ sung cho các biện pháp bảo vệ nhiệm vụ mạng rủi ro cao. Động thái này diễn ra sau cuộc tranh luận rộng rãi hơn về việc lạm dụng mạng của mô hình và khai thác do tác nhân điều khiển, được tham chiếu bởi @kimmonismus và @jachiam0.
Áp lực về giá cũng xuất hiện: Anthropic thông báo riêng rằng mức giá giới thiệu của Claude Sonnet 5 sẽ trở thành vĩnh viễn ở mức $2/M đầu vào và $10/M đầu ra @claudeai, một động thái được hiểu rộng rãi là áp lực cạnh tranh trong bối cảnh lĩnh vực mở và bán mở đang phát triển nhanh chóng.
Bộ khung tác nhân (Agent Harnesses), Sử dụng công cụ và Tối ưu hóa chi phí/độ trễ
Chất lượng bộ khung (harness) đang trở thành yếu tố khác biệt hàng đầu: Một số tweet nhấn mạnh rằng chất lượng mô hình ngày càng bị hạn chế bởi bộ khung tác nhân, không chỉ bởi mô hình cơ sở. Điểm chuẩn của Composio đã chạy DeepSeek V4 Flash qua bốn bộ khung trên 20 tác vụ tác nhân, nhận thấy Pi Agent vừa rẻ nhất vừa hoạt động tốt nhất trong thiết lập đó. Shashwat Goel cũng gọi Prime-agent là một bộ khung tổng quát mạnh mẽ cho các tác vụ dài hạn.
Thiết kế giao diện công cụ quan trọng hơn nhiều ngăn xếp giả định: Một bản tóm tắt bài báo đáng chú ý từ @dair_ai lập luận rằng việc gọi công cụ theo chương trình (programmatic tool calling)—các stub Python có kiểu được thực thi trong mã—khớp hoặc vượt trội hơn so với việc gọi công cụ JSON gốc ở 11/14 mô hình, với dòng GPT-5.6 đạt mức tăng 10,6% so với các đường cơ sở JSON trên BFCL v4. Khẳng định: khi các mô hình trở nên giỏi hơn về mã, việc coi công cụ là các đối tượng mã thay vì các khối lược đồ (schema blobs) ngày càng chiếm ưu thế, đặc biệt là trong điều kiện suy giảm ngữ cảnh (context rot) và phân nhánh song song.
Hiệu quả token vẫn là một vấn đề hệ thống thực tế: Teknium nhấn mạnh các cải tiến về công cụ đọc trong Hermes Agent, trong khi sau đó báo cáo mức giảm ~60% token cho tự động hóa trình duyệt bằng cách thu gọn nhiều hành động trình duyệt vào một giao diện công cụ điều khiển bằng CLI tại đây và đây. Liên quan đến điều này, Browser Use và Stagehand v4 báo hiệu sự chuyển dịch sang các trừu tượng hóa mỏng hơn, gốc trình duyệt cho các tác nhân.
Chuỗi công cụ tác nhân ưu tiên cục bộ (local-first) tiếp tục cải thiện: SDK của Pi nhấn mạnh rằng một tác nhân lập trình có thể duy trì khả năng đáng ngạc nhiên chỉ với bốn nguyên hàm—read, bash, edit, write—trong khi LiteParse của Jerry Liu nhắm mục tiêu phân tích tài liệu độ trễ thấp bên trong vòng lặp tác nhân, tuyên bố đạt 4 ms cho 200 trang trên trích xuất heuristic trước khi quay lại OCR/VLM.
Suy luận và Hệ thống: Giải mã suy đoán, Phục vụ và Hiệu quả GPU
Giải mã suy đoán (Speculative decoding) đang trở nên thực tế hơn trong sản xuất: Một luồng kỹ thuật dài được tóm tắt bởi @ZhihuFrontier đã so sánh DSpark và DFlash trên Qwen3-4B trong vLLM. Kết quả báo cáo: DSpark đạt thông lượng cơ sở gấp 2,45–2,55 lần so với DFlash gấp 1,96–2,09 lần, với lợi thế của DSpark được cho là nhờ cấu trúc bán tự hồi quy cộng với bộ lập lịch tiền tố nhận biết phần cứng giúp tránh xác minh mục tiêu lãng phí. Điều này nhất quán theo hướng với việc Meta sử dụng DFlash trong Glimmer để đáp ứng tác nhân cục bộ.
Các kiến trúc suy luận thay thế vẫn rất nóng: SemiAnalysis nhấn mạnh TileRT / InferenceX trên GPU NVIDIA như một nỗ lực mô phỏng các đặc điểm tương tác cao thường gắn liền với các nhà cung cấp như Cerebras, Groq hoặc SambaNova—đặc biệt là cho kích thước lô (batch size) 1, phục vụ phân tách và tách biệt giải mã/điền trước (decode/prefill).
Sự khác biệt giữa các nhà cung cấp vẫn rất lớn: Qua các tweet về Muse Glimmer, DeepSeek V4 Flash và suy luận được lưu trữ, chủ đề kỹ thuật lặp đi lặp lại là "cùng một mô hình" không có nghĩa là cùng trải nghiệm người dùng. Artificial Analysis đã gợi mở một cuộc thảo luận về lý do tại sao tốc độ đầu ra có thể thay đổi tới 15 lần giữa các nhà cung cấp. Trong khi đó, QuixiAI báo cáo 175 tok/s cho một yêu cầu đơn lẻ và 1k tok/s ở mức 64 đồng thời cho DeepSeek V4 Flash trên 4× A100 với SlimServe.
Video, Đa phương thức và Mô hình Robot
Động lực video open-weight của MiniMax H3 tiếp tục: MiniMax tiếp tục thúc đẩy H3 như một mô hình video open-weight với sự tiếp nhận nhanh chóng từ cộng đồng. Công ty đã chỉ ra các công việc hệ sinh thái mới xung quanh việc lượng tử hóa, offloading, Context-IR và triển khai GPU tiêu dùng trong bản tóm tắt livestream ComfyUI, đồng thời ca ngợi phản hồi nhanh chóng của cộng đồng bao gồm hỗ trợ LoRA, MLX và các tối ưu hóa ComfyUI trong bản tóm tắt ThursdAI. Đáng chú ý, antirez đã phát hành một triển khai Metal nhanh, điều mà chính MiniMax đã ca ngợi như một lợi ích trực tiếp của open weights @MiniMax_AI.
Seedance, Omni và công cụ sáng tạo tiếp tục tiến bộ: Google đã giới thiệu các cách sử dụng Gemini Omni Flash cho việc tạo và chỉnh sửa video đa góc @Google, trong khi fal đã thêm cả đào tạo LoRA cho MiniMax H3 @fal và các điểm cuối Seedance 2.5 @fal. Ngăn xếp sáng tạo đa phương thức đang ngày càng trở nên có thể kết hợp: hình ảnh tham chiếu, âm thanh, kiểm soát khung hình đầu/cuối và tinh chỉnh LoRA đang được coi là các nguyên hàm tiêu chuẩn thay vì các bản demo đặc biệt.
Các mô hình Robot/thế giới cũng có một bản phát hành đáng chú ý: Dyna Robotics đã giới thiệu Dyna-2, một mô hình hành động thế giới được huấn luyện trước trên 1 triệu giờ video của con người, tuyên bố các định luật mở rộng mới: mở rộng trên video con người chuyển sang dữ liệu robot chưa từng thấy, và lựa chọn mục tiêu quan trọng đối với việc chuyển đổi chéo hiện thân (cross-embodiment). Riêng biệt, Sakana AI đã định hình RSI Lab mở rộng của mình xung quanh "AI vật lý", các mô hình thế giới và tự cải thiện đệ quy cho các tác nhân trong thế giới thực.
Các tweet hàng đầu (theo mức độ tương tác)
Tóm tắt AI trên Reddit
Tóm tắt /r/LocalLlama + /r/localLLM
1. Phát hành cục bộ Meta Muse Glimmer 30B
Giới thiệu Muse Glimmer: một mô hình open-weight được tối ưu hóa cho các quy trình làm việc tác nhân cục bộ luôn hoạt động (Hoạt động: 2141): Meta đã công bố Muse Glimmer, một mô hình tác nhân đa phương thức open-weight 30B dense theo giấy phép Apache 2.0, hỗ trợ đầu vào văn bản+hình ảnh xen kẽ thông qua bộ mã hóa nhận thức chuyên dụng, 100+ ngôn ngữ, nỗ lực suy luận có thể kiểm soát và các điểm chuẩn tác nhân như DeepSearch QA, MCP-Atlas, τ³-Bench và SWE-Bench. Bản phát hành nhắm mục tiêu vào các quy trình làm việc cục bộ luôn hoạt động: lượng tử hóa ~4-bit đưa LM xuống dưới 20 GB, để lại không gian trên các hệ thống 24–32 GB cho bộ nhớ đệm KV, bộ mã hóa nhận thức và một drafter giải mã suy đoán dựa trên DFlash đi kèm; các trọng số có trên Hugging Face, với kế hoạch hỗ trợ cho Ollama, LM Studio, Unsloth, torchtitan, llama.cpp, MLX, ExecuTorch, vLLM và SGLang. Một bình luận hàng đầu trích dẫn Alexandr Wang nói rằng bản phát hành Muse Spark 1.2 open-weight sắp ra mắt trên X. Tâm lý bình luận phần lớn nhiệt tình về việc Meta quay trở lại với các bản phát hành open-weight, nhưng không có cuộc tranh luận kỹ thuật thực chất nào trong các bình luận hàng đầu.
Meta phát hành Muse Glimmer 30B - một mô hình mở mới (Hoạt động: 356): Hình ảnh của bài đăng là một thông báo điểm chuẩn quảng cáo, không phải meme: nó trình bày Meta "Muse Glimmer-30B" như một mô hình thị giác dense, open-weight theo giấy phép Apache 2.0, tuyên bố nó có thể chạy trên các thiết lập RAM/VRAM 18GB và được sử dụng thông qua Unsloth Desktop (hình ảnh). Biểu đồ tuyên bố kết quả cạnh tranh so với Gemma 4-31B và Qwen3.6-27B trên các tác vụ tác nhân/đánh giá bao gồm MCP Atlas, DeepSearch QA, SWE-Bench Pro, GPQA Diamond và AIME 2026, định hình nó như một mô hình mở nhỏ gọn với hiệu suất tác nhân và suy luận mạnh mẽ. Các bình luận nhìn chung tích cực đối với việc Meta tái gia nhập các bản phát hành mô hình mở, nhưng một người bình luận lập luận rằng vị trí dẫn đầu được tuyên bố có thể chỉ tồn tại trong thời gian ngắn do tốc độ phát hành nhanh của Qwen và nói rằng Meta vẫn còn "rất nhiều việc phải làm để bắt kịp".
Muse Glimmer THỰC SỰ vừa vặn trên một chiếc RTX 3090 duy nhất (Hoạt động: 490): Một người dùng báo cáo Meta Muse Glimmer 30B chạy trong llama-server dưới dạng Q4_K_XL GGUF với mmproj, DFlash, -c 262144, bộ nhớ đệm F16 KV và Flash Attention trên một chiếc RTX 3090 duy nhất, chỉ sử dụng khoảng 22–23 GiB VRAM trong khi duy trì tốc độ tạo khoảng 64–124 tok/s và xử lý nhắc lệnh 1400 tok/s. Điều này trái ngược với giới hạn RTX 3090 của họ đối với Qwen3.6-27B và Gemma-4-31B ở các ngữ cảnh ngắn hơn nhiều (70k/52k token với F16 KV, 125k/81k với Q8 KV), và một bài kiểm tra hai kim 150k đã truy xuất cả hai kim một cách chính xác, cho thấy không có giới hạn mềm 128k rõ ràng. Một người bình luận lưu ý rằng SWA tất cả các lớp của mô hình vẫn mang lại bộ nhớ đệm KV được tối ưu hóa—1,8 GiB cho 131k F16—và một người khác chỉ ra các GGUF chính thức của Meta nhắm mục tiêu 24GB/32GB VRAM với DFlash trên Hugging Face, thay vì yêu cầu các bản dựng Unsloth. Những người bình luận đã định hình kết quả là đặc biệt thuận lợi cho các GPU tiêu dùng 24GB, với suy đoán nhỏ rằng điều này có thể làm tăng thêm nhu cầu/giá của RTX 3090.
unsloth/Muse-Glimmer-30B-GGUF · Hugging Face (Hoạt động: 631): Bài đăng chỉ ra bản dựng GGUF của Unsloth cho Muse-Glimmer-30B trên Hugging Face (unsloth/Muse-Glimmer-30B-GGUF) cộng với hướng dẫn thiết lập Unsloth chính thức: unsloth.ai/docs/models/muse-glimmer. Một bình luận hàng đầu nhấn mạnh rằng Unsloth ghi lại việc thực thi llama.cpp cụ thể trong hướng dẫn llama.cpp, với một chỉnh sửa lưu ý rằng nó "hiện cũng hoạt động trong Unsloth". Những người bình luận định hình đây là một bản phát hành đáng chú ý của Meta—"Meta đã trở lại cuộc chơi"—nhưng kỳ vọng sự chú ý sẽ nhanh chóng chuyển sang một bản phát hành Qwen sắp tới, được mô tả là 27B và sẽ ra mắt vào cuối tuần.
2. Điểm chuẩn DeepSeek V4 Flash và các lần chạy ROCm
DeepSeek V4 Flash 0731 đạt 82,7% trên Terminal-Bench 2.1 trong một lần chạy bộ khung công cộng độc lập (445 thử nghiệm) (Hoạt động: 411): Tác giả của Ante báo cáo tái tạo độc lập kết quả 82,7% được tuyên bố của DeepSeek V4 Flash 0731 trên Terminal-Bench 2.1, sử dụng Ante 0.preview.71 công cộng thay vì bộ khung "chế độ tối thiểu" chưa được phát hành của DeepSeek: 368/445 thử nghiệm thành công, 89 tác vụ × 5 thử nghiệm, nỗ lực suy luận tối đa, không kỹ năng, thông qua deepseek/deepseek-v4-flash-0731 trên OpenRouter. Toàn bộ quá trình chạy/cấu hình được công khai trên Harbor, cùng với kết quả được báo cáo của DeepSeek và trang đánh giá Ante, nhưng một người bình luận đã gắn cờ khả năng không hợp lệ: một số thử nghiệm caffe-cifar-10 chạy 2h14m và 5h54m, vượt quá giới hạn 3600s chính thức trong đặc tả tác vụ (task.toml). Một người bình luận kỹ thuật lập luận rằng điểm số có khả năng sẽ bị bảng xếp hạng Terminal-Bench chính thức từ chối vì thời gian chờ/giới hạn tài nguyên bị thổi phồng cải thiện đáng kể xác suất thành công của tác nhân; một người bình luận khác ca ngợi DeepSeek V4 Flash là một mô hình miễn phí mạnh mẽ với tiềm năng tinh chỉnh theo miền cụ thể.
DeepSeek-V4-Flash 0731 độ chính xác đầy đủ không mất dữ liệu trên 2x 7900xtx với 128GB RAM. (Hoạt động: 651): Hình ảnh là một bức ảnh phần cứng theo ngữ cảnh của máy tính để bàn GPU kép được sử dụng cho thử nghiệm của bài đăng: chạy DeepSeek-V4-Flash-0731 ở dạng UD-Q8_K_XL gần/đầy đủ trên 2× GPU lớp Radeon 7900 XTX cộng với 128 GB RAM hệ thống (hình ảnh). Thiết lập sử dụng llama-server với ROCm, --split-mode layer, --tensor-split 7,37, --override-tensor CPU offload có chọn lọc của các chuyên gia MoE, bộ nhớ đệm q8_0 KV và một drafter DSpark để đạt được khoảng 52 tok/s tiền điền và 10,5 tok/s tạo ở ctx-size 131072; OP cũng lưu ý chạy dưới cgroup systemd với MemorySwapMax=0 để thất bại nhanh khi OOM thay vì hoán đổi. Các bình luận bị chia rẽ giữa sự quan tâm đến việc tái tạo thiết lập và sự hoài nghi về tốc độ, với một người bình luận phản ứng với tốc độ tạo 10,5 tok/s là "đau đớn". OP định hình nó như một bản dựng mới lạ/chứng minh tính khả thi thay vì một bản triển khai xứng đáng cho sản xuất.
3. Các bản phát hành mô hình cục bộ nhỏ gọn
Đã sửa một số vấn đề của Qwen, và tôi có bằng chứng! Đã xuất bản trên HF (Hoạt động: 560): Hình ảnh là một "biên lai" điểm chuẩn kỹ thuật (png) hỗ trợ tuyên bố của bài đăng rằng Nail-Qwen3.6-35B-A3B và Dagger-Qwen3.6-27B cải thiện các vấn đề về độ dài dòng/độ trễ của Qwen thông qua các thay đổi kiểu chat-template/system-prompt thay vì tinh chỉnh đầy đủ. Nó so sánh Qwen3.6-27B, ThinkingCap-27B, Dagger-27B và Nail-35B-A3B trên các tác vụ MMLU-Pro và CLAW-EVAL đa lượt: Qwen gốc được hiển thị chậm hơn nhiều (203,0s cho mỗi câu trả lời MMLU-Pro đúng; 912s cho mỗi cuộc hội thoại CLAW), trong khi Nail được báo cáo là nhanh nhất và tốt nhất về điểm trung bình CLAW (60,5%). Văn bản tự đăng liên kết các bản phát hành MLX/GGUF trên Hugging Face và tuyên bố tốc độ tăng 3–5 lần, hiệu quả token tốt hơn, duy trì suy luận qua các lượt và ngữ cảnh đầy đủ 256k trên khoảng 24–32GB RAM với lượng tử hóa bộ nhớ đệm KV 8-bit. Những người bình luận hoài nghi rằng một nhà phát triển đơn độc có thể vượt trội đáng kể so với Qwen-27B với dấu chân nhỏ hơn/tương đương, trong khi những người khác lưu ý rằng nếu đây "chỉ là một thay đổi về mẫu trò chuyện và lời nhắc hệ thống", họ muốn Jinja/mẫu được xuất bản riêng thay vì đóng gói vào các bản dựng GGUF/MLX.
Đã huấn luyện một mô hình 1.5B để viết các lệnh shell để tôi không phải google các cờ tar nữa. Chạy trên CPU máy tính xách tay (Hoạt động: 2308): Bài đăng công bố whatisit-nl2sh, một trợ lý NL-to-shell-command cục bộ: Qwen2.5-Coder-1.5B được tinh chỉnh trên 125k cặp ngôn ngữ tự nhiên/lệnh, được hợp nhất và lượng tử hóa thành Q4_K_M cho một mô hình llama.cpp 941MB chạy trên CPU máy tính xách tay ở tốc độ 31,9 tok/s, trung vị/truy vấn 0,59s và 1,6GB RAM. Tác giả tuyên bố đạt 0,620 trên InterCode-ALFA, cao hơn một chút so với 0,613 của Qwen2.5-Coder-7B chưa được tinh chỉnh nhưng thấp hơn 0,73 của GPT-4o, với trình kiểm tra an toàn tĩnh và 304 trường hợp hồi quy để bắt các lệnh phá hoại; mã và trọng số là Apache-2.0 trên GitHub và Hugging Face. GIF đính kèm là một màn hình demo/thương hiệu thiết bị đầu cuối cho công cụ thay vì biểu đồ điểm chuẩn; nó định hình trực quan dự án như một trợ lý CLI cục bộ để tạo các dòng lệnh shell một dòng. Các bình luận hầu hết là tích cực, với một người dùng so sánh nó với tldr-pages nhưng nói rằng bản demo cho thấy giá trị đối với việc tạo các dòng lệnh một dòng rất cụ thể. Một người khác nói đùa rằng đây là "1,5 tỷ tham số" để tránh đọc các trang man, làm nổi bật góc độ tiện lợi thực tế hơn là tài liệu.
Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.