smol.ai AI News
Điểm AI 85/100

Ngành

Điểm tin AI: Bước tiến mới trong đánh giá tác nhân và làn sóng mô hình mã nguồn mở

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu mới từ NVIDIA giới thiệu chỉ số 'Skill Lift' để đánh giá tác nhân AI, trong khi các dự án như Headlong và MCP của Anthropic đang định hình lại hạ tầng vận hành bền bỉ. Đồng thời, thị trường đón nhận các mô hình mã nguồn mở mạnh mẽ cùng nhiều tin đồn về các siêu AI sắp ra mắt.

Chính văn · Bản dịch AI

not much happened today | AINews

Một ngày yên ắng.

Tin tức AI từ 22/8/2026 đến 24/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận hoặc hủy nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

Agent Harnesses (Khung điều phối tác nhân), Persistent Agents (Tác nhân bền bỉ) và Enterprise MCP

Thiết kế khung điều phối (harness) đang trở thành bề mặt tối ưu hóa chính: Nhiều bài đăng cùng đi đến nhận định rằng chất lượng tác nhân ngày càng được định hình bởi khung điều phối thay vì chỉ dựa vào mô hình cơ sở. Nghiên cứu đánh giá mới của NVIDIA lập luận rằng các kiểm tra cấu trúc về "kỹ năng" của tác nhân hầu như không dự đoán được tính hữu dụng—điểm số quét chỉ tương quan với chất lượng được đánh giá ở mức Spearman ρ = 0.14—và đề xuất đo lường "Skill Lift" (Độ nâng kỹ năng) thay thế: chạy cùng một tác vụ với và không có kỹ năng đó trong cùng điều kiện, sau đó tính toán sự khác biệt trong công việc hoàn thành (tóm tắt bài báo qua @omarsar0). Song song đó, một bài báo quan điểm về các khung điều phối kiểu Anthropic lập luận rằng các doanh nghiệp nên chuẩn hóa trên một khung điều phối tác nhân lập trình có thể tái sử dụng duy nhất thay vì các biểu đồ điều phối tùy chỉnh, khẳng định rằng việc chọn khung điều phối có thể quan trọng hơn chọn mô hình trong công việc doanh nghiệp (tóm tắt qua @dair_ai).

Các tác nhân bền bỉ và tự sửa đổi đang chuyển từ khái niệm sang triển khai mã nguồn mở: @andykonwinski đã giới thiệu Headlong, một "microharness" mã nguồn mở dành cho các tác nhân bền bỉ suy nghĩ liên tục thay vì chỉ khi được yêu cầu. Hệ thống lưu trữ các quỹ đạo dưới dạng DAG của các tệp jsonl, duy trì một vòng lặp tự hướng dẫn bên trong và được báo cáo là đã thực hiện thành công việc tự gỡ lỗi mà không cần giám sát trong 48 phút; các đánh đổi bao gồm chi phí suy nghĩ nền từ 1–2 USD/giờ và đôi khi xảy ra lỗi tự gây ra. Bổ sung cho điều đó, @omarsar0 đã mô tả exo, một kiến trúc khung điều phối cho khả năng tự cải thiện đệ quy với nhật ký sự kiện chỉ thêm (append-only), bộ thực thi có thể thay thế và sandbox có khả năng snapshot/rollback—được thiết kế rõ ràng để các tác nhân có thể viết lại prompt/công cụ/bộ nhớ mà không làm hỏng trạng thái bền vững. Nhìn chung, các bài đăng này cho thấy làn sóng hạ tầng tác nhân tiếp theo tập trung vào độ bền, phân nhánh, khôi phục và vận hành liên tục, chứ không chỉ là cải thiện prompt.

MCP đang dần trở thành hạ tầng doanh nghiệp: Anthropic đã triển khai xác thực do doanh nghiệp quản lý cho các trình kết nối MCP, tập trung hóa việc cấp quyền thông qua nhà cung cấp danh tính của tổ chức để người dùng cuối không còn phải thực hiện OAuth cho từng công cụ như Asana, Atlassian, Canva, Datadog, Figma, Notion, Slack và Supabase (thông báo từ @ClaudeDevs). Riêng biệt, lộ trình MCP nhấn mạnh việc hỗ trợ sắp tới cho các khối lượng công việc chạy dài với streaming/server push, HTTP cho máy chủ cục bộ, khám phá lũy tiến cho các danh mục lớn và danh tính tiêu chuẩn/quyền được ủy quyền (tóm tắt lộ trình qua @_philschmid). Điều này thu hẹp khoảng cách đáng kể giữa các bản demo đồ chơi và triển khai doanh nghiệp có thể kiểm toán.

Phát hành mô hình, rò rỉ và định vị cạnh tranh

Qwen3.8-27B tiếp tục vượt xa phân khúc kích thước của nó: Trong Code Arena: WebDev, Qwen3.8-27B đứng thứ 9 chung cuộc với 1595 điểm, là mô hình duy nhất trong phân khúc kích thước của nó lọt vào top 10 và chỉ kém Qwen3.8-Max sáu bậc (cập nhật bảng xếp hạng từ @arena). Nó cũng xếp hạng cao trong các danh mục sản phẩm tiêu dùng, thương hiệu/tiếp thị và trò chơi. Một sản phẩm phái sinh mã nguồn mở liên quan, Carnice-V3-27B, đã được @kaiostephens phát hành: một mô hình SFT dựa trên Qwen 27B, Hermes-agent được thiết kế để chạy trên GPU tiêu dùng (3090+), với các biến thể BF16 và GGUF đã hợp nhất.

Chu kỳ tin đồn xung quanh các mô hình tiên phong chưa phát hành ngày càng tăng: Nhiều tweet đề cập đến quyền truy cập sớm hoặc dấu vết của các hệ thống chưa ra mắt: Các mô hình EAP có nhãn “claude-melon-eap” và “claude-marshmallow-eap” được cho là nhấn mạnh vào các tác vụ kiểu 3D/RL và sử dụng nhiều token suy nghĩ (demo bởi @Lentils80); @kimmonismus đã thu thập các dấu hiệu về các mô hình Claude mới, Ox Alpha, Qwen 4 và một GPT Astra đã được xác nhận; và @eliebakouch tuyên bố có quyền truy cập vào một mô hình vẫn đang trong quá trình đào tạo với một lượt chạy W&B công khai. Hãy coi hầu hết những điều này là tín hiệu hệ sinh thái thay vì thông số đã xác minh, nhưng đáng chú ý là phần lớn các cuộc thảo luận hiện nay xoay quanh sự bất đối xứng về quyền truy cập trước khi ra mắt thay vì các đợt ra mắt công khai—nhắc lại lời cảnh báo của @michael_nielsen rằng việc kiểm soát quyền truy cập vào các mô hình chưa phát hành đang trở thành nguồn gốc của sự tập trung quyền lực.

Định vị của OpenAI và Anthropic vẫn đang biến động: Các nhà phát triển OpenAI đã thông báo về sự khả dụng của GPT-5.6 trong Kiro và tuyên bố giảm khoảng 82% chi phí cho mỗi tác vụ Terminal-Bench 2.1 thành công trong môi trường dựa trên thông số kỹ thuật của Kiro cho biến thể Terra (thông báo). OpenAI cũng cắt giảm giá API GPT-5.6 Sol xuống còn 4 USD/triệu token đầu vào và 20 USD/triệu token đầu ra (ghi chú giá qua @kimmonismus), với các cập nhật từ Arena cho thấy Sol và Luna đang dịch chuyển đường biên Pareto về chi phí/hiệu suất (@arena). Về phía Anthropic, @tenobrus lưu ý rằng đã không có bản nâng cấp dòng Opus rõ ràng nào trong hơn sáu tháng, ngay cả khi các bên kiểm thử bên ngoài báo cáo kết quả suy luận trung bình mạnh hơn từ các biến thể Claude mới (@kimmonismus).

Suy luận, Đánh giá và Hiệu quả chi phí

Sự chồng lấp độ trễ của công cụ đang nổi lên như một cách tăng tốc ở cấp độ khung điều phối: @a1zhang đã giới thiệu Speculative Programmatic Tool Calling (sPTC), dự đoán các lệnh gọi công cụ an toàn trong quá trình tạo mã và khởi chạy chúng sớm trong một bản sao của môi trường để việc thực thi chồng lấp với quá trình tạo token. Sự cải thiện được báo cáo cho đến nay còn khiêm tốn—khoảng 1.0–1.2 lần—nhưng cơ chế này rất quan trọng: nó chuyển dịch việc tối ưu hóa từ các thủ thuật giải mã cấp token sang quy trình làm việc của tác nhân. @lateinteraction so sánh nó với thực thi suy đoán trên CPU, nhấn mạnh rằng công việc bị loại bỏ là chấp nhận được nếu hầu hết các dự đoán đều đúng.

Việc tính toán token và vệ sinh điểm chuẩn vẫn còn lộn xộn: Một số bài đăng đã chỉ trích các thực tiễn báo cáo gây hiểu lầm. @bnjmn_marie đã chia sẻ một lượt chạy DeepSWE với 918,9 triệu token đầu vào, làm rõ rằng nhiều token là các lượt truy cập bộ nhớ đệm (cache hits), trong khi @cHHillee thẳng thắn lập luận rằng việc tính các token đầu vào đã lưu vào bộ nhớ đệm trong "mức sử dụng token" là "cực kỳ ngớ ngẩn". Về phía đánh giá, @jmbollenbacher cảnh báo rằng khi một mô hình lượng tử hóa vượt qua mô hình tham chiếu trên một điểm chuẩn, điều đó có thể cho thấy sự quá khớp (overfitting) của lượng tử hóa, chứ không phải là cải thiện thực sự; @xeophon tóm tắt bài học rộng hơn: việc sửa chữa điểm chuẩn có thể quan trọng hơn việc leo dốc trên đó.

Các điểm chuẩn tác nhân được chuẩn hóa theo chi phí tiếp tục định hình lại các lựa chọn mô hình: Together AI báo cáo rằng với ngân sách 100 USD, GLM-5.3 đã hoàn thành công việc gấp 5 lần so với Fable 5 trên DeepSWE, khoảng 17 so với 3 tác vụ được giải quyết, mặc dù hiệu suất lần thử đầu tiên tương tự (tweet). @reach_vb cũng báo cáo GPT-5.6 Sol Max đạt 72,7% trên DeepSWE v1.1 với giá 6,47 USD/tác vụ so với Fable 5 Max đạt 69,7% và 21,63 USD/tác vụ. Cline cũng so sánh Ox Alpha với Fable trên một bản sửa lỗi thực tế và thấy cả hai đều giải quyết được, nhưng Ox sử dụng ít token đầu ra hơn khoảng 3 lần, cho thấy một triết lý hậu đào tạo khác biệt đáng kể xung quanh việc xác minh lại so với việc hành động dựa trên kết luận đầu tiên (so sánh từ @cline).

AI trên thiết bị và Hệ thống suy luận

Liquid AI + Artificial Analysis đã ra mắt một bộ điểm chuẩn trên thiết bị nghiêm túc: @liquidai đã phát hành Pipette, một bộ đánh giá mã nguồn mở cho suy luận trên thiết bị, đo lường chất lượng, tốc độ, độ trễ và bộ nhớ trên các kết hợp mô hình + lượng tử hóa + runtime + thiết bị, với hơn 10.000 kết quả đã xác minh trải dài trên 35 lớp mô hình, 7 mức lượng tử hóa, runtime llama.cpp và bốn thiết bị. Artificial Analysis đã kết hợp điều này với các đánh giá trí tuệ quy mô điện thoại độc lập trên iPhone 17 Pro và Galaxy S26 Ultra (chuỗi bài đầy đủ).

Kết quả quy mô điện thoại làm nổi bật một đường biên Pareto khác so với các đánh giá trên đám mây: Trong khung bộ nhớ 8 GB / ngữ cảnh 16K, Nanbeige4.2-3B và LFM2.5-2.6B đứng đầu điểm số trung bình với 63, trong đó LFM2.5-2.6B hiệu quả hơn nhiều trên iPhone (8,0 giây, 2,3 GB) so với Nanbeige (21,4 giây, 4,0 GB). Các thiết kế MoE như LFM2.5-8B-A1B và Ling 3.0 Tiny đáng chú ý vì chúng kích hoạt khoảng 1 tỷ tham số/token, cho phép phản hồi dưới 6 giây trên phần cứng điện thoại. Đánh giá cũng làm rõ rằng nhiều mô hình suy luận "thông minh" không phù hợp với các hạn chế về bộ nhớ và độ trễ của thiết bị di động.

Các nhà cung cấp suy luận đang cạnh tranh về thông lượng dành riêng cho tác nhân, không chỉ TPS thô: Groq 3 LPX của NVIDIA được mô tả là bổ sung một bộ tăng tốc tạo token chuyên dụng cho Vera Rubin, với tuyên bố đạt 3.400 token đầu ra/giây trên Gemma 4 31B ở ngữ cảnh 100K trong điểm chuẩn của Artificial Analysis (tóm tắt qua @kimmonismus); Groq cho biết họ sẽ là một trong những đơn vị đầu tiên triển khai nó trong sản xuất (thông báo). Riêng biệt, vLLM đã công bố các kết quả AgentX 1.0 mở rộng trên các dấu vết lập trình đa lượt thực tế, nhấn mạnh việc giảm tải KV, tái sử dụng tiền tố và phân tách prefill/decode là chìa khóa cho thông lượng tác nhân cao thay vì các chỉ số phục vụ đơn lượt cổ điển (@vllm_project).

Nghiên cứu, Bài báo và Giáo dục kỹ thuật

RL cho LLM và đào tạo gốc khung điều phối (harness-native) vẫn đang nóng: @cwolferesearch đã xuất bản một hướng dẫn học tăng cường toàn diện bao gồm các công thức cấp token so với cấp hoàn thành, các biến thể PPO/GRPO, phương pháp actor-critic, RL dựa trên rubric và RL tác nhân/mô hình thế giới. Điều này trùng hợp với sự chú ý ngày càng tăng đối với RL "harness-native" và môi trường tác nhân, được phản ánh trong các bài tổng hợp bài báo như @TheTuringPost và thảo luận về các bài báo như Agent Lightning, LEGO-RL, EnvHarness và SkillGate.

Các chủ đề nghiên cứu đáng chú ý khác: Periodic Row-wise Muon của Meta/USC mở rộng tối ưu hóa Muon cho các diffusion transformer lớn hơn bằng cách khấu hao các cập nhật Newton–Schulz đắt đỏ trong khi vẫn giữ được lợi thế so với AdamW (tóm tắt qua @iScienceLuvr); Latent Dynamics Reasoning của Adobe học các mô hình thế giới video ngoại suy từ pixel bằng cách mô hình hóa sự tiến hóa trạng thái tiềm ẩn thay vì dự đoán tương lai trực tiếp (bài báo qua @_akhaliq, ghi chú của tác giả); và Cartwheel đã báo cáo các định luật mở rộng tối ưu tính toán cho việc tạo chuyển động của con người, lập luận rằng chuyển động có thể trở thành phương thức thứ năm với hành vi mở rộng giống như Chinchilla (ra mắt).

Nội dung giáo dục đáng lưu lại: @fchollet đề xuất các chương 15–16 của Deep Learning with Python là một trong những giải thích dễ hiểu nhất về lý do tại sao dot-product attention hoạt động; @ProfTomYeh đã đăng một hướng dẫn chi tiết từng bước về self-attention; và @mervenoyann đã công bố một ngôi nhà mới cho tài liệu llama.cpp, với tài liệu sắp tới về giải mã suy đoán, lượng tử hóa và tác nhân lập trình.

Các tweet hàng đầu (theo mức độ tương tác)

1. Điểm chuẩn lập trình và lượng tử hóa Qwen 3.8 27B

“Qwen 3.8 không đạt cấp độ Opus”: Tôi đã chạy lại bài kiểm tra. (Hoạt động: 911): Hình ảnh (liên kết) cho thấy khung điều phối lập trình kiểu Deepseek/pi.dev đang được sử dụng với qwen3.8-27b ở chế độ “Plan” cho tác vụ kết xuất đại dương C#/OpenGL, hỗ trợ khẳng định của bài đăng rằng chất lượng khung điều phối ảnh hưởng mạnh đến khả năng mô hình được quan sát. Trong lần chạy lại của tác giả, cùng mô hình và prompt Qwen3.8 đó đã thất bại dưới VS Code Copilot với màn hình đen, nhưng thành công dưới khung điều phối thay thế, được cho là sử dụng phản hồi ảnh chụp màn hình và thậm chí tạo ra bộ giải mã PNG khi thị giác không được bật, tạo ra sóng, bầu trời, mặt trời và khung cảnh dưới nước trong khoảng 1 giờ trên RTX 5090 chạy bản dựng ninfer-nvfp4 với ngữ cảnh ~190k ở tốc độ ~150–180 tok/s. Những người bình luận phần lớn đồng ý rằng kết quả chứng minh khoảng cách lớn giữa các khung điều phối lập trình "lười biếng" hoặc bị cô lập và các khung điều phối tác nhân có phản hồi thực thi/ảnh chụp màn hình. Người chỉ trích ban đầu về Qwen3.8 thừa nhận kết luận trước đó là sai và bắt đầu kiểm tra lại với pi.dev, lưu ý rằng ít bị treo hơn và sử dụng ít RAM hơn so với VS Code/BYOM với llama.cpp.

Qwen3.8:27b mới trên cổng chuyển đổi 39k dòng C sang HTML / three.js một tệp (Hoạt động: 655): Một điểm chuẩn tác nhân one-shot đã cố gắng chuyển đổi một trò chơi bắn súng thủ tục C một tệp 2,1 MB / 39k dòng / ~600k token (vấn đề kỹ năng) thành HTML/Three.js một tệp, nơi nguồn lớn hơn gấp 2 lần ngữ cảnh 262.144 token có sẵn. Trên RTX 6000 Pro 96GB với vLLM, trọng số FP8 và bộ nhớ đệm FP8 KV, Claude Code + Opus 5 đã tạo ra cổng chuyển đổi "tạm ổn" duy nhất trong 21 phút / 1759 LOC, trong khi qwen3.8:27b qua hermes mất 4h18m / 949 LOC và qua codehamr (repo) mất 1h40m / 1056 LOC, cả hai đều bị đánh giá là "tệ". Những người bình luận gợi ý rằng các prompt "chuyển đổi mã này" trực tiếp khiến các mô hình tưởng tượng lại hành vi; một quy trình đáng tin cậy hơn là trước tiên tạo một trình biên dịch chuyển đổi (transpiler), lấy đầu ra ngôn ngữ mục tiêu có thể chạy được, sau đó viết lại lặp đi lặp lại từng hàm dựa trên các so sánh pixel cấp cao hoặc tham chiếu thanh ghi/trạng thái cấp thấp. Cuộc tranh luận kỹ thuật tập trung vào việc liệu kết quả cục bộ kém là do thiết kế prompt/khung điều phối, thiếu phân rã/kiểm thử hay thiết lập suy luận: nhiều người bình luận cảnh báo rằng lượng tử hóa bộ nhớ đệm FP8 KV có thể làm giảm đáng kể hiệu suất ngữ cảnh dài và đề xuất chạy lại mà không có nó. Những người khác lập luận rằng khoảng cách thời gian thực là điều dễ hiểu vì Anthropic có thể song song hóa trên nhiều phần cứng hơn, và khuyến nghị đo lường vLLM token/giây, lập kế hoạch trước, chia tệp C nguyên khối thành các mô-đun và thêm các kiểm thử hành vi trước khi chuyển đổi.

Chúng tôi đã lượng tử hóa Qwen 3.8 27B và so sánh các bản lượng tử trên RTX 6000 (Hoạt động: 448): AtomicChat đã phát hành các bản lượng tử hóa Atomic Dynamic GGUF của Qwen 3.8 27B và đánh giá chúng trên RTX PRO 6000 bằng tác vụ tạo cảnh đảo voxel trong atomic.chat, với các bản tải xuống có sẵn trên Hugging Face. Các đánh đổi về chất lượng/tốc độ so với BF16 được báo cáo là: AD-Q4_K_M 17,1 GB, 95,6% top-1, 0,0113 KLD trung bình, 67 tok/s; AD-Q5_K_M 20,2 GB, 97,3%, 0,0042, 57 tok/s; AD-Q6_K 25,0 GB, 98,7%, 0,0011, 49 tok/s; và Q8_0 28,9 GB, 98,9%, 0,0006, 50 tok/s. Các tác giả nhận thấy đầu ra cảnh định tính nhìn chung tương tự nhau giữa các bản lượng tử và khuyến nghị AD-Q6_K là lựa chọn bảo thủ, trong khi lưu ý rằng Q4 đôi khi được ưa chuộng hơn về mặt chủ quan. Những người bình luận đặt câu hỏi liệu sự khác biệt về hình ảnh phản ánh chất lượng lượng tử hóa hay phương sai lấy mẫu, với một người lưu ý rằng ở mức khoảng ≤0,01 KLD và ≥95% top-1, sự suy giảm sẽ khó nhận thấy đối với tác vụ này. Một người khác quan sát thấy rằng các ví dụ Q8_0 trông tệ hơn một cách nhất quán mặc dù có các chỉ số định lượng tốt hơn, cho thấy cần nhiều mẫu hơn nữa để tách biệt tính ngẫu nhiên của lấy mẫu, xu hướng chi tiêu token và hiệu ứng lượng tử.

Tôi đã mở khóa một GPU đào coin 800 USD thành máy chủ lập trình AI không kiểm duyệt 64GB, ngữ cảnh 256K với tốc độ 84 tok/s trên toàn bộ độ dài ngữ cảnh. (Hoạt động: 404): Bài đăng mô tả việc chuyển đổi một card đào coin NVIDIA CMP 170HX / GA100 cũ thành GPU suy luận ngữ cảnh dài 64GB HBM bằng cách vá các mô-đun kernel mở của NVIDIA với amoghmunikote/cmpunlocker tại commit fe537966, lộ ra 65.536 MiB framebuffer/BAR1 và toàn bộ khả năng tính toán trong khi vẫn bị giới hạn ở PCIe Gen2. Điểm cuối chạy twolven/Qwen3.8-27B-abliterated-AWQ-MTP, bắt nguồn từ JonathanColetti/Qwen3.8-27B-Uncensored, dưới dạng mô hình W4A16 AWQ/Marlin chỉ văn bản với INT8 lm_head/MTP drafter, bộ nhớ đệm BF16 KV, FlashInfer attention, tiền lưu trữ tiền tố (prefix caching), giải mã suy đoán MTP1, không giảm tải CPU và ngữ cảnh gốc 262.144 dưới vLLM 0.27.1. Thông lượng chỉ giải mã được báo cáo trên một card ở mức giới hạn 175W bảo thủ là 84,29 tok/s ở 1K, 74,94 tok/s ở 64K và 57,21 tok/s ở 200K; các phát hiện tiêu cực chính là INT8 KV giảm xuống ~15 tok/s gần 62K, FlashAttention giảm xuống 10,53 tok/s ở 200K, MTP sâu hơn gây hại và tiền lưu trữ tiền tố đã giảm thời gian prefill ~200K lặp lại từ ~157 giây xuống ~2,5 giây khi các tiền tố ổn định. Các bình luận hàng đầu tập trung ít hơn vào việc triển khai và nhiều hơn vào sự sẵn có trên thị trường: người dùng đặt câu hỏi nơi có thể tìm thấy CMP 170HX với giá 800 USD, lưu ý rằng giá có thể đã tăng vọt sau khi bài đăng được chú ý. Một người bình luận đã hỏi về mức tiêu thụ điện năng khi nhàn rỗi, nhưng không có câu trả lời kỹ thuật nào được đưa ra trong các bình luận được cung cấp.

2. Phần cứng AI bộ nhớ cao và Kinh tế học suy luận

Tôi đã lưu trữ Kimi K3 (2,8T tham số) sử dụng 8 B300. 92 tok/s, 190 USD mỗi triệu token (Hoạt động: 416): Hình ảnh là bảng so sánh kỹ thuật để lưu trữ suy luận 2,8T tham số lớp Kimi K3 / Kimi K2: 8× B300 với vLLM + tensor parallel 8 + MXFP4 gốc tải ~1,56 TB, đạt ~92 tok/s giải mã và ~1 giây TTFT, nhưng tốn khoảng 190 USD / 1 triệu token đầu ra. Nó tương phản với Unsloth Dynamic GGUF 1-bit UD-IQ1_S trên 8× A100-80GB qua llama.cpp, rẻ hơn theo giờ nhưng chậm hơn nhiều (~9 tok/s, 7–60 giây TTFT), mang lại ước tính tồi tệ hơn khoảng 620 USD / 1 triệu token đầu ra mặc dù vừa với 594 GB; các cờ/JSON đầy đủ được liên kết trong bài viết của tác giả. Những người bình luận lập luận rằng kinh tế học theo token là gây hiểu lầm cho một điểm chuẩn luồng đơn vì hiệu quả phục vụ thực tế phụ thuộc vào việc batching/người dùng song song, và một số người nói rằng thiết lập nên sử dụng phục vụ song song với NVFP4/SGLang hoặc vLLM. Một người bình luận cũng tranh cãi về so sánh 1-bit, tuyên bố rằng lượng tử hóa như vậy có thể làm giảm nghiêm trọng kiến thức/khả năng ngay cả khi tác giả quan sát thấy số học và văn xuôi chấp nhận được.

Cụm “The All Spark”: Nâng cấp từ 16 lên 36 DGX Sparks (Hoạt động: 1860): Người đăng đang mở rộng cụm homelab NVIDIA DGX Spark từ 16 lên 36 nút, tuyên bố có 4,6 TB bộ nhớ hợp nhất và sử dụng cấu trúc chuyển mạch FS 200 Gbps với 24× QSFP56 DAC cộng với 6× cáp breakout 400G→2×200G. Thay vì phục vụ một điểm cuối suy luận nguyên khối duy nhất, cụm được phân vùng thành các "mô-đun suy luận" được phối hợp thành một tác nhân bền bỉ thông qua Hermes cộng với một sidecar bộ nhớ tùy chỉnh, với 16 nút dành riêng cho các LLM tiên phong như "Kimi K3" và phần còn lại xử lý reranking, embeddings, tạo video/hình ảnh và khối lượng công việc âm thanh. Lý do được nêu cho việc chọn DGX Sparks thay vì các hệ thống lớp B200/B300 là các hạn chế về điện/làm mát tại homelab, các yêu cầu lưu trữ cục bộ/chủ quyền, giá trị mở rộng bộ nhớ hợp nhất, tính thanh khoản khi bán lại và khả năng bổ sung theo kế hoạch với 2 hệ thống RTX 6000 Pro cộng với các thí nghiệm suy luận phân tách Mac Studio/M5 Ultra trong tương lai. Các bình luận hàng đầu chủ yếu là các phản ứng phi kỹ thuật đối với quy mô và chi phí, ước tính thiết lập ở mức khoảng 150 nghìn USD và đùa rằng đây là một bản dựng cực đoan của người có sở thích. Một chuỗi bình luận ngụ ý rằng chủ sở hữu có nguồn lực cao bất thường, tham chiếu đến một tuyên bố trước đó về việc sở hữu một công ty hóa sinh ở Thung lũng Silicon.

Xiaomi AI Cube được công bố với băng thông bộ nhớ 1,2TB/s (Hoạt động: 2080): Xiaomi đã công bố một nguyên mẫu AI Cube được xây dựng xung quanh hệ thống 3 chip: Xuanjie O3, Xuanjie O100 và Xuanjie D100, với băng thông bộ nhớ tiêu đề được tuyên bố là 1,22 TB/s theo ITHome. Bài đăng lưu ý một sự mơ hồ về kiến trúc: D100—có vẻ bắt nguồn từ nền tảng tính toán xe điện của Xiaomi—hỗ trợ tới 160 GB RAM, trong khi băng thông 1,22 TB/s dường như liên quan đến O100, làm dấy lên khả năng con số này đề cập đến băng thông SRAM/cache trên chip thay vì băng thông DRAM/HBM bên ngoài. Những người bình luận coi đây là sự cạnh tranh mới hữu ích trong lĩnh vực silicon AI, đặc biệt là khi giá máy chủ AI của NVIDIA tăng cao và chi phí HBM đắt đỏ. Một quan sát kỹ thuật là các nền tảng tính toán xe điện hiện đại đã xuất xưởng với các nhóm bộ nhớ LPDDR5 lớn bất thường—ví dụ: Xiaomi D100 lên tới 160 GB, Xpeng Tuling lên tới 216 GB trên 3 chip—khiến ô tô có khả năng trở thành một trong những thiết bị bộ nhớ sẵn sàng cho suy luận AI lớn nhất của người tiêu dùng.

3. Kiến trúc LLM hiệu quả và Runtime nhỏ gọn

[Bài báo] ToMoE: Chuyển đổi các mô hình ngôn ngữ lớn dày đặc thành Mixture-of-Experts thông qua cắt tỉa cấu trúc động (Hoạt động: 253): ToMoE đề xuất chuyển đổi các LLM dày đặc thành các mô hình kiểu MoE bằng cách áp dụng cắt tỉa cấu trúc động có thể vi phân cho các lớp MLP, giảm các tham số hoạt động trong khi vẫn giữ lại các trọng số gốc thay vì xóa vĩnh viễn các cấu trúc (arXiv, PDF, GitHub, OpenReview). Bài báo tuyên bố rằng, ngay cả khi không cần tinh chỉnh, ToMoE vẫn vượt trội hơn các phương pháp cắt tỉa cấu trúc trước đó trên các dòng mô hình dày đặc bao gồm Phi-2, LLaMA-2, LLaMA-3 và Qwen-2.5, bằng cách thực thi ngân sách tham số hoạt động cố định thông qua định tuyến MoE thay vì cắt tỉa mang tính phá hủy. Những người bình luận cảnh báo rằng "MoEfication" kiểu ToMoE khó có thể biến một Qwen 27B dày đặc thành một MoE tham số hoạt động A3B thực sự; một ước tính kỹ thuật cho thấy thứ gì đó gần với A16B hơn với sự suy giảm chất lượng đáng chú ý, vẫn kém hơn so với việc đào tạo một kiến trúc MoE từ đầu.

Tôi đã phát triển LLM lượng tử hóa của riêng mình từ đầu, đào tạo trên 30B token, triển khai trong 60 MB (Hoạt động: 362): Tác giả đã phát hành SHADOW-250M, một LLM 250M tham số từ đầu được đào tạo trên 30B token FineWeb, lượng tử hóa xuống <2 bit cho bản triển khai ~60 MB sử dụng ~80 MB RAM và một runtime CPU nhỏ đã biên dịch được báo cáo đạt ~400 tok/s trên máy tính xách tay (GitHub, Hugging Face). Các chỉ số LM web tiếng Anh được báo cáo là 3,15 nats/token entropy chéo, 23,3 perplexity và 0,99 bit/byte; mô hình sử dụng bộ nhớ đệm KV fp16 2048 token cộng với lưu trữ đĩa lịch sử cũ hơn được nén xuống ~320 byte/token, với khả năng truy xuất được chứng minh ở độ sâu 50,6M token nhưng rõ ràng không được đào tạo cho suy luận tầm xa. Lược đồ tokenizer/embedding sử dụng mã token 512-bit cố định cho 131k token mà không có bảng embedding được đào tạo, chiếm 8,4 MB và được báo cáo đạt 0,619 Spearman trên WordSim-353 so với 0,029 cho các mã ngẫu nhiên. Các bình luận chủ yếu quan tâm đến các triển khai biên như đối thoại NPC trong trò chơi hoặc giao diện trợ lý giọng nói độ trễ thấp, và một số người khen ngợi thiết kế lưu trữ/truy xuất và embedding. Phản đối kỹ thuật chính là việc gọi đây là mô hình ngữ cảnh 100M-token là gây hiểu lầm: các nhà phê bình lập luận rằng ngữ cảnh transformer thực tế là 2k, trong khi tính năng lịch sử dài là một quy trình tìm kiếm/trích xuất dựa trên đĩa thay vì attention gốc trên ngữ cảnh khổng lồ.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Điểm tin AI: Bước tiến mới trong đánh giá tác nhân và làn sóng mô hình mã nguồn mở | AIHOT.vn