Thủ thuật
Qwen3.8-27B trở lại: Đâu là lý do khiến cộng đồng AI 'phát cuồng'?
(giờ Việt Nam)
Tóm tắt AI
Bài viết phân tích sức hút thực sự của mô hình Qwen3.8-27B, lý giải tại sao phiên bản này lại tạo nên làn sóng quan tâm mạnh mẽ trong cộng đồng phát triển AI.
Bản dịch AI

Tại sao lại là kích thước này? Tại sao lại là lúc này?

👦🏻 Tác giả: GaKi
🥷 Biên tập: Koji
🧑🎨 Dàn trang: NCon

Vào mùa hè năm 2026, khi các mô hình flagship với hàng nghìn tỷ tham số lần lượt ra mắt, mô hình vươn lên dẫn đầu xu hướng toàn cầu trên Hugging Face lại chỉ có 27 tỷ tham số.
Qwen3.8-27B
Hai ngày sau khi mã nguồn mở: hơn 1 triệu lượt tải xuống. Hơn 500 phiên bản lượng tử hóa (quantized) được cộng đồng đóng góp. Tổng lượt tải xuống của các mô hình liên quan đã vượt mốc 5 triệu. Các lập trình viên quốc tế đã thức trắng đêm để lượng tử hóa và đo điểm chuẩn (benchmark), gọi nó là "Opus 4.6 có thể chạy trên laptop của bạn".

Đội ngũ Qwen một lần nữa được cộng đồng ca ngợi là "vị thần mã nguồn mở đến từ Trung Quốc".
Tại sao lại là kích thước này? Tại sao lại là lúc này? Tại sao nó lại tiếp thêm năng lượng cho toàn bộ cộng đồng mã nguồn mở?
I. Qwen3.8-27B thực sự mang lại điều gì?
Qwen3.8-27B: 27 tỷ tham số, kiến trúc dày đặc (dense), quy mô nhỏ hơn gần 100 lần nhưng thiết kế tinh tế hơn. Đa phương thức (multimodal) nguyên bản, hỗ trợ hiểu hình ảnh và video. Cửa sổ ngữ cảnh (context window) gốc 262K token, có thể mở rộng lên 1 triệu thông qua YaRN. Tham số reasoning_effort mới giúp điều chỉnh độ sâu tư duy theo độ khó của tác vụ. Giấy phép Apache 2.0, miễn phí tải xuống và sử dụng.
Về hiệu năng, mô hình 27B ngang bằng hoặc vượt qua Opus 4.6 Max trên nhiều bài kiểm tra benchmark. So với phiên bản tiền nhiệm Qwen3.6-27B, nó cho thấy sự cải thiện lớn trong các kịch bản lập trình và năng suất văn phòng, thậm chí vượt qua cả Qwen3.7-Plus. Trong bài kiểm tra Agent của bên thứ ba là Agents' Last Exam, nó đạt tổng điểm 42,9%, đứng trong nhóm dẫn đầu toàn cầu.

Điều này khiến nhiều lập trình viên quốc tế suy ngẫm:
Bạn có thể chạy một mô hình cấp độ Opus 4.6 trên một GPU tiêu dùng duy nhất không?
Các lập trình viên đã trả lời bằng hành động. Một nhà phát triển AI Agent trên X lập luận rằng Qwen3.8-27B về cơ bản ngang ngửa với Opus 4.6. Paul Seekamp, đồng sáng lập một công ty an ninh mạng, cho biết mô hình này hoạt động đủ tốt để ông dự định sử dụng nó thay thế cho Claude. KOL Ripper cũng lưu ý rằng việc đạt được hiệu năng cấp độ Opus 4.6 trên một chiếc laptop khiến xu hướng mô hình nhỏ trở nên thực sự thú vị.

Sự phấn khích đó nhanh chóng chuyển thành những con số. Trong vòng hai ngày sau khi mở mã nguồn, Qwen3.8-27B đã phá mốc 1 triệu lượt tải xuống, với hơn 500 phiên bản lượng tử hóa được cộng đồng đóng góp và tổng lượt tải xuống các mô hình liên quan vượt quá 5 triệu. Tốc độ đó chính là câu trả lời.
II. Tại sao lại là kích thước này?
Tuần trước, một người dùng quốc tế @sudoingX đã đăng một câu chuyện đùa thu hút hơn một triệu lượt xem:
CEO Anthropic, Dario Amodei, sau khi biết tin Qwen3.8-27B vượt qua mô hình flagship Opus 4.6 Max của chính mình trên một chiếc GPU cũ giá 900 USD, đã khẩn cấp lên lịch họp với các nhà lập pháp để thúc đẩy việc hạn chế mã nguồn mở vì lý do an toàn. Câu chuyện đùa ngày càng được thêu dệt thêm, cuối cùng còn có thêm cảnh CEO OpenAI vội vã chạy đến hiện trường.
Những phiên bản biến tấu ngày càng trở nên vô lý hơn:
Rõ ràng đó là chuyện bịa đặt, nhưng một triệu lượt xem cho thấy rất nhiều người cảm thấy nó "không hoàn toàn phi lý—ít nhất là đáng đọc, đáng cười, đáng để châm biếm".
Điều thúc đẩy trí tưởng tượng này không phải là điểm số benchmark, mà là rào cản triển khai.
Phiên bản FP8 chính thức cần khoảng 28GB VRAM—có thể chạy trên một chiếc RTX 5090 duy nhất. Khi lượng tử hóa xuống 4-bit, nó giảm còn 14-17GB, nằm trong tầm với của một chiếc RTX 4090. Các dòng MacBook Pro hoặc Mac Studio có bộ nhớ cao cũng có thể tải nó nhờ kiến trúc bộ nhớ thống nhất (unified memory).
Cựu CTO của Autonomy, mrinal, đã chạy Qwen3.8-27B cục bộ trên một chiếc M3 Max, đạt tốc độ đầu ra 18-20 token/s và ca ngợi khả năng tuân thủ chỉ dẫn cũng như lập trình của nó.
Benchmark chứng minh "nó mạnh đến mức nào"; rào cản triển khai quyết định "ai thực sự có thể sử dụng nó". Đây là hai vấn đề khác nhau.
Qwen3.6-27B trước đó vẫn phổ biến gần nửa năm sau khi mở mã nguồn, được coi là lựa chọn hàng đầu để triển khai cục bộ trên phần cứng tiêu dùng. Chỉ riêng điều đó đã chứng minh nhu cầu đối với kích thước 27B là vững chắc như thế nào. Qwen3.8-27B đẩy khả năng lên hơn 80% cấp độ flagship trong khi vẫn giữ nguyên rào cản triển khai.
Đó là lý do tại sao nó được gọi là "kích thước vàng"—không phải mạnh nhất, nhưng là dễ sử dụng nhất.
Và việc "dễ sử dụng" được nhấn mạnh nhiều đến vậy cho thấy một vấn đề sâu xa hơn.
III. Cộng đồng mã nguồn mở thực sự cần gì?
Trong sáu tháng qua, các mô hình mã nguồn mở đã mở rộng từ hàng trăm tỷ lên hàng nghìn tỷ tham số, cửa sổ ngữ cảnh từ hàng trăm nghìn lên đến một triệu. Cụm từ "một mô hình mã nguồn mở khác" không còn gây phấn khích như trước nữa.
Một phần của sự mệt mỏi đó là có thật, và nó bắt nguồn từ một nguyên nhân gốc rễ: các mô hình siêu lớn không tương thích với phần cứng thông thường.
36Kr từng có một tiêu đề: "Nếu không có hai chiếc Rolls-Royce Phantom, đừng mơ đến việc triển khai LLM mã nguồn mở cục bộ"—rất phù hợp để giải thích cho "sự mệt mỏi với mã nguồn mở" này:
Để triển khai đầy đủ một mô hình 2,4 nghìn tỷ tham số cục bộ, bạn cần 64 chiếc NVIDIA B200, chi phí mua sắm phần cứng khoảng 30 triệu Nhân dân tệ, chưa tính tiền điện và vận hành. Một mô hình 1,6 nghìn tỷ tham số vẫn cần 16 chiếc H200, với khoản đầu tư phần cứng năm đầu tiên hơn 4 triệu và chi phí bảo trì hàng năm tốn thêm 1,2 triệu nữa.
Những con số này thực sự ngăn cản hầu hết các đội ngũ tiếp cận với các mô hình mã nguồn mở tiên tiến nhất.
Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.