Tomer Tunguz Blog (phân tích VC)
92

Thủ thuật

Qwen3.8-27B: Mô hình chạy trên laptop vượt mặt các siêu AI trên bảng xếp hạng

(giờ Việt Nam)

Tóm tắt AI

Qwen3.8-27B gây ấn tượng mạnh khi dẫn đầu bảng xếp hạng Artificial Analysis với 52 điểm, vượt qua cả các mô hình mã nguồn mở khổng lồ, chứng minh sức mạnh vượt trội của các mô hình tối ưu cho thiết bị cá nhân.

Bản dịch AI

Birds Don't Fly Like Planes. Neither Does AI.

Chiếc laptop của bạn giờ đây đã có thể chạy một mô hình mạnh mẽ gần như bất kỳ thứ gì trên đám mây. Tôi đã thay thế Qwen3.8-27B vào tác nhân (agent) của mình và nó hoạt động cực kỳ hiệu quả. Con chim này bay theo một cách khác với máy bay.

Mô hình Qwen nhỏ bé này xếp hạng #1 trong số 135 mô hình, đạt 52 điểm trên Intelligence Index của Artificial Analysis, cao hơn một điểm so với GLM-5.2, mô hình mã nguồn mở tiên tiến nhất từ Z.ai với 753 tỷ tham số. Một mô hình chạy trên laptop đã đánh bại một đối thủ đám mây đẳng cấp hàng đầu có kích thước lớn hơn khoảng 28 lần.

Làm thế nào một con ong nghệ có thể đạt được khả năng bay tương tự như một chiếc máy bay chở khách? Các mô hình lớn hơn có thể lưu trữ nhiều kiến thức hơn, vì vậy chúng có thể đi thẳng đến câu trả lời, giống như một chuyên gia trong nhiều lĩnh vực khác nhau. Các mô hình nhỏ hơn không ghi nhớ được nhiều như vậy, nên chúng phải suy luận nhiều hơn, gần như từ những nguyên lý cơ bản nhất, để thu hẹp khoảng cách đó.

Tôi đã tận mắt chứng kiến điều này khi thực hiện đánh giá mô hình đám mây DeepSeek V4 so với hai mô hình cục bộ. Tôi đã so sánh chúng trên cùng một khối lượng công việc, gồm 25 tác vụ đầu tư mạo hiểm (nghiên cứu startup, tóm tắt bài báo, chuyển ngữ podcast), được chấm điểm bởi một mô hình giám khảo.

Qwen3.8-27B là mô hình dày đặc (dense): nó sử dụng mọi chương trong sách cho mọi câu hỏi. Những mô hình "đọc lướt" như DeepSeek và Qwen 3.6 35b (một mô hình cục bộ khác mà tôi đưa vào thử nghiệm) chỉ lật đến các chương liên quan cho một câu hỏi cụ thể.

Các mô hình này cung cấp câu trả lời tốt ngang nhau. Nhưng tốc độ thì khác biệt. Qwen 35b cục bộ chạy với tốc độ tối đa, nhưng cần phải suy nghĩ nhiều hơn khoảng 7,2 lần so với mô hình đám mây, cán đích sau DeepSeek 9 giây. Mô hình Qwen mới nhất nhanh hơn ba giây, và mô hình đám mây vẫn nhanh hơn 6 giây nữa.

Mô hình đám mây nhảy ngay đến câu trả lời đúng; các mô hình cục bộ thì suy ngẫm và tranh luận nội bộ với tốc độ và độ chính xác khác nhau.

Ví dụ: trong một tác vụ phân loại, mô hình 35B đã tiêu tốn 993 token để tạo ra sáu từ: “Classification: Scheduling / Action: Respond.” 1000 token suy ngẫm trước khi phản hồi giống như cú lao nhanh của chim ruồi về phía hoa kim ngân. Con ong nghệ cần 369 token suy nghĩ, bay lượn với tốc độ chỉ bằng một nửa.

Các mô hình cục bộ có thể đạt được kết quả tương tự như mô hình đám mây, nhưng chúng sẽ đi theo một lộ trình bay khác để đến đích.

Artificial Analysis xếp hạng cái tên đang dẫn đầu ở đây, Qwen3.8-27B, ở vị trí #1 trong số 135 mô hình trên Intelligence Index, đạt 52 điểm, cao hơn một điểm so với 51 điểm của GLM-5.2, một mô hình tiên phong với 753 tỷ tham số mà Z.ai đã phát hành hai tháng trước đó. Cùng trang đó xếp nó ở vị trí #23 trên 135 về số lượng token đầu ra trên mỗi tác vụ, với 160 triệu token có trọng số so với mức trung bình 43 triệu của nhóm. Xếp hạng trí tuệ và xếp hạng độ dài phản hồi biến động độc lập với nhau, và đó chính là sự đánh đổi mà toàn bộ bài viết này đề cập đến.

Lời giải thích về "khoảng cách bắt chước". Các mô hình nhỏ hơn tạo ra chuỗi suy nghĩ (chain-of-thought) trôi chảy nhưng dễ bị lệch lạc về mặt logic, bởi vì chúng có bản đồ các ví dụ đúng gần đó thưa thớt hơn để tham chiếu khi bị ép rời khỏi con đường trực tiếp dẫn đến câu trả lời. Xem thêm "Chain of Thought in Large Language Models: Elicited Reasoning or Constrained Imitation?". Tôi đã đề cập đến hình thái chung của sự đánh đổi này, đó là đánh đổi tài nguyên tính toán tại thời điểm suy luận để lấy năng lực, trong bài "When Models Learn".

Phương pháp. 25 tác vụ đầu tư mạo hiểm (nghiên cứu startup, tóm tắt bài báo, chuyển ngữ podcast) được lấy từ hàng đợi tác nhân của riêng tôi. Một mô hình giám khảo riêng biệt, deepseek-v4-pro, đã chấm điểm mù các kết quả đầu ra dựa trên tính đầy đủ, độ chính xác và tính súc tích, mỗi tiêu chí 3 điểm, tổng cộng 9 điểm. max_tokens là 4096 cho mỗi lần chạy. Cả hai mô hình cục bộ đều được phục vụ thông qua Ollama trên cùng một runtime MLX, vì vậy sự so sánh không bị nhiễu bởi sự khác biệt về runtime. Tôi đã thiết lập ngưỡng nhiễu của giám khảo bằng cách chấm điểm lại các kết quả đầu ra giống hệt nhau, cho ra sai số tuyệt đối trung bình là 0,16.

Qwen3.6-35B-A3B là mô hình 35 tỷ tham số với 3 tỷ tham số hoạt động trên mỗi token, sử dụng kiến trúc hỗn hợp chuyên gia thưa (sparse mixture-of-experts), tổng cộng 256 chuyên gia với 8 chuyên gia được định tuyến và 1 chuyên gia dùng chung hoạt động trên mỗi token. Theo thẻ mô hình của Qwen trên Hugging Face và công thức mô hình của vLLM.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Tomer Tunguz Blog (phân tích VC). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.