Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
92

Mô hình

Ra mắt mô hình mã nguồn mở Qwen3.8-2.4T-A95B với 2,4 nghìn tỷ tham số

(giờ Việt Nam)

Tóm tắt AI

Alibaba vừa phát hành Qwen3.8-2.4T-A95B, mô hình mã nguồn mở khổng lồ với 2,4 nghìn tỷ tham số tổng và 95 tỷ tham số kích hoạt, hiện đã có mặt trên Hugging Face.

Bản dịch AI

Qwen/Qwen3.8-2.4T-A95B · Hugging Face

Kho lưu trữ này chứa trọng số mô hình và các tệp cấu hình cho mô hình đã qua huấn luyện (post-trained model) ở định dạng Hugging Face Transformers.

Các tệp này tương thích với vLLM, SGLang, TokenSpeed, v.v.

Đối với người dùng đang tìm kiếm dịch vụ suy luận (inference) có quản lý, khả năng mở rộng mà không cần bảo trì cơ sở hạ tầng, dịch vụ API Qwen chính thức được cung cấp bởi Qwen Cloud.

Cụ thể, Qwen3.8-Max là phiên bản chính thức dựa trên Qwen3.8-2.4T-A95B với nhiều tính năng hơn, chẳng hạn như hỗ trợ đầu vào thị giác (vision input) & không cần chế độ suy nghĩ (non-thinking), độ dài ngữ cảnh mặc định 1M, các công cụ tích hợp chính thức, v.v. Để biết thêm thông tin, vui lòng tham khảo Tổng quan về Qwen3.8-Max.

Tiếp nối sự đón nhận rộng rãi của cộng đồng đối với dòng Qwen3.5 và Qwen3.6, chúng tôi vui mừng giới thiệu Qwen3.8, thế hệ mạnh mẽ nhất trong dòng mô hình mở Qwen tính đến thời điểm hiện tại.

Lần đầu tiên, Qwen3.8 mang một mô hình đẳng cấp Qwen-Max đến với bản phát hành mở. Được xây dựng trên nền tảng kiến trúc của Qwen3.5, Qwen3.8 mang lại những cải tiến đáng kể trong lập trình, công việc chuyên môn, nghiên cứu và các tác vụ đại lý (agentic tasks) dài hạn. Ngoài việc trả lời các câu hỏi khó hơn, Qwen3.8 được thiết kế để thực hiện các tác vụ phức tạp, đa bước đến khi hoàn thành với độ tin cậy cao hơn.

Các điểm nổi bật của Qwen3.8

Qwen3.8 có các cải tiến sau:

Để biết thêm chi tiết, vui lòng tham khảo bài viết trên blog của chúng tôi về Qwen3.8-Max.

Tổng quan về mô hình

Kết quả đánh giá (Benchmark)

1. Kết quả Fable5 có thể bao gồm các phương án dự phòng. 2. Terminal Bench 2.1: Được đánh giá bằng Claude Code (avg@10), sử dụng thời gian chờ 5 giờ và max_tokens=131,072. Đối với tất cả các mô hình khác, chúng tôi báo cáo điểm số công bố tốt nhất trên các bộ đánh giá: Claude Opus 4.8 và Claude Fable 5 với Terminus 2 từ Artificial Analysis (https://artificialanalysis.ai/evaluations/terminalbench-v2-1); GPT-5.6 Sol với Codex (https://openai.com/index/previewing-gpt-5-6-sol/). 3. SWE-bench Pro: Được đánh giá bằng bộ đánh giá Claude Code, temp=1.0, top_p=0.95 và cửa sổ ngữ cảnh 256K. Các tác vụ có vấn đề đã được sửa và tất cả các mô hình cơ sở đều được đánh giá trên bộ tiêu chuẩn đã tinh chỉnh. 4. DeepSWE 1.1: Được đánh giá bằng bộ đánh giá Claude Code và mini-SWE-agent, temp=1.0, top_p=0.95 và cửa sổ ngữ cảnh 256K. Chúng tôi báo cáo điểm số cao nhất trong cả hai bộ đánh giá; đáng chú ý là Qwen3.8-Max đạt kết quả tốt nhất trên Claude Code. 5. NL2Repo-Bench: Được đánh giá bằng bộ đánh giá Claude Code. Để ngăn chặn việc "hack" phần thưởng, chúng tôi vô hiệu hóa các lệnh Bash cố gắng truy cập vào kho lưu trữ cụ thể, chẳng hạn như pip download, pip install và git clone. 6. FrontierSWE: Được đánh giá bằng bộ đánh giá Claude Code. Tất cả các kết quả MEAN@5 khả dụng khác được lấy từ bảng xếp hạng FrontierSWE chính thức (https://www.frontierswe.com) tính đến ngày 3 tháng 8 năm 2026. Điểm thống trị được tính toán lại từ điểm thô bằng cách sử dụng tập lệnh đánh giá chính thức. "--" cho biết không có kết quả MEAN@5 chính thức nào khả dụng vào ngày đó. 7. MLS-Bench-Lite: Được đánh giá bằng Claude Code sử dụng thời gian chờ 5 giờ và max_tokens=131,072. Tất cả điểm số của các mô hình khác được lấy từ bảng xếp hạng chính thức. 8. PaperBench: Được đánh giá trong thiết lập BasicAgent ở chế độ Code-Dev, được đánh giá bởi Claude Opus 4.6 và lấy trung bình qua 3 lần chạy (tối đa 12 giờ mỗi lần chạy). 9. AndroidBench: Được đánh giá trên tập con công khai gồm 95 tác vụ, báo cáo điểm avg@3. 10. QwenSWEBench: Bộ đánh giá lập trình nội bộ để đánh giá khả năng kỹ thuật phần mềm của các mô hình. Được đánh giá bằng bộ đánh giá Claude Code. Báo cáo avg@3 với thời gian chờ 8 giờ, max_tokens=32,768, temperature=1.0 và cửa sổ ngữ cảnh 256K-token. 11. QwenQoderBench: Bộ đánh giá lập trình nội bộ để đánh giá trải nghiệm người dùng trên Qoder. Được đánh giá bằng bộ đánh giá Claude Code. Báo cáo avg@5 với thời gian chờ 6 giờ, max_tokens=32,768, temperature=1.0 và cửa sổ ngữ cảnh 256K-token. 12. QwenReactBench: Bộ đánh giá xây dựng dự án React nội bộ sử dụng Claude Code làm bộ đánh giá, song ngữ (Anh/Trung), 7 danh mục; tự động kết xuất + đánh giá đa phương thức; xếp hạng BT/Elo. 13. QwenSVGBench: Bộ đánh giá tạo mã SVG nội bộ; song ngữ (Anh/Trung), tự động kết xuất + đánh giá đa phương thức; xếp hạng BT/Elo. 14. CoWorkBench: Bộ đánh giá làm việc nhóm nội bộ để đánh giá các tác vụ dài hạn trong các lĩnh vực khoa học máy tính, tài chính, luật, y tế và các lĩnh vực năng suất khác. 15. SkillsBench: Được đánh giá trên bộ tiêu chuẩn công khai SkillsBench v1.1 qua 87 tác vụ, báo cáo điểm trung bình qua ba lần chạy mỗi tác vụ. Opus 4.8 và Fable 5 được đánh giá trên Claude Code; GPT-5.6 Sol được đánh giá trên Codex; dòng Qwen được đánh giá trên OpenCode. Tất cả kết quả đều từ thử nghiệm của riêng chúng tôi. 16. Automation-Bench: Được đánh giá trên tập con công khai gồm 600 tác vụ. 17. WideSearch: Được đánh giá bằng bộ đánh giá Claude Code cho các mô hình bên ngoài và bộ đánh giá Qwen-Agent cho mô hình của chúng tôi, báo cáo item-F1 trung bình qua bốn lần chạy. 18. $OneMillion-Bench: Được đánh giá bằng gemini-3.1-pro-preview. 19. PLawBench: Được đánh giá bằng gemini-3.1-pro-preview. 20. Các ô trống (--): Điểm số chưa khả dụng hoặc không áp dụng.

Bắt đầu nhanh

Để tích hợp hợp lý, chúng tôi khuyên bạn nên sử dụng Qwen3.8 thông qua API.

Triển khai Qwen3.8

Hiệu suất suy luận và thông lượng thay đổi đáng kể giữa các khung làm việc (frameworks). Chúng tôi khuyên bạn nên sử dụng các phiên bản khung làm việc mới nhất để đảm bảo hiệu suất và khả năng tương thích tối ưu. Đối với khối lượng công việc sản xuất hoặc các kịch bản có thông lượng cao, các công cụ phục vụ chuyên dụng như SGLang, vLLM hoặc TokenSpeed được khuyến nghị.

Qwen3.8 có thể được triển khai với các khung suy luận phổ biến, ví dụ:

Sử dụng API

Qwen3.8-2.4T-A95B là mô hình chỉ văn bản yêu cầu chế độ suy nghĩ (thinking mode) cho tất cả các tương tác. Đầu vào đa phương thức không được hỗ trợ và không thể tắt chế độ suy nghĩ. Mọi phản hồi sẽ tự động bắt đầu bằng lập luận được đặt trong thẻ <think>\n...\n</think>\n\n trước khi đưa ra kết quả cuối cùng.

Chúng tôi khuyên bạn nên sử dụng bộ tham số lấy mẫu (sampling parameters) sau đây để tạo phản hồi:

Xin lưu ý rằng việc hỗ trợ các tham số lấy mẫu thay đổi tùy theo khung suy luận.

Qwen3.8 đi kèm với hỗ trợ chính thức cho reasoning_effort, có thể được sử dụng để điều chỉnh độ sâu suy luận và kiểm soát chi phí:

Ngoài ra, preserve_thinking được bật theo mặc định cho tất cả các khối lượng công việc để có trải nghiệm tốt nhất ngay khi sử dụng.

API Chat Completions

API Chat Completions có thể được sử dụng với hầu hết các khung suy luận, cũng như Qwen Cloud. Trước khi bắt đầu, hãy đảm bảo rằng OpenAI Python SDK đã được cài đặt và khóa API cũng như URL cơ sở API đã được cấu hình, ví dụ:

Nếu bạn đang sử dụng API từ Qwen Cloud, ngoài việc thay đổi mô hình, vui lòng truyền extra_body={"enable_thinking": True, "preserve_thinking": True} thay vì extra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}.

Các phương pháp hay nhất

Để đạt được hiệu suất tối ưu, chúng tôi khuyên dùng các cài đặt sau:

Tham số lấy mẫu:

Độ dài đầu ra đầy đủ: Để tối ưu hóa hiệu suất trên các tác vụ đại lý, chúng tôi khuyên bạn nên phân bổ độ dài đầu ra đủ lớn để mô hình có thể tạo ra các phản hồi chi tiết và toàn diện. Đối với các khung hỗ trợ giới hạn token riêng biệt cho suy luận nội bộ và đầu ra cuối cùng, chúng tôi đề xuất cấu hình sau trong phạm vi ngữ cảnh 1M:

Các cài đặt này cung cấp khả năng cần thiết cho việc suy luận phức tạp đồng thời đảm bảo không gian rộng rãi cho các sản phẩm cuối cùng chất lượng cao.

Trích dẫn

Nếu bạn thấy công trình của chúng tôi hữu ích, đừng ngần ngại trích dẫn.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.