Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Trải nghiệm chạy cục bộ Qwen 2.5 27B trên Mac Studio: Hiệu năng thực tế

(giờ Việt Nam)

Tóm tắt AI

Đánh giá khả năng vận hành mô hình Qwen 2.5 27B trên Mac Studio M3 Ultra thông qua Ollama. Với định dạng lượng tử hóa Q4_K_M, mô hình đạt tốc độ phản hồi ấn tượng khoảng 14 tokens/giây.

Bản dịch AI

Run Qwen3.8 27B locally: real numbers from my Mac Studio

Trong 10 ngày qua, Qwen3.8 27B đã âm thầm chạy trên chiếc Mac Studio của tôi như một trợ lý nền. Nó tóm tắt các nguồn cấp RSS của tôi thành bản tin buổi sáng, đổi tên và lưu trữ các tệp PDF tôi quét thành định dạng có thể tìm kiếm, đồng thời xử lý bất kỳ công việc tóm tắt nào tôi giao cho nó. Những việc tầm thường. Đó chính là sức hấp dẫn: đây là mô hình chạy cục bộ (local model) đầu tiên mà tôi đủ tin tưởng để giao phó những công việc tầm thường đó.

Sau đó, vào tuần trước, mô hình này đột nhiên xuất hiện khắp nơi trên r/LocalLLaMA, các bảng tin của tôi tràn ngập các biểu đồ đánh giá hiệu năng (benchmark), và tôi nhận ra mình đang sở hữu thứ mà hầu hết các bài đăng đó còn thiếu: một cỗ máy thực sự có thể chạy nó một cách trơn tru và thời gian để đo lường nó.

Vì vậy, tôi đã thực hiện đánh giá hiệu năng. Năm lần chạy có bấm giờ cho mỗi mô hình, cùng một câu lệnh (prompt), cùng một cỗ máy, cộng thêm một thử nghiệm 1-bit khiến tôi ngạc nhiên hai lần. Dưới đây là tất cả những gì tôi đã đo lường được và ý nghĩa của nó đối với phần cứng bạn cần để tự mình chạy mô hình này.

Tóm tắt (TL;DR)

Vậy Qwen3.8 27B là gì?

Qwen3.8-27B là một mô hình dày đặc (dense model) với 27,3 tỷ tham số, sử dụng thiết kế chú ý lai (hybrid attention design) (thẻ kiến trúc trong GGUF là qwen35, điều này sẽ quan trọng sau này). Đây là mô hình đa phương thức (multimodal), tích hợp khả năng hiểu hình ảnh và video, sở hữu cửa sổ ngữ cảnh (context window) gốc lên tới 262.144 token và được phát hành theo giấy phép Apache 2.0. Thẻ mô hình chính thức cho thấy điểm số 61.7 trên SWE-bench Pro và 89.2 trên GPQA Diamond, những con số mà một năm trước chỉ có các phòng thí nghiệm tiên phong mới đạt được.

Phản ứng của cộng đồng đã bỏ qua bảng đánh giá đó. Điều khiến các chủ đề thảo luận trở nên sôi nổi là những gì mọi người đã làm với mô hình này trong tuần đầu tiên: một nhóm đã tích hợp nó vào quy trình lập trình của họ để thay thế cho một mô hình API trả phí và báo cáo rằng nó hoạt động rất ổn định, còn những người thử nghiệm OCR khẳng định chất lượng vượt trội hơn một số dịch vụ đám mây thương mại. Dòng bình luận từ bài đăng được ủng hộ nhiều nhất mà tôi nhớ mãi: “đây là mô hình cục bộ đầu tiên mang lại cảm giác không chỉ là một món đồ chơi.”

Đóng góp của tôi là phép đo duy nhất mà hầu hết các biểu đồ đó còn thiếu: mô hình này thực sự hoạt động như thế nào trên dòng chip Apple silicon mà bạn có thể mua ngày nay.

Các con số của tôi: 3.8 so với 3.6 trên cùng một cỗ máy

Cỗ máy làm việc hàng ngày của tôi là Mac Studio M3 Ultra với 256GB bộ nhớ thống nhất (unified memory), cùng một thiết bị tôi đã dùng cho hướng dẫn DeepSeek V4 Flash. Tôi đã chạy năm lần tạo văn bản có bấm giờ cho mỗi mô hình thông qua `ollama run --verbose`, với các câu lệnh kỹ thuật đa dạng, câu trả lời dài khoảng 200-500 từ và lấy trung bình các thông số. Cả hai mô hình đều là bản định lượng (quant) mặc định Q4_K_M của Ollama, cả hai đều chiếm gần chính xác 17GB trên ổ cứng.

Con số tiêu đề trước tiên: mô hình mới tạo văn bản với tốc độ bằng một nửa so với phiên bản tiền nhiệm. Cùng số lượng tham số, cùng kích thước định lượng, cùng cỗ máy. Kiến trúc chú ý lai là một điểm mới, và các nhân Metal trong Ollama rõ ràng vẫn chưa bắt kịp. Tôi kỳ vọng khoảng cách này sẽ thu hẹp khi các runtime hoàn thiện hơn; điều tương tự cũng đã xảy ra với các kiến trúc mới lạ khác.

Tuy nhiên, nó không thực sự làm tôi mất thêm thời gian. Qwen3.8 trả lời cùng các câu lệnh đó trong khoảng 1.000 token, trong khi bản 3.6 lan man tới 2.000-3.300 token. Phép tính: 2.058 token ở tốc độ 28,6 tok/s mất 72 giây, còn 955 token ở tốc độ 14,2 tok/s mất 67 giây. Chậm hơn trên mỗi token, nhưng nhanh hơn trên mỗi câu trả lời.

Trong khi nó tạo văn bản, CPU hầu như không bị ảnh hưởng, vì trên Apple silicon, quá trình suy luận (inference) chạy trên GPU thông qua Metal. Hình ảnh bìa của bài viết này chính là khoảnh khắc đó, được chụp bằng macmon khi đang tạo văn bản: GPU đạt 100% công suất, tiêu thụ 63,95W, CPU chỉ tiêu thụ 6W, và câu trả lời được truyền liên tục trong suốt quá trình.

Ứng dụng thanh menu Stats cũng cho thấy kết quả tương tự từ phía giao diện đồ họa: tất cả 60 nhân GPU đều đạt 100%, mức tiêu thụ điện năng của hệ thống chạm ngưỡng 291W:

Thử nghiệm 1-bit: "tổn thương não bộ", đã được đo lường

Chủ đề về Qwen3.8 được ủng hộ nhiều nhất trong tuần đã ca ngợi bản định lượng 1-bit của Unsloth, một tệp tin 6,7GB mà người đăng gọi một cách trìu mến là “bản định lượng tổn thương não bộ”. Một mô hình 27B nằm gọn trong dung lượng bộ nhớ của một mô hình 7B. Tôi buộc phải thử nó.

Nó chạy được và rất nhanh:

Tốc độ xử lý câu lệnh 309 tok/s, tốc độ tạo văn bản 27,2 tok/s. Nhanh gần gấp đôi tốc độ Q4 của tôi, trong khi chỉ tốn chưa đầy 8GB RAM.

Sau đó, tôi đặt câu hỏi cho nó. Khả năng nhớ dữ kiện thực sự rất ổn: nó biết Canberra là thủ đô của Úc và giải thích chính xác sự thỏa hiệp giữa Sydney và Melbourne đằng sau đó. Nhưng khi tôi yêu cầu một câu lệnh bash đơn giản, nó tạo ra một lệnh hoạt động tốt nhưng sau đó không thể ngừng nghi ngờ chính mình, tiêu tốn 400 token để xoay vòng qua các phương án thay thế mà không bao giờ đưa ra câu trả lời cuối cùng.

Điều này khớp với những gì chính Unsloth nói: tài liệu định lượng của họ khẳng định thẳng thắn rằng 1-bit không nên được sử dụng cho các tác vụ đại lý (agentic) hoặc gọi công cụ (tool-calling), và các thử nghiệm phân kỳ của họ cho thấy độ chính xác trong các tác vụ dài bị sụt giảm nghiêm trọng ở mức 1-bit trong khi kiến thức chung vẫn được bảo toàn. Mức tối thiểu mà họ đưa ra cho việc gọi công cụ là bản định lượng Q2_K_XL với dung lượng 9,8GB.

Từ kinh nghiệm của tôi: bản định lượng 1-bit là một trò vui mang lại bài học thực tế. Định lượng không làm suy giảm mô hình một cách đồng đều. Dữ kiện vẫn còn, nhưng khả năng quyết đoán thì mất đi. Nếu trường hợp sử dụng của bạn là “trả lời câu đố nhanh trên một cỗ máy yếu,” thì nó thực sự hiệu quả. Nếu là bất kỳ tác vụ đại lý nào, hãy bỏ thêm 3GB RAM để dùng bản Q2.

Mỗi bản định lượng cần bao nhiêu RAM

Unsloth công bố toàn bộ thang đo GGUF, vì vậy đây là phiên bản thực tế. Hãy dự trù dung lượng tệp cộng thêm vài GB cho ngữ cảnh và bộ chiếu hình ảnh (vision projector).

Đối với phân khúc 32GB, các thiết bị như GEEKOM A6 với Ryzen 7 6800H và 32GB RAM hoặc GMKtec M6 Ultra với DDR5 có thể chạy bản định lượng Q4 theo cách tôi đã đánh giá ở trên, chỉ là chậm hơn: tốc độ chỉ đạt vài token mỗi giây khi suy luận trên CPU thay vì 14. Tốc độ đó phù hợp với các công việc nền như của tôi; nhưng sẽ thử thách sự kiên nhẫn của bạn trong các cuộc trò chuyện tương tác.

Nếu bạn muốn chạy mô hình ở tốc độ thực mà không mua máy Apple, sự đồng thuận của cộng đồng là nền tảng Strix Halo của AMD. Dự án strix-halo-guide đã đo lường bản Q4_K_M chính thức đạt 20,4 tok/s khi tạo văn bản và 292 tok/s khi xử lý câu lệnh trên Ryzen AI Max+ 395, với các tệp CSV thô làm bằng chứng. GMKtec EVO-X2 với 64GB là lựa chọn giá trị để gia nhập nền tảng đó với giá 1.999 USD, và các cấu hình 128GB như BOSGAME M5 mở ra các hàng Q8 và BF16 trong bảng, cộng với các mô hình lớn hơn nhiều. Tôi đã đề cập toàn bộ quyết định về nền tảng đó trong bài viết về mini PC tốt nhất cho LLM cục bộ.

Một cảnh báo từ thị trường hiện tại: giá RAM vẫn đang bị thổi phồng. Một bộ kit 64GB DDR5 SODIMM hiện có giá 750-870 USD. Nếu bạn đang mua một chiếc mini PC cho công việc LLM cục bộ, việc mua máy đã lắp sẵn RAM hiện tại rẻ hơn so với việc nâng cấp sau này, điều này đi ngược lại với mọi bản năng mà tôi đã xây dựng trong hơn hai mươi năm mua máy tính.

Với người dùng GPU, quy mô sẽ khác: các báo cáo từ cộng đồng cho thấy thiết lập dual RTX 3090 đạt khoảng 60 tok/s và RTX 5090 đạt 75-140 tok/s tùy thuộc vào runtime, với các card 16GB chạy bản định lượng IQ4 cùng bộ nhớ đệm KV đã định lượng.

Cách chạy mô hình (và cái bẫy khiến tôi mất 20 phút)

Ollama là con đường ngắn nhất. Trang mô hình là ollama.com/library/qwen3.8:

Chạy nó với `--verbose` và mỗi câu trả lời sẽ kết thúc bằng một khối thống kê như thế này:

Bạn sẽ cần Ollama 0.32.12 trở lên; siêu dữ liệu của mô hình đã khai báo đây là mức tối thiểu.

Đối với llama.cpp, đây là cái bẫy. Bản llama.cpp trên Homebrew của tôi đã cũ vài tuần, và nó từ chối tệp tin một cách dứt khoát:

Kiến trúc lai cần các nhân (kernel) hiện tại. `brew update && brew upgrade llama.cpp` đã giải quyết vấn đề, và yêu cầu về phiên bản mới này áp dụng cho bất kỳ giao diện nào dựa trên llama.cpp (LM Studio, Jan, koboldcpp): nếu Qwen3.8 không tải được, hãy cập nhật runtime trước khi gỡ lỗi bất cứ thứ gì khác.

Nó thực sự làm gì cho tôi cả ngày

Các con số đánh giá hiệu năng không quan trọng bằng những gì mô hình đã làm kể từ khi tôi tải nó về: những công việc nền không hào nhoáng mà trước đây hoặc là không được thực hiện, hoặc phải gửi ra API đám mây.

Bản tin RSS buổi sáng: một công việc `launchd` thu thập các mục RSS chưa đọc của tôi qua đêm và yêu cầu Qwen3.8 nén chúng thành một bản tóm tắt để tôi đọc cùng với cà phê. Ngữ cảnh 262k có nghĩa là một tuần tin tức có thể nằm gọn trong một câu lệnh duy nhất.

Lưu trữ tài liệu quét: thư từ giấy được quét, và mô hình đọc văn bản của từng tệp PDF rồi đổi tên theo quy ước YYYY-MM-nhà cung cấp-nội dung của tôi. Khả năng thị giác có nghĩa là nó xử lý được cả những bản quét mà OCR bị lỗi.

Và khi một chủ đề trên diễn đàn dài tới 400 bình luận, nó được dán vào và tóm tắt với các quan điểm được quy cho từng người. Quá trình nghiên cứu cho bài viết này đã tạo ra một vài bản tóm tắt như vậy, cảm giác thật thú vị.

Không có việc nào trong số này quan tâm đến tốc độ token mỗi giây. Yêu cầu ở đây là một mô hình đủ thông minh để không lưu nhầm thư bảo hiểm thành thực đơn đồ ăn mang về, phần cứng tôi đã sở hữu và không có dữ liệu nào rời khỏi nhà. Đó mới là lời chào hàng thực sự cho các mô hình cục bộ vào năm 2026, và đó cũng là lập luận tương tự mà tôi đã đưa ra trong cuộc cách mạng tự lưu trữ (self-hosting): ngay cả những phụ thuộc nhỏ vào đám mây cũng đáng để thay thế.

QwenMacStudioOllamaLocalLLMAppleSilicon
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.