Hacker News: AI bài nổi bật
92

Thủ thuật

Đánh giá Mac Studio M5 Ultra: Cỗ máy trong mơ cho AI cục bộ, vượt xa M3 Ultra và RTX 5090?

(giờ Việt Nam)

Tóm tắt AI

Trải nghiệm thực tế Mac Studio M5 Ultra với 256GB RAM cho thấy đây là thiết bị lý tưởng để vận hành các AI agent cục bộ, mang lại hiệu năng vượt trội so với thế hệ tiền nhiệm và đối thủ RTX 5090.

Bản dịch AI

M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents

Trong vài ngày qua, tôi đã thử nghiệm chiếc M5 Ultra Mac Studio (hiện là dòng máy cao cấp nhất) với 256 GB RAM.

Tôi xin đi thẳng vào vấn đề: M5 Ultra Mac Studio là cỗ máy trong mơ dành cho các AI agent chạy cục bộ (local). Chiếc máy tính này cho phép vận hành các trợ lý cá nhân dựa trên các mô hình cục bộ với hiệu suất tuyệt vời mà không tốn thêm chi phí đám mây. Nếu bạn từng hoài nghi về việc thử nghiệm OpenClaw hay Hermes Agent với các mô hình cục bộ vì cho rằng chúng không bao giờ đạt được trí thông minh và tốc độ như các mô hình trên đám mây, thì chiếc Mac này sẽ thay đổi suy nghĩ đó của bạn.

Kể từ thứ Năm tuần trước, tôi đã so sánh chiếc Mac Studio này với phiên bản tiền nhiệm là M3 Ultra với 512 GB RAM, cũng như chiếc PC chơi game để bàn của tôi có gắn card RTX 5090. Xét về kích thước, giá thành, hiệu suất tản nhiệt – chưa kể đến cách tiếp cận bộ nhớ thống nhất (unified memory) của Apple – M5 Ultra Mac Studio đã thay đổi hoàn toàn tư duy của tôi về các mô hình chạy cục bộ và những gì chúng có thể làm được hiện nay. Tất nhiên, RTX 5090 vẫn có lợi thế hơn M5 Ultra nhờ băng thông bộ nhớ cao hơn. Nhưng xét đến kích thước cồng kềnh của bộ PC, cũng như nhiệt lượng và tiếng ồn mà nó tạo ra, tôi vẫn ưu tiên chọn M5 Ultra Mac Studio hơn. Hơn nữa, đây còn là một chiếc Mac với hệ điều hành đẹp mắt, hoạt động ổn định cùng hệ sinh thái ứng dụng phong phú. (Các fan của Windows, tôi rất tiếc, nhưng phần mềm của Microsoft sẽ không bao giờ nhận được sự đồng cảm từ tôi.)

Như tôi sẽ khám phá trong bài viết này, việc chạy mô hình Qwen3.8-Flash-Next mới nhất trên M5 Ultra Mac Studio mang lại trải nghiệm rất mượt mà và nhanh chóng, đến mức tôi đã đặt nó làm mặc định cho cả Open Minis trên iOS và Hermes Agent. Đúng vậy: các trợ lý cá nhân mà tôi sử dụng nhiều nhất – thực tế là còn nhiều hơn cả Siri AI – giờ đây hoàn toàn được vận hành bởi một mô hình chạy cục bộ trên Mac Studio. Hơn nữa, nhờ GPU nhanh hơn và băng thông bộ nhớ cao hơn của M5 Ultra, các agent này bắt đầu phản hồi nhanh hơn, duy trì tốc độ ổn định ở các cửa sổ ngữ cảnh (context windows) lớn hơn và có thể chạy các vòng lặp đa lượt (multi-turn loops) dài mà không bị chậm chạp khi phiên làm việc kéo dài. Nhờ đó, tôi cũng đã sử dụng các mô hình cục bộ trong ứng dụng Codex trên Mac của mình – dưới dạng các luồng chính hoặc các subagent được điều phối bởi GPT-6 Astra – và tôi đã có những trải nghiệm tuyệt vời.

Tôi cần lưu ý trước rằng tôi không phải là một nhà phát triển AI chuyên nghiệp: tôi không huấn luyện hay tinh chỉnh (fine-tune) các mô hình. Tôi chỉ là một người thích mày mò, và đến nay tôi đã chơi với các mô hình AI cục bộ được hơn một năm. Mùa hè này, tôi đã dồn toàn lực vào việc sử dụng AI cục bộ cho một dự án lớn mà tôi đang thực hiện, điều mà tôi sẽ giải thích trong phần tiếp theo.

Mục tiêu của tôi với bài viết này là cung cấp cho bạn sự kết hợp giữa hai yếu tố: các con số và hình ảnh trực quan dựa trên (nhiều) bài kiểm tra mà tôi đã thực hiện trong suốt bốn ngày, cùng với lời giải thích về các trường hợp sử dụng thực tế của tôi đối với AI cục bộ áp dụng vào quy trình làm việc và cách tôi hoàn thành công việc cho MacStories.

Hãy cùng bắt đầu.

Tại sao lại là AI cục bộ?

Trước hết, hãy giải quyết vấn đề lớn nhất: tại sao phải bận tâm đến AI cục bộ khi các mô hình tiên phong trên đám mây tốt hơn và thường nhanh hơn?

Đó là một câu hỏi hợp lý. Bạn cần phần cứng đắt tiền để chạy các mô hình này, và đến khi bạn thu hồi được vốn đầu tư, bạn có thể đã sử dụng gói đăng ký Anthropic đắt đỏ nhất trong vài năm, vẫn tiết kiệm tiền hơn và nhận lại hiệu suất tốt hơn.

Mỗi người sẽ có những câu trả lời khác nhau cho câu hỏi này. Một số người có thể nói họ sử dụng mô hình cục bộ vì quyền riêng tư: họ thà dựa vào trí thông minh cục bộ cho các dữ liệu và tài liệu nhạy cảm còn hơn là tải bất cứ thứ gì lên đám mây bên ngoài. Những người khác có thể lập luận rằng đơn giản là vì nó thú vị – và tôi không phủ nhận điều đó. Đối với một số người, đó là nhiệm vụ liên quan đến công việc: nếu bạn là một nhà phát triển AI, việc có một thiết lập cục bộ tuyệt vời để huấn luyện các adapter của riêng mình hoặc tinh chỉnh mô hình là điều hợp lý.

Đối với tôi, hành trình đến với AI cục bộ được đặc trưng bởi sự kết hợp giữa yếu tố "thú vị, tại sao không?" cùng với những cân nhắc về quyền riêng tư và chi phí.

Như tôi sẽ chia sẻ với các thành viên Club MacStories vào cuối tuần này, thiết lập nghiên cứu và viết lách của tôi cho bài đánh giá iOS và iPadOS 27 mùa hè này đã được hỗ trợ và hiện thực hóa nhờ AI cục bộ. Quay lại tháng 6, tôi đã tạo một ứng dụng nội bộ tên là Desk để sắp xếp hàng trăm ghi chú, phiên làm việc, tài liệu PDF và các trang web đã cắt liên quan đến iOS và iPadOS 27, cũng như các chương của bài đánh giá. Đến cuối quá trình, dự án bao gồm 310 tài liệu. Trong Desk, một đội ngũ các agent – tất cả đều dựa trên DeepSeek V4 Flash, cộng với olmOCR cho các tệp PDF – đã chạy 24/7 trong 99 ngày để thực hiện các tác vụ sau:

Khi bắt đầu làm việc với thiết lập này vào đầu tháng 6, tôi nhanh chóng nhận ra rằng việc dựa vào API của OpenAI hoặc Anthropic cho loại tác vụ chạy nền liên tục này sẽ… tốn kém đến mức không thể chấp nhận được. Vì vậy, tôi đã chuyển sang AI cục bộ, và kết quả là bài đánh giá iOS và iPadOS 27 mà bạn có thể đọc trên MacStories. Tất cả đều do tôi viết theo cách thủ công truyền thống. Nhưng toàn bộ kho dữ liệu nghiên cứu, liên kết sâu giữa các ghi chú và theo dõi các tính năng mới cũng như các bản beta đều được thực hiện bởi các agent của tôi, chạy cục bộ trên Mac Studio với tổng chi phí là 0 đô la.

Nếu bạn không thấy điều đó hay ho, hoặc không thấy đây là một khái niệm mạnh mẽ để khám phá, thì bài viết này có lẽ không dành cho bạn – và tôi hiểu điều đó. Làm việc với các mô hình này rất phức tạp, và đó không phải là điều tôi khuyên dùng cho những ai (một cách chính đáng) chỉ muốn trả 20 đô la để sử dụng Claude Cowork. Loại thiết lập này, theo định nghĩa, là đỉnh cao của các quy trình làm việc AI ở thời điểm hiện tại.

Tuy nhiên, nếu bạn thuộc nhóm còn lại và nghĩ rằng những thứ này thật thú vị… hãy để tôi nói cho bạn biết: M5 Ultra Mac Studio là một bước nhảy vọt về hiệu suất cho các mô hình cục bộ được vận hành bởi MLX, và tôi có một vài ví dụ để chứng minh điều đó.

Bước nhảy vọt cho việc xử lý và tạo prompt

Như bạn có thể đã thấy từ thông báo và bài viết ban đầu của tôi, M5 Ultra Mac Studio trông giống hệt mẫu M3 Ultra mà nó thay thế, nhưng nó đi kèm với kiến trúc Apple silicon hoàn toàn mới sử dụng UltraFusion để kết nối hai chip M5 Max dual-die nhằm tạo thành kiến trúc quad-die, đây là lần đầu tiên trong hệ sinh thái Apple. Đối với các khối lượng công việc AI cục bộ, có hai lĩnh vực chúng ta cần chú ý (và tôi đã theo dõi kể từ khi đưa tin về M5 iPad Pro cho AI cục bộ vào năm ngoái): GPU và băng thông bộ nhớ.

M5 Ultra sở hữu GPU thế hệ tiếp theo với 80 nhân, mỗi nhân đều có bộ tăng tốc thần kinh (Neural Accelerator) giúp tăng hiệu suất tính toán GPU cho AI lên tới 4,5 lần so với M3 Ultra. Về bộ nhớ, kiến trúc bộ nhớ thống nhất của Apple vẫn đạt mức tối đa 512 GB như trước (mặc dù mẫu đó sẽ ra mắt vào cuối tháng 10), nhưng băng thông đã tăng từ 819 GB/s lên 1,2 TB/s, cao hơn 50% so với M3 Ultra.

Với những con số này, tôi bắt đầu thử nghiệm M5 Ultra so với M3 Ultra với 512 GB RAM và RTX 5090 của mình. Tôi sẽ chia sẻ thêm chi tiết về thử nghiệm bên dưới, nhưng tóm tắt ngắn gọn là: với M5 Ultra, bạn mất ít thời gian hơn đáng kể để chờ mô hình đọc prompt và bắt đầu tạo phản hồi; và khi nó bắt đầu trả lời, văn bản xuất hiện nhanh hơn nhiều so với trên M3 Ultra. Chỉ riêng hai cải tiến này đã làm cho chiếc máy trở nên khả thi cho các vòng lặp agent hiện đại đòi hỏi sự lặp lại nhanh chóng với mô hình và kết quả là các cửa sổ ngữ cảnh lớn hơn.

Trong trải nghiệm hàng ngày của tôi với các agent chạy trên M5 Ultra, những cải tiến về token prefill (tốc độ xử lý prompt) và tạo token là những thay đổi tôi nhận thấy ngay lập tức. Khi so sánh một mô hình chạy trên M3 Ultra và M5 Ultra song song với Open Minis trên iOS, M5 Ultra nhanh hơn trung bình khoảng 70% so với M3 Ultra trong việc tạo phản hồi. Như chúng ta sẽ thấy sau này, việc một mô hình như Qwen3.8-Flash-Next đạt tốc độ hơn 100 token/giây với các prompt ngắn và vẫn viết ở tốc độ 60 đến 85 token/giây với 64K đến 256K ngữ cảnh phía sau không phải là chuyện đùa, và nó cho phép kiểu tương tác qua lại giữa bạn và mô hình trở nên rất mượt mà, đặc biệt là khi có sự tham gia của các tool call.

Tuy nhiên, tôi ấn tượng hơn với hiệu suất đạt được trong token prefill. Khi bạn sử dụng các trợ lý agent như Hermes hoặc Codex, mô hình nhận được cả một khối hướng dẫn bao gồm system prompt, cá nhân hóa người dùng, bộ nhớ phiên làm việc, mô tả kỹ năng, mô tả MCP, v.v. Một số agent xử lý tốt hơn những agent khác trong việc rút gọn các hướng dẫn, nhưng nhìn chung, bất cứ khi nào bạn sử dụng một agent hiện đại, bạn không bắt đầu với một cửa sổ ngữ cảnh trống rỗng. Vì lý do này, tôi chưa bao giờ có thể sử dụng ổn định các mô hình cục bộ với làn sóng agent mới này: chúng hoạt động, nhưng tôi phải nhìn chằm chằm vào màn hình trống và biểu tượng tải trong một lúc trước khi mô hình bắt đầu tạo phản hồi. Và ở mỗi vòng lặp, hiệu suất lại tệ hơn (do ngữ cảnh phiên làm việc lớn hơn), và tôi lại phải chờ đợi thêm.

Trong các thử nghiệm của tôi, tốc độ xử lý prompt tăng trung bình 150% so với M3 Ultra – cải thiện khoảng 2,5 lần so với thiết lập trước đây của tôi. Chỉ riêng thay đổi này đã làm cho các mô hình cục bộ trở thành lựa chọn vững chắc trong các ứng dụng như Open Minis và Hermes Agent. Khi tôi yêu cầu Flash-Next trên M5 Ultra lấy các tác vụ trong tuần của mình với RemCTL, tôi không phải chờ đợi agent xử lý prompt của mình và của Open Minis: chỉ trong vài giây, nó bắt đầu làm việc bằng cách suy luận, thực hiện các tool call, v.v. Và khi tôi làm việc trên một dự án lớn, chẳng hạn như bản demo voxel Colosseum bên dưới, mô hình có thể xử lý các vòng lặp đa lượt một cách nhanh chóng, điều phối các subagent và thực hiện tất cả ở tốc độ 60 đến 85 token mỗi giây khi luồng công việc dài hơn.

Tôi rất tin tưởng vào các trợ lý có thể thực hiện các tác vụ một cách chủ động bên cạnh việc trả lời câu hỏi, nhưng để cảm thấy thoải mái khi sử dụng, chúng phải nhanh. Trong vài tháng qua, tôi đã thử nghiệm một số nhà cung cấp đám mây "boutique" với Open Minis: Inco, phục vụ Kimi K3 ở tốc độ hơn 300 TPS; Cerebras, với Qwen3.8-27B ở tốc độ đáng kinh ngạc 1.800 TPS; và các dịch vụ như Fireworks và Baseten, mỗi dịch vụ đều vượt qua rào cản 150 TPS. Tất cả các nhà cung cấp đó đều mang lại cảm giác cực kỳ tốt khi sử dụng trong Open Minis và Hermes, nhưng chúng rất đắt đỏ (tôi đã tiêu tốn 20 đô la tín dụng Inco chỉ trong 10 phút vào tuần trước), và tất nhiên, dữ liệu của tôi đang đi đến… đâu đó khi tôi sử dụng chúng. Khi tôi khởi chạy Open Minis với Flash-Next và bộ sưu tập Apple CLI mà tôi đang tạo, mọi thứ vẫn nằm cục bộ, bên trong một chiếc máy tính mà tôi có thể nhìn thấy và khởi động lại bất cứ khi nào tôi muốn.

Quan trọng nhất: một mô hình như Flash-Next có thể đủ "nhỏ" để chạy ở các mức lượng tử hóa (quantization) cao hơn trên M5 Ultra 256 GB (tôi có thể chạy 5-bit hoàn toàn trong RAM; 6-bit và 8-bit có thể chuyển các bảng n-gram của chúng sang SSD với kiến trúc mới này) nhưng cũng đủ thông minh để duy trì các luồng dài và nhiều tool call của agent.

Theo sở thích của tôi, lượng tử hóa 5-bit đạt điểm ngọt (sweet spot) trên phiên bản Ultra này với sự cân bằng giữa trí thông minh, hiệu suất và mức tiêu thụ bộ nhớ. Nhưng tôi đã biết rằng, nếu có cơ hội thử nghiệm M5 Ultra 512 GB, tôi sẽ thực sự quan tâm đến việc đo lường hiệu suất của bản 8-bit mà không cần chuyển sang SSD.

Tôi chưa dành nhiều thời gian để mày mò việc chuyển các tác vụ lập trình sang mô hình cục bộ, nhưng tôi đã thực hiện một vài thí nghiệm thú vị. Với hiệu suất như thế này, và đặc biệt là khả năng xếp chồng lên đến ba phiên Flash-Next đồng thời với các subagent trong oMLX với 256 GB RAM (sẽ nói thêm sau), giờ đây tôi có thể cân nhắc một cách thực tế việc giao các tác vụ lập trình đơn giản cho một mô hình cục bộ và để các mô hình đám mây tiên phong xem xét công việc của chúng. Ví dụ, tôi đã có thể thiết lập Qwen3.8-Flash-Next trong Codex, cho phép tôi sử dụng mô hình cục bộ với Codex harness. Điều này có nghĩa là tôi có thể để một mô hình GPT chính điều phối các subagent cục bộ, để Flash-Next điều phối các subagent của riêng nó, hoặc thậm chí chỉ sử dụng mô hình từ điện thoại của mình với Codex Remote trên iOS.

Tôi rất tò mò muốn đọc thêm về chủ đề này từ các nhà phát triển thực thụ, những người sắp sở hữu M5 Ultra. Với việc các mô hình mã nguồn mở hiện đang vượt trội hơn trên phần cứng tiêu dùng so với những gì được coi là "tiên phong" khoảng 10 tháng trước, và với hiệu suất trên M5 Ultra hiện làm cho việc lập trình bằng agent trở nên khả thi, tôi nghĩ chúng ta sẽ sớm thấy những thí nghiệm hấp dẫn từ cộng đồng MLX.

M5 Ultra so với RTX 5090

Như bạn sẽ thấy từ các hình ảnh trực quan sau này trong bài viết, NVIDIA RTX 5090 vẫn nhanh hơn Apple M5 Ultra mặc dù chỉ có 32 GB VRAM "ít ỏi", vì hai lý do khác nhau.

Tốc độ xử lý prompt được quyết định bởi khả năng tính toán: mô hình đọc toàn bộ prompt trong một phép nhân ma trận khổng lồ, đó chính xác là công việc mà các nhân Tensor của NVIDIA được xây dựng để thực hiện. Các bộ tăng tốc thần kinh mới của Apple (một trong mỗi 80 nhân GPU của M5 Ultra) thu hẹp khoảng cách, nhưng không thể san lấp hoàn toàn. Với prompt 6.000 token, M5 Ultra đọc ở tốc độ ~1.700 tok/s; 5090 đạt con số đáng kinh ngạc ~3.000 với mô hình Qwen mà tôi đã thử nghiệm trong LM Studio. Mặt khác, việc tạo token phụ thuộc vào băng thông: mô hình viết từng token một và lấy toàn bộ mô hình ra khỏi bộ nhớ cho mỗi token, vì vậy băng thông 1,79 TB/s của 5090 so với 1,2 TB/s của M5 Ultra mang lại cho nó lợi thế ổn định khoảng 25% ở mọi kích thước prompt. Điều mà 5090 không có là bộ nhớ: ở mức 256K, 5090 chỉ kết thúc với bộ nhớ đệm attention 8-bit. 32 GB VRAM chỉ có giới hạn nhất định.

Tuy nhiên, có hai vấn đề với sự so sánh này. Thứ nhất, mặc dù 5090 vẫn vượt trội hơn M5 Ultra với các mô hình nhỏ hơn, nhưng việc thiếu bộ nhớ thống nhất có nghĩa là tôi bị giới hạn ở 32 GB VRAM trong GPU nếu muốn chạy mô hình ở tốc độ cực nhanh. Ngay khi tôi muốn chạy bất cứ thứ gì vượt quá 32 GB (chẳng hạn như các mức lượng tử hóa Flash-Next cao hơn đã đề cập), 5090 phải chuyển các lớp mô hình qua PCIe sang RAM hệ thống (chậm hơn nhiều), và đó không phải là cách làm việc hiệu quả.

Thứ hai, PC chơi game của tôi rất lớn so với Mac Studio đặt trên bàn – và tôi đang dùng một thùng máy nhỏ gọn Lian-Li A3. Chưa kể đến việc nó ồn và nóng như thế nào khi tôi chạy các mô hình cục bộ ở cửa sổ ngữ cảnh lớn: khi tôi bước vào văn phòng sau khi một số bài kiểm tra chạy xong, không khí nóng hơn hẳn so với phần còn lại của căn hộ. Ngược lại, chiếc Mac Studio "nhỏ bé" trên bàn làm việc của tôi chỉ hơi ấm khi chạm vào, nhưng nó cũng yên tĩnh hơn đáng kể so với 5090, quạt không quay nhanh hay ồn ào, và quan trọng nhất, nó cho phép tôi chạy các mô hình lớn hơn như GLM-5.3-Flash cục bộ với hiệu suất ổn nhờ bộ nhớ thống nhất của Apple silicon. Trong quá trình sử dụng hàng ngày, khi tôi chạy Flash-Next oQ4e liên tục, tôi không bao giờ nghe thấy tiếng quạt của Studio trên bàn trừ khi tôi áp tai trực tiếp vào máy tính.

Đánh giá dựa trên những tiến bộ mà Apple đã đạt được trong những năm gần đây, tôi sẽ không ngạc nhiên nếu thấy một chiếc M7 Ultra vượt qua băng thông bộ nhớ của 5090 trong tương lai gần. Nhưng đó là câu chuyện của một dịp khác.

Một lưu ý về thử nghiệm

Cuối cùng, trước khi chúng ta đi sâu vào các con số và biểu đồ thô: tôi đã thử nghiệm mọi thứ như thế nào?

Các bài kiểm tra tự động được thực hiện với một bộ công cụ thử nghiệm (testing harness) mà tôi đã xây dựng với GPT-6 Astra, điều phối nhiều phiên bản Codex trên Mac Studio M3 Ultra và M5 Ultra của tôi, cũng như PC của tôi với ứng dụng Codex cho Windows và Computer Use. Trên macOS, tôi chọn oMLX (phiên bản 0.7.0.dev2) làm backend cục bộ cho các mô hình MLX, và chạy Qwen3.8-Flash-Next-oQ4e-mtp, GLM-5.3-Flash-MLX-mixed-4_8bit, và Qwen3.8-27B-oQ4e-mtp trên macOS Golden Gate 27.0 cho phần lớn các bài kiểm tra của mình. Trên Windows, tôi sử dụng LM Studio và Qwen3.8-27B-GGUF với runtime CUDA 12 và với tất cả 66 lớp được chuyển sang GPU cho các bài kiểm tra toàn GPU, cộng với các bài kiểm tra riêng biệt chia mô hình giữa GPU và RAM hệ thống.

Bên cạnh các thí nghiệm riêng biệt với các subagent gốc của Open Minis, tôi đã sử dụng một bộ công cụ thử nghiệm tùy chỉnh để đo lường các yêu cầu đồng thời và quy trình làm việc liên quan đến một mô hình chính và nhiều mô hình hỗ trợ, với oMLX phục vụ các mô hình Mac và LM Studio phục vụ mô hình Windows.

Các con số được Astra thu thập trong suốt bốn ngày, và sau đó được trực quan hóa bởi Claude Fable 5.1 và Opus 5 sử dụng tính năng Projects sắp ra mắt của Anthropic, tính năng mà tôi đã có thể thử nghiệm sớm khi thực hiện bài viết này. Hình ảnh trực quan tương tác được xây dựng bằng HTML và CSS thuần dựa trên phong cách của MacStories, và nó bao gồm các bình luận và chú thích của chính tôi.

Mac StudioM5 UltraAI cục bộPhần cứng AIĐánh giá
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.