# Sự trỗi dậy của các trợ lý cá nhân 'chậm': Khi tư duy sâu quan trọng hơn tốc độ phản hồi

- Nguồn: Cerebras: Blog (Web)
- Thời gian phát hành: 2026-09-25 06:22 (giờ Việt Nam)
- Điểm AI: 13/100
- Link AIHOT.vn: https://aihot.vn/items/d7ed173ceee411a9
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmug5q02g0g92rogv6uc3gxsh
- Link gốc: https://www.cerebras.ai/blog/the-rise-of-slow-personal-assistants

## Tóm tắt AI

Bài viết phân tích xu hướng chuyển dịch từ các mô hình AI phản hồi tức thì sang các trợ lý cá nhân tập trung vào khả năng suy luận sâu, chấp nhận thời gian xử lý lâu hơn để đạt kết quả chính xác và phức tạp hơn.

## Thân bài

![Why AI Assistants Are Slow—and How to Make Them Faster](https://cdn.sanity.io/images/e4qjo92p/production/a84bcd37e2c9ee2a76ee720609eb41e92aff9c2d-1435x893.png?rect=0,71,1435,753&w=1200&h=630&fit=max&auto=format)

Một trợ lý cá nhân nên giúp bạn tiết kiệm thời gian và công sức. Trong vài tuần qua, chúng tôi đã miệt mài thử nghiệm các trợ lý cá nhân AI với những công việc thường nhật, từ đặt vé máy bay, quản lý lịch trình cho đến mua sắm thực phẩm và lên kế hoạch ăn uống.

Chúng tôi vẫn luôn kinh ngạc mỗi khi một trợ lý tự mình hoàn thành công việc. Tuy nhiên, việc phải chờ đợi hơn 7 phút cho một yêu cầu đặt bàn ăn tối – vốn chúng tôi có thể tự làm thủ công chỉ trong 37 giây – chắc chắn sẽ làm giảm đi sự hào hứng đó.

Vì vậy, chúng tôi bắt đầu tìm hiểu xem thời gian đó đã trôi đi đâu. Đối với thí nghiệm này, chúng tôi đã xây dựng một trợ lý thử nghiệm sử dụng Qwen 3.8 27B chạy trên Cerebras, với Pi đóng vai trò là bộ khung điều phối (agent harness). Nhờ khả năng suy luận nhanh hơn trên Cerebras và kỹ thuật tối ưu hóa bộ khung, trợ lý của chúng tôi đã hoàn thành nhiệm vụ trong 22 giây, nhanh gấp 19 lần so với các trợ lý hiện có. Dưới đây là những thay đổi mà chúng tôi đã thực hiện.

### Các trợ lý AI tiêu dùng mới

OpenClaw là một cái nhìn thoáng qua về tương lai, và làn sóng trợ lý AI tiêu dùng mới đang xử lý nhiều khâu thiết lập hơn cho bạn, giúp bạn có thể bắt đầu bàn giao công việc mà không cần phải cấu hình phần mềm bên dưới.

![](https://cdn.sanity.io/images/e4qjo92p/production/1aed64c3fdc379c87f42db6d392de39f2fd2bb05-1881x718.png?auto=format&dpr=2&fit=max&q=75&w=1881)

### Thời gian đã trôi đi đâu

Như một thử nghiệm, chúng tôi đã đưa mọi trợ lý lớn vào bài kiểm tra và đánh giá chúng dựa trên cùng một yêu cầu đặt bàn ăn tối.

![](https://cdn.sanity.io/images/e4qjo92p/production/5da91d1d12071f4d280d98cad8bcfbafec15fb8b-1920x1080.png?auto=format&dpr=2&fit=max&q=75&w=1920)

Cùng một yêu cầu đó đã khiến mỗi trợ lý thực hiện các chuỗi tìm kiếm, kiểm tra và thao tác trình duyệt khác nhau. Lượt chạy của Meta Muse mất 4 phút 36 giây và bao gồm 9 lệnh gọi API trực tiếp tới OpenTable. Claude Cowork mất 6 phút 25 giây với 57 lệnh gọi công cụ. Grok Bot mất 7 phút 40 giây. Mỗi trợ lý đều đặt bàn thành công tại một trong các nhà hàng A Mano, II Borgo hoặc Doppio Zero.

![](https://cdn.sanity.io/images/e4qjo92p/production/ec167b43a5b4852fd2c363a8b432270175c76397-1920x1080.png?auto=format&dpr=2&fit=max&q=75&w=1920)

#### Các lượt chạy được ghi lại, không phải bảng xếp hạng tổng quát. Kết quả 22 giây là giá trị trung vị của hai lần thử nghiệm thành công.

![](https://cdn.sanity.io/images/e4qjo92p/production/f42868b849b7cdd63e2f000dbd822c9a39ca7a8a-976x1103.png?auto=format&dpr=2&fit=max&q=75&w=976)

Với bất kỳ tác vụ đại lý (agentic task) nào, có rất nhiều thứ diễn ra bên dưới bề mặt. Bộ khung điều phối quản lý cuộc hội thoại, thực thi các lệnh gọi công cụ, xử lý lỗi và phản hồi kết quả cho mô hình. Để hiểu thời gian đã trôi đi đâu, hãy xem cách Grok Bot dành 2 phút đầu tiên của nó. Grok Bot bắt đầu bằng việc tải các kỹ năng, truy xuất bộ nhớ, tìm kiếm, kiểm tra các trang nhà hàng và báo cáo lại. Chỉ riêng một lượt chạy trình duyệt đã mất 2 phút 18 giây để kiểm tra lần lượt A Mano, Il Borgo và Doppio Zero.

Ví dụ, chúng ta có thể thấy ở đây bảng phân tích chi tiết hơn về lượt chạy của Grok Bot.

![](https://cdn.sanity.io/images/e4qjo92p/production/7ba66b66e76318f77128f9ce96c440c7a72c1c11-2114x868.png?auto=format&dpr=2&fit=max&q=75&w=2000)

Các mô hình cũng đóng vai trò quan trọng. Những tiến bộ gần đây trong việc lập kế hoạch, sử dụng công cụ và suy luận dài hạn đã làm cho các tác vụ này trở nên thực tế hơn. Thế hệ [Opus 4.5](https://www.anthropic.com/news/claude-opus-4-5) kết hợp các khả năng đại lý mạnh mẽ hơn với tính năng nén ngữ cảnh: chuyển tiếp một bản tóm tắt công việc khi ngữ cảnh đầy. Các nghiên cứu như [CompactionRL](https://arxiv.org/abs/2607.05378) còn tiến xa hơn bằng cách huấn luyện các đại lý làm việc xuyên suốt các bước nén đó.

Và trên hết, bạn vẫn cần một mô hình nhanh để theo dõi mục tiêu, phục hồi sau lỗi và thường xuyên xác minh rằng công việc đang đi đúng hướng.

### Cách chúng tôi thực hiện

Chúng tôi đã sử dụng [Pi](https://pi.dev/) làm bộ khung điều phối đại lý. Lời nhắc hệ thống (system prompt) nhỏ gọn và bốn công cụ tích hợp sẵn đã cung cấp cho chúng tôi một điểm khởi đầu đơn giản, với không gian để thêm các công cụ riêng cho tác vụ đặt bàn.

Đang tải trình phát...

### 1. Kiểm tra các tùy chọn độc lập song song

Kiểm tra tình trạng sẵn sàng của nhà hàng là một tác vụ có thể thực hiện song song một cách dễ dàng. Bước đặt bàn phụ thuộc vào kết quả của các bước kiểm tra đó. Cách phân chia của chúng tôi: chạy các bước kiểm tra độc lập cùng lúc, sau đó sử dụng kết quả để quyết định cách tiếp tục.

Kỹ năng này hướng dẫn nó kiểm tra các tùy chọn độc lập song song, nhờ đó nó có thể thu thập kết quả từ nhiều nhà hàng mà không cần chờ đợi từng bước kiểm tra hoàn tất mới bắt đầu bước tiếp theo.

Phần trình duyệt/API trong lượt chạy tối ưu hóa của chúng tôi mất 6,8 giây, so với 4 phút 31 giây trong lượt chạy trước đó của Grok: chênh lệch khoảng 40 lần trong các danh mục được ghi lại đó. Sự so sánh đó bao gồm các thay đổi về mô hình, bộ khung và lộ trình thực thi; nó không tách biệt riêng hiệu quả của kỹ năng đó.

### 2. Tăng tốc các lệnh gọi mô hình còn lại

Mỗi khi trợ lý quay lại mô hình, nó phải chờ đợi phản hồi tiếp theo. Suy luận nhanh hơn trên Cerebras giúp rút ngắn những khoảng dừng đó. Lượt chạy tối ưu hóa của chúng tôi sử dụng Qwen 3.8 27B; việc lưu lại quy trình trang web cũng giảm bớt khối lượng công việc mà mô hình phải xử lý trong quá trình chạy.

Một số bước vẫn phải diễn ra theo thứ tự. Đại lý cần kết quả trang web trước khi có thể quyết định phải làm gì với nó. Suy luận nhanh hơn sẽ không làm một trang web chậm tải ngay lập tức hoặc loại bỏ bước xác minh qua điện thoại, nhưng nó có thể cắt giảm các khoảng dừng lặp đi lặp lại giữa việc quan sát, quyết định và hành động.

### 3. Lưu lại những gì đại lý học được

Phần lớn nỗ lực lãng phí đến từ việc khám phá cách trang web hoạt động: gọi công cụ, quan sát trang, dự đoán bước tiếp theo, gọi công cụ khác. Đại lý mày mò, tìm hiểu chuyện gì xảy ra, rồi mới tiếp tục công việc. Trong lần truy cập tiếp theo, nó có thể phải làm lại toàn bộ công việc khám phá đó.

Trước khi chạy trợ lý, chúng tôi đã cung cấp cho đại lý nhiều ngữ cảnh hơn và biến những gì đã học được thành một kỹ năng. Điều đó cung cấp cho mô hình các hướng dẫn để điều hướng quy trình đặt bàn mà không cần phải tự mình khám phá từng bước. Trong thử nghiệm của chúng tôi, điều này đã giảm số lượng lệnh gọi công cụ hơn 80%.

Điểm khác biệt quan trọng là những gì được tái sử dụng. Chúng tôi có thể lưu lại quy trình điều hướng trang web và kiểm tra đặt bàn. Tình trạng sẵn sàng, giá cả và việc có yêu cầu thẻ tín dụng hay không vẫn cần được kiểm tra trực tiếp. Công việc tìm ra lộ trình diễn ra trước lượt chạy tính giờ; nó không hề biến mất.

### Một trợ lý cá nhân nhanh hơn

Còn nhiều việc phải làm trước khi nó có thể xử lý mọi việc vặt một cách hoàn hảo và chúng ta có một Jarvis ngoài đời thực, nhưng hãy tưởng tượng khi những đại lý vốn đã mang lại cảm giác kỳ diệu này nhanh hơn gấp 10 lần.

Dù sao thì, phải đi thôi! Chúng tôi có một bàn ăn tối cần phải đến.

——————————-

Thiết kế bởi Halley Chang và Alycia Cary

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.cerebras.ai/blog/the-rise-of-slow-personal-assistants>
