Latent Space
92

Sản phẩm

Giải mã ChatGPT Work: Trợ lý AI cho hàng tỷ người dùng

(giờ Việt Nam)

Tóm tắt AI

Bài viết phân tích chuyên sâu cách vận hành của ChatGPT Work, từ khả năng ghi nhớ, tính chủ động, lập lịch trình cho đến việc sử dụng trình duyệt và các công cụ hỗ trợ.

Bản dịch AI

Unpacking ChatGPT Work: the Agent for a Billion Users

Lời người biên tập: Tôi rất vui mừng được chào đón Shlok đến với danh sách các tác giả khách mời của chúng tôi! Bạn có thể biết đến Shlok qua những bài phân tích xuất sắc của anh ấy (với tư cách là người ngoài cuộc — để có góc nhìn từ người trong cuộc, hãy xem podcast của chúng tôi với Akshay Nathan từ OpenAI. Đây đã là một trong những tập podcast phổ biến nhất của chúng tôi trong năm nay!) về các hệ thống bộ nhớ của các phòng thí nghiệm AI hàng đầu, chủ đề mà anh ấy đã có một bài thuyết trình AIE tuyệt vời. Chúng tôi đã theo dõi quá trình nghiên cứu và triển khai các tác nhân (agents) của OpenAI đến toàn nhân loại kể từ Plugins 2023, Devday 2024 và Codex 2025, và giờ đây ChatGPT Work vào năm 2026 dường như là giai đoạn áp chót của hành trình dài hơi này. Hãy cùng bắt đầu!

Vào ngày 9 tháng 7, OpenAI đã phát hành ChatGPT Work, sản phẩm tác nhân dành cho công việc tri thức. Đây là một đợt ra mắt bận rộn theo mọi nghĩa: ba mô hình mới với mười bốn cấu hình khác nhau, hợp nhất các ứng dụng máy tính để bàn của ChatGPT và Codex, đồng thời đưa các tác nhân đám mây (cloud agents) đến với người dùng phổ thông ở dạng dễ tiếp cận nhất từ trước đến nay.

Sau ba tuần, Work (cùng với Codex) được cho là đã vượt mốc 10 triệu người dùng.

Lời người biên tập: ChatGPT ước tính đã vượt mốc 1 tỷ MAU (người dùng hoạt động hàng tháng) vào tháng 6 và 1 tỷ WAU (người dùng hoạt động hàng tuần) trong tháng này.

Chat và Work hiện đang tồn tại song song như các chế độ riêng biệt bên trong ChatGPT, nhưng Greg Brockman đã xác nhận rằng chúng sẽ hợp nhất vào cuối năm nay. Như vậy, Work không chỉ là một sản phẩm ngách dành cho người dùng chuyên nghiệp, mà còn là bản xem trước về cách mà một tỷ người dùng hàng tuần của ChatGPT sẽ sớm sử dụng ứng dụng này. Đó là lý do tại sao mọi người trong và ngoài OpenAI lại hào hứng với nó đến vậy, và tại sao nó xứng đáng được xem xét kỹ lưỡng hơn.

Work ở dạng hiện tại cần một chút thời gian để giải mã. Nó là sự kết hợp giữa ChatGPT (dưới dạng trò chuyện), ứng dụng Codex, bộ khung (harness) Codex, tác nhân đám mây gốc Codex, tác nhân ChatGPT, Atlas, OpenClaw và nhiều thứ khác. Dòng sản phẩm xoay quanh nó khá khó hiểu. Hơn nữa, các phiên bản web và di động lại khác biệt so với phiên bản máy tính để bàn (trừ khi bạn chạy nó ở chế độ đám mây?!).

Vì vậy, tôi đã dành vài ngày qua để tìm hiểu: Work là gì, nó nằm ở đâu trong dòng sản phẩm của OpenAI, những lựa chọn thú vị trong thiết kế của nó, những căng thẳng tiềm ẩn bên dưới và hướng đi tương lai của nó. Phần lớn nội dung dưới đây đến từ việc tôi và Codex cùng khám phá bên trong Work, và tôi đã đính kèm các cuộc hội thoại đó xuyên suốt bài viết để bạn có thể thấy nguồn gốc của từng nhận định.

Cốt lõi của nó là:

Một tác nhân dành cho công việc tri thức. Bạn kết nối nó với những nơi bạn đang làm việc—Slack, email, Drive, lịch, CRM, công cụ quản lý dự án và hàng trăm plugin khác—và nó sẽ thu thập ngữ cảnh từ tất cả các nguồn đó để tạo ra công việc hoàn chỉnh.

Chạy trên bộ khung Codex. Vì vậy, nó kế thừa các mô hình, các tác nhân phụ, khả năng sử dụng trình duyệt và khả năng xử lý một tác vụ trong nhiều giờ. Giao diện người dùng (UI) của nó đã được lược bỏ các bằng chứng (như các điều khiển git, các dấu vết diff) vốn có thể làm lộ việc bạn đang trò chuyện với một tác nhân lập trình.

Sống trong một máy tính đám mây. Cụ thể là một microVM mạnh mẽ, biệt lập: Tài khoản Pro nhận được 8 CPU, 20GB RAM và 64GB ổ cứng; tài khoản Plus nhận được 14GB RAM. Bên cạnh máy ảo, Work còn có một dịch vụ Chrome được quản lý mà tác nhân vận hành thông qua các lệnh gọi công cụ (tool calls).

Tạo ra các sản phẩm (artifacts). Các bảng tính, tài liệu và bản trình bày được hiển thị trong các trình xem tương tác, cộng với Sites: các ứng dụng web và bảng điều khiển được lưu trữ mà nó có thể xây dựng, chia sẻ qua URL và cập nhật liên tục.

Mỗi cuộc hội thoại mới trong Work được gọi là một tác vụ (task). Trên web và di động, Work chạy trên đám mây. Bạn có thể bắt đầu một tác vụ trên web, theo dõi tiến độ và đưa ra chỉ dẫn trong ứng dụng ChatGPT trên điện thoại, sau đó xem kết quả (có thể là một báo cáo hoặc bảng tính) trên máy tính xách tay của bạn.

Work trên ứng dụng máy tính để bàn hơi khác biệt và có hai chế độ: đám mây và cục bộ. Ở chế độ đám mây, các tác vụ chạy trên cùng một máy tính đám mây như trên web và di động, đồng thời đồng bộ hóa trên cả ba nền tảng.

Ở chế độ cục bộ, tác nhân làm việc trực tiếp trên máy tính của bạn, trên các tệp và ứng dụng của bạn, với toàn quyền sử dụng máy tính. Các tác vụ này không xuất hiện trên web hoặc di động, và hiện chưa có cách nào để chuyển một tác vụ cục bộ lên đám mây. Điều này khiến chế độ cục bộ về cơ bản chính là Codex, trừ đi các dấu vết UI liên quan đến mã nguồn vốn có thể khiến người dùng không phải lập trình viên e ngại.

Trên máy tính để bàn, mỗi tác vụ Work mới có thể chạy cục bộ trên máy tính của bạn hoặc trên đám mây.

Nhưng sau đó mọi thứ trở nên hơi khó hiểu. OpenAI đã phát hành một cách để chuyển giao tác vụ Codex sang môi trường từ xa. Mặc dù tính năng này không hoạt động với tôi tại thời điểm viết bài, tôi cho rằng cuối cùng nó sẽ hoạt động, và họ sẽ mang chức năng tương tự lên Work.

ChatGPT Image Aug 4, 2026, 10_55_25 AM

Trong phần còn lại của bài viết này, Work = Work ở chế độ đám mây.

Một lý do lớn khiến OpenClaw mang lại cảm giác khác biệt so với chatbot là vì tác nhân đó có một máy tính riêng. Bạn có thể chạy nó trên một chiếc máy tính xách tay luôn bật hoặc một VPS, để nó tạo thư mục, cài đặt phần mềm, duy trì cơ sở dữ liệu và tái sử dụng tất cả những thứ này trên các cuộc hội thoại và tác nhân phụ. Trạng thái của nó không chỉ nằm trong lịch sử trò chuyện, các tệp Markdown hay một hệ thống bộ nhớ chuyên dụng, mà nằm trên toàn bộ máy tính.

Máy tính đám mây của Work cũng có tính bền bỉ. Nhưng thay vì chạy trong một máy ảo luôn bật, không gian làm việc của nó được đồng bộ hóa với bộ lưu trữ bền bỉ và được khôi phục vào các microVM biệt lập khi cần. Vì vậy, máy tính cơ sở có thể thay đổi, nhưng trạng thái làm việc vẫn được duy trì. Tuy nhiên, so với OpenClaw, tác nhân này có ít quyền kiểm soát hơn đối với máy tính đó.

Mỗi tác vụ (luồng) Work đều có một thư mục làm việc tại /workspace/scratch, nơi tác nhân có sự tự do như một máy tính bình thường: nó có thể tạo thư mục, cài đặt các phụ thuộc, viết tập lệnh, duy trì cơ sở dữ liệu và tìm kiếm mọi thứ bằng các lệnh Linux thông thường.

Khi tôi yêu cầu nó tạo một bài thuyết trình cho Acme, nó có thể tạo thư mục clients/acme, sao chép tài liệu nguồn vào, thực hiện phân tích thông qua mã nguồn, và tạo các biểu đồ cũng như slide, tất cả dưới dạng các tệp trong thư mục đó. Khi tôi tiếp tục trong cùng một luồng, nó quay lại trạng thái làm việc đó và có thể tiếp tục chỉnh sửa.

Nhưng khi một tác vụ cần ngữ cảnh từ các luồng khác, nó không coi các thư mục làm việc của các luồng đó là một không gian làm việc chung mà nó có thể tự do điều hướng. Thay vào đó, nó dựa vào lớp sản phẩm ChatGPT.

ChatGPT Work - persistence architecture

Theo mặc định, mỗi luồng mới nhận được một bản tóm tắt nén về các tác vụ và tệp gần đây đã được xử lý. Một bản tóm tắt có thể trông như thế này:

20260731T15:55 Chuẩn bị kế hoạch thí điểm Acme:||||Chuyển các ghi chú đính kèm thành một kế hoạch một trang cho dự án thí điểm Acme, với mục tiêu, thời hạn và các bước tiếp theo.<<Tên tệp=”acme_notes.txt”>>

Các bản ghi hội thoại thô không được lưu trữ trên máy tính để tác nhân duyệt qua. Khi một tác vụ cần ngữ cảnh từ các luồng trước đó, tác nhân sẽ gọi Personal Context (Ngữ cảnh cá nhân), một công cụ chuyên dụng truy vấn lịch sử Chat và Work thông qua một dịch vụ được quản lý riêng và trả về các đoạn trích liên quan.

Các tệp cũng tuân theo mô hình tương tự. Thư viện (Library) của ChatGPT là kho lưu trữ trung tâm dành cho người dùng đối với tất cả các tệp và sản phẩm. Các tệp người dùng tải lên sẽ tự động nằm ở đó; các tệp do tác nhân tạo ra sẽ được lưu khi người dùng yêu cầu, hoặc khi tác nhân đánh giá chúng đáng để giữ lại. Tác nhân cũng có thể tạo các thư mục trong Thư viện để giữ cho nó ngăn nắp. Giống như các cuộc hội thoại, Thư viện không nằm trên máy tính và chỉ có thể truy cập thông qua các công cụ chuyên dụng.

Do đó, một tệp được tải lên tồn tại ở hai nơi: một bản sao làm việc bên trong luồng và một mục chính thức trong Thư viện. Điều thú vị là hai nơi này không đồng bộ hóa với nhau. Nếu Luồng A tải lên một tệp và sau đó Luồng B thay đổi phiên bản trong Thư viện, Luồng A vẫn tiếp tục đọc bản sao cục bộ đã cũ của nó khi được tiếp tục.

Khi được hướng dẫn rõ ràng, một tác nhân trong một tác vụ có thể điều hướng các thư mục scratch của các tác vụ khác, tìm tệp và sửa đổi chúng. Nhưng nó sẽ không tự làm điều này, và các thư mục có tên khó hiểu, không có bản đồ rõ ràng dẫn đến các cuộc hội thoại của chúng và không có hợp đồng lưu trữ cụ thể nào.

Bộ nhớ cũng được quản lý bên ngoài. Như tôi đã viết trước đây, nguyên lý bộ nhớ cốt lõi của ChatGPT là một hồ sơ người dùng được tổng hợp liên tục. Sản phẩm duy trì hồ sơ đó một cách không đồng bộ và cung cấp cho Work khi một tác vụ bắt đầu. Tác nhân có thể suy luận từ đó, nhưng không thể sửa đổi hoặc tạo các tệp Markdown kiểu OpenClaw mà các tác vụ khác tải theo mặc định.

Các Dự án (Projects) của ChatGPT cũng được chuyển sang Work. Các Dự án nhóm các cuộc hội thoại liên quan, các chỉ dẫn thường trực và Nguồn (các tệp do người dùng tải lên). Một tác vụ mới trong một Dự án sẽ nhận được các chỉ dẫn, tóm tắt các cuộc hội thoại liên quan và các bản sao cục bộ của Nguồn trong thư mục của nó. Nhưng bản thân Dự án không tồn tại trên máy tính như một thư mục, giống như trong Codex. Nó cũng là một sự trừu tượng mà sản phẩm duy trì.

Tóm lại, tác nhân có sự tự do rộng rãi trong một tác vụ, nhưng tính liên tục giữa các tác vụ lại đi qua một lớp sản phẩm ChatGPT đầy tính chủ quan thay vì chính chiếc máy tính. Tại sao lại có sự phân chia này? Tôi đoán là vì một vài lý do:

Work được xây dựng trên các nguyên lý hiện có của ChatGPT (Hội thoại, Thư viện, Ngữ cảnh cá nhân, Bộ nhớ). Việc loại bỏ tất cả những thứ đó và xây dựng lại bên trong máy tính sẽ đồng nghĩa với việc tái cấu trúc một hệ thống vốn đã phục vụ một tỷ người dùng.

Sự phân chia này là một rào cản an toàn. Việc truy cập không hạn chế kiểu OpenClaw vào một môi trường duy nhất chứa mọi tệp, cuộc hội thoại và bộ nhớ là không an toàn cho người dùng.

Nó cho phép OpenAI giữ quyền kiểm soát sản phẩm: những gì người dùng thấy trong giao diện, cách quản lý ngữ cảnh và cách thức hoạt động của việc chia sẻ, đồng bộ hóa đa thiết bị và quản lý phiên bản tệp. Tất cả những điều đó sẽ khó xây dựng hơn nếu tác nhân có thể thay đổi môi trường theo ý muốn.

ChatGPTAI AgentsOpenAICông nghệSản phẩm AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.