Claude: Blog (Web)
90

Tin ngành

Đưa chế độ tự động (Auto Mode) vào môi trường thực tế

(giờ Việt Nam)

Tóm tắt AI

Anthropic chia sẻ những bài học kinh nghiệm và thách thức kỹ thuật khi triển khai tính năng 'Auto Mode' của Claude vào môi trường sản xuất thực tế.

Bản dịch AI

Auto mode hiện là thiết lập mặc định trong Claude Code. Thay vì yêu cầu bạn phê duyệt mọi lệnh mà một tác nhân (agent) muốn thực thi, một bộ phân loại (classifier) sẽ đánh giá từng hành động và chặn những hành động có vẻ gây hại.

Thiết kế của auto mode giải quyết một sự đánh đổi phổ biến trong lập trình bằng tác nhân: tốc độ so với tính an toàn. Việc xem xét từng lệnh giúp con người luôn nắm quyền kiểm soát, nhưng khi các phiên làm việc kéo dài hàng giờ hoặc chạy song song nhiều tác vụ, sự giám sát đó trở thành nút thắt cổ chai. Việc bỏ qua hoàn toàn các bước kiểm tra quyền hạn sẽ nhanh hơn—nhưng đó cũng là cách mà các lỗi như prompt injection, chệch phạm vi (scope drift) và việc vô tình xóa tài nguyên sản xuất (production resource) xảy ra.

Auto mode thu hẹp phần lớn khoảng cách đó. Trong các đánh giá nội bộ, bộ phân loại đã phát hiện nhiều hành động nguy hiểm hơn so với các lập trình viên khi họ tự tay nhấp chuột phê duyệt, và hiệu suất của nó vẫn ổn định dưới các bài kiểm tra thâm nhập (red-teaming) từ bên thứ ba. Và vì các phiên làm việc ít bị tạm dừng hơn, Claude hoạt động lâu hơn gấp 9 lần giữa các lần gián đoạn so với thiết lập mặc định trước đây—trên toàn bộ quá trình sử dụng Claude Code.

Để xem auto mode hoạt động như thế nào trong môi trường thực tế (production), chúng tôi đã trao đổi với các đội ngũ tại Nuro, Gusto và Garner Health về cách thức và lý do họ sử dụng auto mode làm công cụ chính hàng ngày để cân bằng giữa tốc độ và tính an toàn trong môi trường vận hành của họ.

Thúc đẩy các tác nhân tự hành chạy dài hạn tại Nuro

Nuro, công ty AI vật lý đang phát triển công nghệ lái xe tự hành cấp độ 4 phổ quát, đã áp dụng Claude Code vào cuối năm 2025, và đến tháng 3, đây đã trở thành công cụ lập trình bằng tác nhân phổ biến nhất tại công ty.

Trước khi auto mode ra mắt, kỹ sư phần mềm Kai Zhou đã bắt đầu tạo mẫu một giải pháp thay thế nội bộ: một hook gửi từng hành động đang chờ xử lý tới một mô hình nhỏ, tự động phê duyệt các tác vụ thường lệ trong 90% trường hợp và chuyển bất kỳ yêu cầu nhạy cảm nào lên Slack để con người xem xét. Bản mẫu này giải quyết một áp lực thực tế: các kỹ sư ghét việc phải ngồi canh chừng các thông báo phê duyệt, nhưng từ quan điểm bảo mật và pháp lý của công ty, việc bỏ qua hoàn toàn quyền hạn là quá nguy hiểm để cho phép. Khi auto mode ra mắt, Kai đã gác lại dự án phụ này.

Ngày nay, Kai sử dụng auto mode cho mọi công việc anh thực hiện.

"Tôi không muốn cứ ngồi đó và nhấp phê duyệt suốt," Kai nói. "Tôi sử dụng auto mode cho 100% công việc lập trình của mình. Hầu hết thời gian, tôi mở ba hoặc bốn phiên chạy auto mode song song và chỉ kiểm tra lại khi cần."

Ngoại lệ là những công việc liên quan đến các đội ngũ khác. Ví dụ, khi Claude Code thay mặt anh xem xét một Pull Request, Kai chuyển trở lại chế độ tương tác (interactive mode) và xem xét từng cái trước khi nó được gửi đi.

Auto mode cũng không chạy mà không có sự kiểm soát. Nuro dựa nhiều vào các kỹ năng (skills), và các kỹ sư từ chối thẳng các lệnh nguy hiểm nhất, như lệnh xóa đệ quy (recursive deletes), ngay trong cài đặt của họ. Bộ phân loại đưa ra các quyết định đánh giá của nó bên trong những hàng rào bảo vệ đó.

Tuy nhiên, bước tiến lớn hơn của auto mode là khả năng khởi chạy công việc vẫn tiếp tục chạy sau khi các kỹ sư đã kết thúc ngày làm việc. Cụ thể, đội ngũ của Kai sử dụng auto mode để vận hành các tác nhân nghiên cứu chạy dài hạn nhằm tối ưu hóa các chỉ số đánh giá đằng sau hệ thống lái xe tự hành của công ty: các tác vụ có tín hiệu rõ ràng, có thể đo lường được mà một tác nhân có thể tự lặp lại để cải thiện.

Qua đêm, một tác nhân có thể nghiên cứu các kết quả âm tính giả (false negatives) được gắn cờ bởi bộ đánh giá, soạn thảo đề xuất, chạy thử nghiệm và tiếp tục lặp lại dựa trên kết quả. Cách tiếp cận này mở rộng sang bất kỳ tác vụ nào có phương pháp đánh giá rõ ràng—một đội ngũ khác tại Nuro sử dụng nó để thu nhỏ dung lượng bộ nhớ của một tệp nhị phân cụ thể—bởi vì bản thân chỉ số đó cho tác nhân biết liệu nó đang cải thiện hay đi lùi.

"Hôm nọ, tôi khởi chạy một tác nhân lúc 10 giờ tối và nó chạy liên tục đến 5 giờ sáng—và nó mang lại cho tôi ba PR vào buổi sáng," Kai nói. "Tôi nghĩ điều đó khá ấn tượng. Chỉ có auto mode mới cho phép kiểu khối lượng công việc này."

Gửi PR nhanh hơn và an toàn hơn tại Gusto

Tại Gusto, một công ty công nghệ SMB hàng đầu, việc chuyển sang auto mode bắt đầu như một bước nâng cấp bảo mật chủ động.

Martin Emde, người làm việc trong đội ngũ AI Dev Tools của công ty, đã chứng kiến sự mệt mỏi vì phải phê duyệt quyền hạn làm chậm đội ngũ. Auto mode mang lại cho họ tốc độ tương đương mà không phải hy sinh quyền kiểm soát hay bảo mật, và kể từ khi được áp dụng rộng rãi trong kỹ thuật, gánh nặng về quyền hạn tổng thể đã giảm đáng kể.

Martin đã khởi chạy 2.425 phiên Claude Code kể từ tháng 12, với auto mode là công cụ làm việc hàng ngày. Công việc liên kho (cross-repo) vốn thường bị đình trệ do chờ phê duyệt quyền truy cập thư mục giờ đây chạy không gián đoạn, và các công việc không cần giám sát, như tổng hợp ghi chú hàng ngày từ GitHub, Slack và Jira, đều tự chạy. Trong phân tích của đội ngũ, khoảng 10% bản ghi phiên làm việc kể từ giữa tháng 5 năm 2026 bao gồm một lần từ chối của auto mode, bằng chứng cho thấy bộ phân loại đang làm việc hiệu quả mà không gây cản trở các tác vụ hợp lệ.

“Auto mode mang lại cho chúng tôi sự cân bằng an toàn hơn giữa tốc độ và quyền kiểm soát," Martin nói. "Chúng tôi có thể loại bỏ các thông báo lặp đi lặp lại và tăng năng suất mà không ảnh hưởng đến tính an toàn. Chúng tôi thấy rằng auto mode chặn đúng lúc, điều này mang lại cho chúng tôi sự tự tin để di chuyển nhanh chóng."

Chad Kunsman, một thành viên của đội ngũ AIT Cloud Engineering tại Gusto, đã đi đến cùng kết luận từ một hướng khác. Công việc của anh—điều tra endpoint, kiểm tra log, quản lý kết nối, nhập dữ liệu tài liệu trên một loạt các máy chủ MCP—chạy trong các đợt ngắn, khoảng hai mươi phút thay vì chạy marathon qua đêm. Anh không tìm kiếm các phiên chạy dài hơn; anh muốn tốc độ rảnh tay của việc bỏ qua quyền hạn mà không gặp rủi ro từ một thông báo xấu, hoặc một lỗi prompt injection lọt qua.

"Với khả năng bảo vệ chống lại prompt injection, và cách nó kiểm tra xem những gì bạn đang làm có thực sự khớp với những gì bạn yêu cầu hay không, đó là lựa chọn tốt hơn so với việc bỏ qua quyền hạn và nhanh hơn nhiều so với các thông báo phê duyệt," Chad nói.

Trong những trường hợp hiếm hoi bộ phân loại can thiệp, Chad cho biết nó rất chính xác. "Khi nó dừng tôi lại, điều đó hoàn toàn hợp lý và nó giải thích lý do tại sao. Nó đang chệch khỏi những gì tôi yêu cầu ban đầu, và nó đã kiểm tra lại. Nó không hề sai lệch chút nào."

Chad vẫn thoát khỏi auto mode cho những công việc nhạy cảm nhất của mình. Khi một phiên làm việc can thiệp vào cơ sở hạ tầng sản xuất—Terraform, AWS, các lệnh gọi POST trực tiếp vào các API đang hoạt động—anh chuyển sang chế độ chấp nhận chỉnh sửa và xác minh từng lệnh gọi công cụ bằng tay. "Bạn phải cân nhắc giữa thời gian tiết kiệm được với những sai lầm có thể xảy ra, và mức độ thảm khốc của nó," anh nói. "Cuối cùng, bạn vẫn là người chịu trách nhiệm cho những gì xảy ra."

Sự đánh giá đó vận hành bên trong một thiết lập phòng thủ theo chiều sâu rộng hơn: Gusto định tuyến lưu lượng MCP của mình qua một lớp proxy được quản lý với các công cụ bảo vệ và kiểm tra prompt, vì vậy các tác nhân làm việc với các quyền hạn được giới hạn chặt chẽ trước khi auto mode đưa ra quyết định.

Tăng tốc vòng đời phát triển phần mềm (SDLC) tại Garner Health

Garner Health, công ty công nghệ y tế, đã triển khai Claude Code vào tháng 2 cho tất cả 550 nhân viên trên mọi bộ phận. Công cụ này được kết nối vào tất cả các hệ thống cốt lõi bao gồm Salesforce, Zendesk và Snowflake, và nhân viên được khuyến khích dành khoảng hai giờ mỗi tuần để tự động hóa các phần lặp đi lặp lại nhất trong công việc của họ.

Trước khi có auto mode, quy mô đó đi kèm với chi phí quản lý. Evan Magnussen, quản lý kỹ thuật nền tảng của Garner, mô tả việc quản lý quyền hạn là một chu kỳ tẻ nhạt của việc tự tay quản lý danh sách lệnh được phê duyệt và nhìn các lệnh được gửi đi bị từ chối.

Ngày nay, Evan và hầu hết các đồng nghiệp của anh sử dụng auto mode trong mọi phiên làm việc, từ nghiên cứu codebase đến quản lý các tích hợp bên ngoài thông qua MCP.

“Chúng tôi đã xây dựng một vòng đời phát triển phần mềm tiêu chuẩn cho toàn bộ tổ chức kỹ thuật, điều mà thực sự chỉ có thể thực hiện được nhờ auto mode,” Evan nói. “Nhân viên coi đó là một gánh nặng được trút bỏ. Họ không còn phải giám sát các tác nhân của mình hàng giờ liền nữa.”

Vòng đời đó chạy như một plugin của các kỹ năng tiêu chuẩn hóa. Một tác nhân nhận một tác vụ, khám phá ngữ cảnh mà nó có quyền truy cập, commit các tệp ngữ cảnh vào kho lưu trữ, chạy những gì Evan gọi là “nghiên cứu đối kháng” để kiểm tra áp lực các giả định của chính nó, và sau đó chuyển sang triển khai—chỉ tạm dừng để chờ con người khi nó cần ngữ cảnh mà nó không thể tự tìm thấy. Các giai đoạn nghiên cứu chuyên sâu, Evan lưu ý, là không thể thực hiện được trước khi có auto mode.

Ngay khi cài đặt, bộ phân loại cần rất ít tinh chỉnh. Điều chỉnh duy nhất của Evan phản ánh điều của Kai tại Nuro: anh cấu hình auto mode không phê duyệt các hành động giao tiếp với người khác, như gửi tin nhắn Slack hoặc email.

“Cá nhân tôi không thích Claude tự ý hành động thay mặt tôi khi tôi đang giao tiếp với người khác,” anh nói. Các đội ngũ làm việc về sở hữu trí tuệ cốt lõi—những người hoài nghi nhất về việc bỏ qua quyền hạn trước khi có auto mode—đã học cách tinh chỉnh các prompt được đưa vào của bộ phân loại để trở nên dễ dãi hơn hoặc khắt khe hơn cho công việc của họ.

Lời khuyên của anh cho các doanh nghiệp khác đang triển khai nó? Hãy tham gia và xây dựng các biện pháp kiểm soát phù hợp để bạn có thể trao quyền cho các kỹ sư trong khi vẫn đảm bảo triển khai an toàn. “Nếu chúng tôi nói, mọi người hãy tự xây dựng quy trình làm việc của riêng mình, và chúng tôi không có hệ thống đo lường (telemetry), điều đó sẽ rất nguy hiểm,” Evan nói. “Vì chúng tôi có hệ thống đo lường, vì chúng tôi đã xây dựng các quy trình làm việc tương đối tiêu chuẩn, chúng tôi có nhiều sự tự tin hơn.”

Bắt đầu với auto mode trong Claude Code.

ClaudeAuto ModeAI thực tếAnthropicVận hành AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Claude: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.