# Nghiên cứu từ Fudan: AI Agent đảm nhận phần lớn công việc phát triển mô hình Atria Dawn Preview

- Nguồn: The Decoder: AI News
- Thời gian phát hành: 2026-09-27 22:18 (giờ Việt Nam)
- Điểm AI: 55/100
- Link AIHOT.vn: https://aihot.vn/items/4ab6047a5854049c
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmujz82l112d4ro9hsb2680j6
- Link gốc: https://the-decoder.com/ai-agents-do-more-of-the-work-in-model-development-but-humans-still-make-the-decisions

## Tóm tắt AI

Nghiên cứu trên 700 nhật ký tác vụ cho thấy dù AI Agent thực hiện phần lớn công việc kỹ thuật, con người vẫn nắm giữ 85,5% quyết định quan trọng. Nhóm tác giả cảnh báo rủi ro con người dần mất khả năng giám sát thực chất khi quá phụ thuộc vào AI.

## Thân bài

![AI agents do more of the work in model development, but humans still make the decisions](https://the-decoder.com/wp-content/uploads/2026/09/research-tree-nano-banana-pro.jpg)

Dự án tập trung vào việc phát triển một [mô hình ngôn ngữ có tính đại lý tên là Atria Dawn Preview](https://huggingface.co/internlm/Atria-Dawn-Preview), được xây dựng trên kiến trúc hỗn hợp chuyên gia (mixture-of-experts) với 744 tỷ tham số và được thiết kế cho các tác vụ nghiên cứu và kỹ thuật.

Mô hình được huấn luyện thông qua một quy trình liên kết mỗi tác vụ với một môi trường thực thi thực tế. Nó gọi các công cụ, tạo ra các kết quả trung gian và được kiểm tra dựa trên các tín hiệu bên ngoài như kiểm thử, số liệu hoặc bằng chứng nguồn. Nhóm nghiên cứu cho biết mô hình này dẫn đầu ở 5 trong số 16 tiêu chuẩn đánh giá, bao gồm tìm kiếm web và an ninh mạng, mặc dù nó không chiếm ưu thế hoàn toàn so với các đối thủ cạnh tranh.

![Eight bar charts comparing Atria Dawn Preview with DeepSeek V4 Pro, Kimi K3, Qwen 3.8 Max, GLM 5.3, GPT 5.6 Sol, and Claude Opus 5 across AutomationBench, SkillsBench, Workspace-Bench-Lite, GDPval, Cy](https://the-decoder.com/wp-content/uploads/2026/09/atria-dawn-01-benchmark-overview.jpg)

### Một phần ba số tác vụ có sự hỗ trợ của AI đã hoàn thành sẽ không được thực hiện nếu không có AI.

AI được sử dụng trong 96,5% các tác vụ được xem xét. Trong suốt quá trình thực hiện dự án, những người tham gia đã bàn giao ngày càng nhiều công việc cho các tác nhân (agent). Tỷ lệ trung vị giữa các hành động của tác nhân so với đầu vào của con người đã tăng từ 11 lên 28,5 trong vòng bốn tuần. Nhóm nghiên cứu cảnh báo không nên hiểu điều này là sự gia tăng quyền tự chủ. Mỗi quyết định của con người dẫn đến nhiều bước thực hiện hơn của tác nhân, điều đó không có nghĩa là các tác nhân tự đưa ra nhiều quyết định hơn.

![Line chart showing the daily median of agent actions per human prompt from August 7 to September 4, 2026, rising from 11.0 to 28.5 with a gray shaded interquartile range.](https://the-decoder.com/wp-content/uploads/2026/09/atria-dawn-07-agent-actions-chart.jpg)

Những người tham gia cũng được hỏi liệu họ có thể hoàn thành phần việc của mình mà không cần AI, với cùng phạm vi và chất lượng hay không. Trong số 455 tác vụ có sự hỗ trợ của AI đã hoàn thành, 151 tác vụ được đánh giá là không khả thi nếu không có AI, chiếm khoảng một phần ba. Những tác vụ này được phân bổ cho 27 trong số 56 người tham gia, vì vậy chúng không chỉ đến từ một nhóm nhỏ người dùng chuyên nghiệp. Trong những trường hợp này, AI không làm tăng tốc công việc hiện có mà nó làm cho những công việc vốn không bao giờ có thể bắt đầu trở nên khả thi.

![Heatmap table showing estimated time effort without AI by task category, ranging from under half an hour to infeasible, with the infeasible share at 33.2 percent overall.](https://the-decoder.com/wp-content/uploads/2026/09/atria-dawn-08-effort-without-ai-table.jpg)

### AI đề xuất, con người lựa chọn

Đối với các phương pháp và tham số, mô hình phổ biến nhất là "AI đề xuất, con người lựa chọn" với 55,4%. Nhìn chung, con người đưa ra 85,5% các quyết định về phương pháp và tham số, trong khi AI chỉ thực hiện 9,2%. Con người đưa ra quyết định cuối cùng về mục tiêu và phạm vi trong 93,4% các trường hợp.

Tỷ lệ đề xuất của AI dao động từ 17 đến 55% tùy thuộc vào loại quyết định. Tỷ lệ quyết định cuối cùng của nó chỉ ở mức một con số. Ai là người đề xuất các tùy chọn thì rất đa dạng, nhưng con người luôn là người đưa ra hầu hết các lựa chọn cuối cùng. Ngay cả trong số 151 tác vụ được đánh giá là không khả thi nếu không có AI, con người vẫn chọn mục tiêu trong 95,4% trường hợp.

![Stacked bar chart showing who proposes and who decides on goals, methods, and acceptance criteria, with AI proposing methods in 55.4 percent of cases and humans making the final selection.](https://the-decoder.com/wp-content/uploads/2026/09/atria-dawn-09-decision-responsibility-chart.jpg)

### Con người cung cấp ngữ cảnh, không phải lao động chân tay

Mô hình tương tự xuất hiện khi có sự cố xảy ra. Trong số 588 tác vụ có ghi nhận về độ khó, 76% tiến triển nhờ sự can thiệp của con người và trong 23% trường hợp, tác nhân tự giải quyết vấn đề. Sự trợ giúp của con người hầu như luôn ở dạng thông tin, bằng cách bổ sung ngữ cảnh hoặc làm rõ các yêu cầu (35,2%) hoặc bằng cách chẩn đoán vấn đề và thay đổi phương pháp (34,7%). Con người hiếm khi tự mình thực hiện công việc. Việc chỉnh sửa một phần chiếm 3,2% các trường hợp và tiếp quản hoàn toàn chỉ chiếm 0,7%.

![Horizontal bar chart showing how tasks progressed after a problem, with 35.2 percent resolved by adding context, 34.7 percent by human diagnosis, and 23.0 percent by the AI recovering on its own.](https://the-decoder.com/wp-content/uploads/2026/09/atria-dawn-10-difficulty-resolution-chart.jpg)

Khi kết quả đầu ra của AI cần sửa đổi, AI tự xử lý các thay đổi đó trong 75,4% trường hợp sau khi nhận được phản hồi từ con người. Phán đoán của con người, thay vì việc thực thi, mới chính là nút thắt cổ chai.

Nhóm nghiên cứu mô tả ba giai đoạn trong vai trò của AI, từ đối tượng nghiên cứu trở thành công cụ cho các tác vụ cá nhân và hiện nay là đối tác dự án. Trong vai trò hiện tại, AI soạn thảo và điều chỉnh các kế hoạch trong phạm vi mục tiêu do con người đặt ra. Giai đoạn thứ tư mang tính suy đoán sẽ liên quan đến việc tự cải thiện đệ quy, với các mô hình mạnh hơn tạo ra những thế hệ kế nhiệm mạnh hơn.

Các tác giả cho rằng một mô hình có thể cải thiện các tác vụ huấn luyện của nó mà không cần phải giỏi hơn trong việc phát triển thế hệ kế nhiệm. Làm thế nào để AI có thể đề xuất các hướng nghiên cứu đa dạng và đánh giá giá trị của chúng trước khi có kết quả vẫn là một câu hỏi mở.

### Rủi ro "đóng dấu phê duyệt" (rubber-stamp)

Khi mọi quyết định đều dựa trên một chuỗi công việc của tác nhân dài hơn mức con người có thể xem xét, việc giám sát trở nên khó khăn. Nhóm nghiên cứu viết rằng trong trường hợp xấu nhất, con người trở thành những người đánh giá chỉ có thể "đóng dấu phê duyệt" những gì họ thấy. Nhiều người tham gia cũng vận hành các tác nhân ở chế độ tự động để tránh làm gián đoạn các quy trình chạy dài bằng việc phê duyệt liên tục. Ranh giới đó được vạch ra vì sự thuận tiện, không phải từ bất kỳ lựa chọn có chủ đích nào về việc AI nên có bao nhiêu quyền hạn.

Bài báo nằm giữa cuộc tranh luận về việc tự cải thiện đệ quy. Anthropic coi việc AI tự phát triển thế hệ kế nhiệm của chính nó là [có thể sớm hơn dự kiến](https://the-decoder.com/anthropic-says-claude-now-writes-over-90-of-its-code-and-wants-the-world-to-have-an-ai-pause-button/), và CEO Dario Amodei đang kêu gọi [một giới hạn tốc độ cho ngành](https://the-decoder.com/anthropic-ceo-amodei-wants-ai-speed-limits-before-self-improvement-outpaces-human-control/) vì lý do này. Theo Anthropic, con người hiện chỉ đưa ra tỷ lệ quyết định ở mức một con số về hướng nghiên cứu tại công ty. OpenAI sử dụng GPT-5.6 Sol [trong toàn bộ chu kỳ phát triển của mình](https://the-decoder.com/openais-gpt-5-6-sol-autonomously-post-trained-the-smaller-luna-model-with-a-fairly-underspecified-prompt/), trong khi Google và DeepMind để các tác nhân AI khám phá [các chiến lược thay thế thông qua các quỹ đạo tìm kiếm được ghi lại](https://the-decoder.com/google-deepminds-dream-rsi-helps-ai-agents-improve-by-dreaming-about-past-attempts/) với Dream-RSI, mặc dù chúng chỉ cải thiện chiến lược tìm kiếm chứ không phải bản thân mô hình.

Hơn một nghìn nhân viên tại các công ty AI hàng đầu gần đây đã [cảnh báo rằng các tổ chức của họ có thể đang trên bờ vực tự động hóa nghiên cứu AI](https://the-decoder.com/top-ai-lab-researchers-warned-about-automated-ai-research-and-several-of-their-predicted-milestones-have-already-fallen/). Một [nghiên cứu riêng biệt từ Princeton và Viện An toàn AI Vương quốc Anh](https://the-decoder.com/study-contradicts-anthropic-and-openai-claims-that-autonomous-ai-research-is-within-reach/) đã đưa ra kết luận phù hợp hơn với những phát hiện của nhóm Atria, cho thấy rằng các mô hình tiên phong có thể xử lý kỹ thuật nghiên cứu nhưng lại thất bại trong các quyết định mang tính phán đoán thực sự quan trọng.
