The Decoder: AI News
85

Nghiên cứu

Nghiên cứu mới từ Princeton: Khả năng tự nghiên cứu của AI đang bị thổi phồng

(giờ Việt Nam)

Tóm tắt AI

Đại học Princeton và Viện An toàn AI Anh quốc phát hiện Claude Opus 4.8 vẫn thiếu tư duy phản biện và khả năng giải quyết vấn đề sáng tạo, dù có thể thực hiện tốt các tác vụ kỹ thuật đơn thuần.

Bản dịch AI

Study contradicts Anthropic and OpenAI claims that autonomous AI research is within reach

Các tác giả lập luận rằng bằng chứng xác thực cho các tuyên bố về nghiên cứu AI tự động hầu như không tồn tại. Các đánh giá hiện có hoặc là kiểm tra các tác nhân (agent) trên các nhiệm vụ hẹp, có thể kiểm chứng, hoặc là gửi các bài báo do AI tạo ra để bình duyệt – một quy trình mà các nhà nghiên cứu gọi là "quá tải, ngẫu nhiên và chịu sự đánh giá kém chất lượng."

Một phương pháp mới để kiểm tra năng lực nghiên cứu của AI

Các nhà nghiên cứu gọi phương pháp của họ là "Shadow Evaluation" (Đánh giá bóng). Một tác nhân sẽ nhận được câu hỏi nghiên cứu cốt lõi từ một bài báo chưa được công bố. Các tác giả gốc, những người đã dành nhiều tháng cho cùng một câu hỏi đó, sau đó sẽ đánh giá kết quả như cách các nhà bình duyệt hội nghị thực hiện. Vì các kết quả này chưa có trên web, tác nhân không thể dựa vào dữ liệu huấn luyện.

Nhóm nghiên cứu đã hợp tác với tác giả của hai bài báo gửi tới NeurIPS 2026. Bài báo đầu tiên xem xét cách các đặc điểm tính cách của các mô hình ngôn ngữ có thể được điều hướng thông qua trọng số của chúng. Bài báo thứ hai phát triển một phương pháp gọi là TabPFN, giúp phát hiện khi nào một mô hình dự đoán dạng bảng gặp phải dữ liệu triển khai khác biệt hoàn toàn so với dữ liệu huấn luyện và làm giảm độ chính xác của nó.

Các thí nghiệm chính sử dụng Claude Opus 4.8 với tính năng Extra-High Reasoning (Suy luận cực cao). Mỗi tác nhân có sáu ngày, 3.000 USD tín dụng API, ngân sách GPU và toàn quyền truy cập vào một máy ảo cùng mạng internet mở. Tác nhân chạy bên trong một "scaffold" (khung phần mềm), một môi trường phần mềm điều phối các lệnh gọi mô hình và cung cấp công cụ, cho phép mô hình ủy quyền cho các tác nhân phụ và tự giám sát việc sử dụng tài nguyên của chính nó. Nó cũng có thể tham khảo các công cụ đánh giá AI bên ngoài.

Các nhà nghiên cứu đã sử dụng OpenClaw, một khung tác nhân mã nguồn mở, không phụ thuộc vào nhà cung cấp, được xây dựng bởi nhà phát triển người Áo Peter Steinberger, người đã gia nhập OpenAI vào đầu năm nay. Tác nhân cốt lõi khởi chạy các tác nhân phụ và các tác vụ GPU chạy dài hạn, với cơ chế "heartbeat" (nhịp tim) tự động từ scaffold để đánh thức nó khi công việc hoàn thành nhằm thu thập kết quả.

Ablaufdiagramm des CRUX-2-Scaffolds mit vier Spuren für menschliche Nachrichten, Kernagent, Subagenten und GPU-Experimente sowie den Agent-Turns entlang einer Zeitachse.

Các tác giả gốc đã đánh giá các bài báo hoàn thiện với tư cách là nhà bình duyệt hội nghị và từ chối cả hai. Một bài nhận được đánh giá "Strong Reject" (Từ chối mạnh). Họ chỉ trích dữ liệu và thí nghiệm thiếu động lực, văn phong khó đọc và không có đóng góp mới. Một nhà bình duyệt gọi lập luận này là "ngụy biện chứng minh bằng ví dụ" và "hoàn toàn phi khoa học". Một người khác gọi các lựa chọn thí nghiệm là "kỳ quặc" và kết quả rõ ràng là sản phẩm của "những lựa chọn hậu kiểm" (post hoc).

Tabellarische Balkendarstellung der Reviews für Personas und TabPFN mit Anzahl genannter Schwächen und Stärken je Quelle, aufgeteilt nach Selbstreviews, externen KI-Reviewern und menschlichem Experten

Các kiểu thất bại liên tục xuất hiện

Phân tích nhật ký của tác nhân cho thấy những điểm yếu có hệ thống. Các tác nhân thiếu khả năng phán đoán về những gì đạt tiêu chuẩn cho một nghiên cứu có thể xuất bản, tạo ra các giả thuyết hợp lý nhưng lại loại bỏ chúng dựa trên các tập dữ liệu nhỏ, được chọn lọc thủ công hoặc tổng hợp.

Chúng cũng thất bại trong việc giải quyết vấn đề một cách sáng tạo. Khi các giả thuyết ban đầu bị bác bỏ, các tác nhân thu hẹp các tuyên bố hiện có thay vì theo đuổi các hướng đi mới. Các đánh giá AI nội bộ của chúng không bao giờ đưa ra kết quả "Accept" (Chấp nhận) trong suốt mười lăm vòng sửa đổi, nhưng các tác nhân không bao giờ giải quyết được những chỉ trích cốt lõi.

Các tác nhân cũng không thể quay lại (backtrack) một cách hiệu quả. Cả hai đều từ bỏ các mục tiêu nghiên cứu tham vọng nhất của mình trong vòng mười giờ đầu tiên. Trong lần chạy với Personas, tác nhân đã kết thúc quá trình khám phá chỉ sau năm giờ mặc dù đã lên kế hoạch từ 36 đến 48 giờ cho giai đoạn đó.

Zwei Dot-Plots stellen für Personas und TabPFN geplante Deadlines und tatsächliche Fertigstellung von sechs Projektmeilensteinen auf einer Zeitachse von 0 bis 120 Stunden gegenüber.

Nhận thức về tài nguyên cũng rất kém. Cả hai lần chạy đều kết thúc với chưa đầy một nửa ngân sách API được sử dụng. Một tác nhân tuyên bố dự án hoàn thành bảy giờ trước thời hạn, ngay sau khi nhà bình duyệt của chính nó đưa ra thêm một lượt "Reject" (Từ chối).

Các tác nhân cũng bị "instruction drift" (trôi dạt chỉ dẫn), dần quên đi các hướng dẫn rõ ràng trong một ngữ cảnh dài. Cả hai bài báo đều vượt quá giới hạn độ dài và sẽ bị loại ngay từ vòng sơ loại tại NeurIPS. Một bài báo không chứa bất kỳ hình ảnh minh họa nào trong văn bản chính, trong khi bản gốc do con người viết có 15 hình. Meta AI gần đây đã mô tả một hiện tượng liên quan chặt chẽ gọi là "behavioral state decay" (suy giảm trạng thái hành vi), nơi một tác nhân nhận ra yêu cầu từ sớm nhưng lại vi phạm nó sau đó khi sửa một lỗi không liên quan.

Liniendiagramm zum Personas-Durchlauf, das Wall-Clock-Zeit, Anthropic-API-Ausgaben und GPU-Compute als Anteil des Budgets über 140 Stunden zeigt; der API-Verbrauch endet bei 1.130 von 3.000 US-Dollar,

Kỹ thuật thì hiệu quả, tư duy nghiên cứu thì không

Các tác nhân đã quản lý tất cả công việc kỹ thuật mà không cần sự trợ giúp của con người. Chúng thực hiện tìm kiếm tài liệu, gỡ lỗi mã GPU, hoàn thành hàng trăm thí nghiệm và kiểm tra độ bền, đồng thời biên soạn các bài báo đầy đủ bằng LaTeX. Chỉ cần ba sự can thiệp của con người: sửa lỗi scaffold, gia hạn thời hạn và yêu cầu viết lại để dễ đọc hơn.

Các nhà nghiên cứu không tìm thấy hành vi "reward hacking" (hack phần thưởng) đáng kể nào. Các tác nhân không thao túng kết quả hoặc làm sai lệch dữ liệu để theo đuổi điểm số tốt hơn. Trên thực tế, chúng làm điều ngược lại, bắt đầu với những tuyên bố tham vọng và điều chỉnh chúng hướng tới các kết quả phủ định.

Vier verkleinerte Titelseiten der beiden vom Agenten geschriebenen Papers, jeweils vor und nach der von Menschen angeordneten Überarbeitung auf bessere Lesbarkeit.

Để kiểm tra xem các kết quả có phải là sản phẩm của thiết lập phần mềm hay không, các nhà nghiên cứu đã lặp lại một thí nghiệm với GPT-5.6 Sol và scaffold Codex của OpenAI. Hầu như tất cả các kiểu thất bại tương tự đều xuất hiện. GPT-5.6 đã tiêu tốn hết ngân sách 3.000 USD chỉ trong hơn hai ngày, dẫn đến các thí nghiệm không đạt quy mô cần thiết.

Kết quả mâu thuẫn với tuyên bố của các phòng thí nghiệm

Những phát hiện này trái ngược với các tuyên bố từ các phòng thí nghiệm AI hàng đầu. Vào tháng 6, Anthropic đã xuất bản một bài viết có tiêu đề "Khi AI tự xây dựng chính nó", chia sẻ dữ liệu nội bộ về khả năng tăng tốc nghiên cứu của chính họ và đưa ra ý tưởng về việc tạm dừng phát triển có phối hợp trên toàn cầu.

OpenAI tuyên bố rằng GPT-5.6 Sol đã hỗ trợ hậu huấn luyện (post-training) một mô hình nhỏ hơn và giúp các nhà nghiên cứu tiết kiệm vài tuần. Các tác giả của nghiên cứu lưu ý rằng đóng góp này thậm chí không được đề cập trong thẻ hệ thống (system card) dài 81 trang.

Nỗ lực suy luận nhiều hơn thực sự đã cải thiện chất lượng, như các thử nghiệm sơ bộ không có suy luận đã cho thấy. Nhưng các nhà nghiên cứu nghi ngờ rằng nhiều thời gian hoặc tài nguyên tính toán hơn cũng sẽ không thay đổi kết quả nhiều. Những phản đối của nhà bình duyệt nhắm vào chất lượng của các lựa chọn thí nghiệm, chứ không phải số lượng.

Các tác giả cho biết các mô hình tiên tiến có thể xử lý khía cạnh kỹ thuật của nghiên cứu AI nhưng "không thể giải quyết các câu hỏi nghiên cứu AI mở, kéo dài hàng tuần". Nghiên cứu chỉ bao gồm hai bài báo và các nhà bình duyệt không bị làm mù (blinded), họ biết cả câu hỏi nghiên cứu của chính mình và việc họ đang đánh giá công trình do AI tạo ra. Tuy nhiên, kết quả yếu đến mức rõ ràng nên những hạn chế này khó có thể thay đổi bức tranh tổng thể. Nhóm nghiên cứu đã công khai các đánh giá chuyên gia, nhật ký và kho lưu trữ tác nhân trực tuyến để các nhà nghiên cứu khác có thể tự đánh giá.

Tại sao bình duyệt là một thước đo tồi

Các tuyên bố trước đây về thành công của nghiên cứu tự chủ dựa gần như hoàn toàn vào các bài báo được chấp nhận, nhưng việc được chấp nhận đơn thuần không nói lên nhiều điều về chất lượng nghiên cứu. The AI Scientist-v2 của Sakana AI đã gửi ba bài báo tới một hội thảo ICLR vào năm 2025.

Một bài được chấp nhận với điểm trung bình 6.33, chỉ vừa đủ trên ngưỡng, và bị rút lại sau khi bình duyệt khi các nhà nghiên cứu phát hiện lỗi trích dẫn. Tỷ lệ chấp nhận tại hội thảo dao động từ 60 đến 70 phần trăm, cao hơn nhiều so với mức 20 đến 30 phần trăm tại các hội nghị chính. Shadow Evaluation tránh được vấn đề này bằng cách chuyển việc đánh giá lại cho các tác giả gốc.

Sakana AI kể từ đó đã thành lập một phòng thí nghiệm nghiên cứu chuyên dụng cho việc tự cải thiện đệ quy vào tháng 6 năm 2026. Theo công ty, một phiên bản sau của AI Scientist đã viết một bài báo vượt qua vòng bình duyệt. Nghiên cứu liên quan đã được xuất bản trên Nature vào tháng 3 năm 2026.

Cuộc tìm kiếm AI tạo ra tri thức mới

Sự chỉ trích đang gia tăng cùng với các kết quả thực nghiệm này. Tom Zahavy của Google DeepMind lập luận trong bài báo quan điểm "LLMs can't jump" (LLM không thể nhảy vọt) rằng các mô hình ngôn ngữ thiếu cơ chế nhận thức để tạo ra thứ gì đó thực sự mới. Ông viết, AI Scientist chỉ đơn thuần kết hợp lại các khái niệm hiện có, trong khi AlphaEvolve của DeepMind vượt trội trong việc tối ưu hóa nhưng cần một tín hiệu lỗi rõ ràng để hoạt động.

Những đột phá toán học gần đây có vẻ mâu thuẫn với quan điểm đó, nhưng có lẽ không phải vậy. Vào tháng 5, một mô hình suy luận của OpenAI đã bác bỏ một giả thuyết về hình học khoảng cách đơn vị mà Paul Erdős đặt ra vào năm 1946. Người đoạt huy chương Fields Tim Gowers gọi kết quả này là "cột mốc trong toán học AI". Ngay sau đó, Claude Mythos đã giải quyết cùng một vấn đề với cái mà kỹ sư Sholto Douglas của Anthropic gọi là "một chứng minh đơn giản, dễ thương". OpenAI sau đó xác nhận Astra, một dòng mô hình mới được cho là đã giải quyết mười vấn đề mở trong toán học và khoa học máy tính lý thuyết mà lĩnh vực này đã bế tắc trong ít nhất một thập kỷ.

Nhưng các chứng minh toán học là diễn dịch, rút ra các kết luận cần thiết từ các quy tắc cố định hoặc tìm kiếm một cách có hệ thống trong các không gian giải pháp lớn. Điều đó rất ấn tượng, nhưng đó là những gì các mô hình tiên tiến được xây dựng để làm. Nghiên cứu cũng đòi hỏi sự suy luận dạng "abduction" (suy diễn ngược), bước nhảy sáng tạo để phát minh ra nguyên nhân giải thích cho một hiện tượng đáng ngạc nhiên. Việc xây dựng các câu hỏi nghiên cứu mới, thiết kế các thí nghiệm phù hợp và rút ra kết luận vững chắc từ kết quả là những điều mà các mô hình ngày nay vẫn chưa thể làm được.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.