Hacker News: AI bài nổi bật
85

Nghiên cứu

Nghiên cứu từ Princeton: AI vẫn chưa thể tự mình thực hiện các nghiên cứu khoa học mở

(giờ Việt Nam)

Tóm tắt AI

Nhóm nghiên cứu tại Princeton đã thử nghiệm cho AI tự thực hiện các nghiên cứu khoa học, kết quả cho thấy dù tốn kém ngân sách và thời gian, AI vẫn chưa thể thay thế con người trong việc tự chủ nghiên cứu chuyên sâu.

Bản dịch AI

AI’s recursive self-improvement might not come so quickly after all

Lời hứa táo bạo nhất của ngành công nghiệp AI hiện nay là AI sẽ sớm tự cải thiện bản thân mà gần như không cần sự giám sát của con người. Các mô hình ngôn ngữ lớn (LLM) hiện đã có thể viết mã, tạo dữ liệu tổng hợp để huấn luyện và tối ưu hóa các con chip máy tính mà chúng vận hành. Những dự báo về sự tiến bộ bùng nổ của AI cho rằng cái mà các nhà nghiên cứu gọi là "tự cải thiện đệ quy" (recursive self-improvement) đang ở rất gần.

Tuy nhiên, một nghiên cứu mới cho thấy chúng ta có thể còn mất một thời gian nữa mới đạt được điều đó. Các nhà nghiên cứu đứng sau nghiên cứu này nhận thấy rằng các tác nhân AI (AI agents) vẫn chưa đủ khả năng thực hiện nghiên cứu AI mang tính mở—những cuộc điều tra tự do không có câu trả lời rõ ràng và đòi hỏi sự phán đoán cũng như gu thẩm mỹ, những yếu tố có thể là không thể thiếu để xây dựng một AI tự cải thiện.

Một nhóm các nhà nghiên cứu từ nhiều tổ chức, dẫn đầu bởi Peter Kirgis và Sayash Kapoor tại Đại học Princeton, nhận thấy rằng các tác nhân AI có thể giải quyết các vấn đề kỹ thuật cần thiết để thực hiện nghiên cứu AI, nhưng lại thiếu sự phán đoán và sáng tạo để tạo ra các nghiên cứu gốc đạt tiêu chuẩn của các bài báo được chấp nhận tại một hội nghị học máy hàng đầu. Khoảng cách này cho thấy một số mốc thời gian đầy hứa hẹn về việc tự động hóa nghiên cứu AI có thể đang đi trước cả bằng chứng thực tế.

Hầu hết các nghiên cứu hiện có về cách các tác nhân có thể tự động hóa nghiên cứu AI đều đánh giá khả năng hoàn thành các nhiệm vụ hẹp với các câu trả lời có thể kiểm chứng, chẳng hạn như giải quyết các vấn đề kỹ thuật hoặc hậu huấn luyện (post-training) các mô hình ngôn ngữ nhỏ dựa trên một bộ tiêu chuẩn (benchmark). Nhưng để đạt được tiến bộ trong nghiên cứu AI, cần phải có tư duy mở—chọn lọc các giả thuyết, quyết định bằng chứng nào sẽ giải quyết được vấn đề, hoặc biết khi nào cần bắt đầu lại từ đầu.

Để kiểm tra các tác nhân về những kỹ năng đó, các nhà nghiên cứu trong nghiên cứu này đã đề xuất một phương pháp đánh giá mới gọi là "đánh giá bóng" (shadow evaluation), yêu cầu AI trả lời một câu hỏi nghiên cứu từ một bài báo chất lượng cao chưa được công bố.

Các nhà nghiên cứu đã yêu cầu mô hình Claude Opus 4.8 của Anthropic, chạy trên phần mềm mã nguồn mở có tên OpenClaw, giải quyết các câu hỏi như vậy, trong trường hợp này là từ hai bài báo được gửi đến hội nghị học máy danh giá NeurIPS 2026.

Câu hỏi đầu tiên là liệu các "nhân cách" (personas) của một mô hình ngôn ngữ lớn, vốn quyết định hành vi của nó, có thể được kiểm soát bằng cách chỉnh sửa trọng số của mô hình (hàng tỷ con số lưu trữ mọi thứ nó học được trong quá trình huấn luyện) hay không. Câu hỏi còn lại là làm thế nào để thiết kế một bộ dò tìm (detector) chỉ ra khi nào một mô hình đưa ra dự đoán dựa trên dữ liệu bảng tính trở nên không đáng tin cậy. Vì các bài báo này chưa được công khai, các tác nhân không thể ghi nhớ câu trả lời từ dữ liệu huấn luyện hoặc tìm thấy chúng trên mạng.

Các tác nhân được cấp sáu ngày, 3.000 USD tín dụng API của Anthropic, ngân sách GPU để chạy các thí nghiệm, máy tính ảo riêng và quyền truy cập vào web mở để tạo ra một bài báo nghiên cứu xứng đáng được xuất bản tại một hội nghị AI hàng đầu. Các tác giả gốc của các bài báo đã chấm điểm bài làm của các tác nhân như cách họ đánh giá một bài báo được gửi đến hội nghị.

Các tác giả đó đã từ chối cả hai bài báo.

Các nhà khoa học con người nhận thấy rằng các tác nhân có khả năng thực hiện tất cả các công việc kỹ thuật cần thiết để tiến hành nghiên cứu. Các tác nhân đã xem xét tài liệu, chạy hàng trăm thí nghiệm và tổng hợp kết quả.

"Mặt khác, các tác nhân rõ ràng là rất tệ trong việc thực hiện chính nghiên cứu đó," Kapoor nói. Chúng chạy các thí nghiệm kỳ quặc (trong một số trường hợp là kiểm tra giả thuyết trên các tập dữ liệu tổng hợp nhỏ xíu), chật vật trong việc viết một cách dễ hiểu về công việc của mình và không đóng góp gì mới mẻ cho lĩnh vực này. "Các bài báo không hề đạt tiêu chuẩn chất lượng của một hội nghị AI hàng đầu," ông nói.

Đó là vì các tác nhân chật vật trong việc huy động sự sáng tạo và phán đoán cần thiết để tiến hành nghiên cứu. Chúng không khám phá đủ các ý tưởng khác nhau và cam kết với các phương pháp thiếu triển vọng quá nhanh chóng. Mặc dù các tác nhân đã phát triển các giả thuyết mới lạ và đầy tham vọng giống như những giả thuyết mà chính các tác giả gốc đã bắt đầu, chúng lại bác bỏ chúng dựa trên dữ liệu rất hạn chế. Và chúng không thể quay lại từ những phương pháp thất bại. Chúng có thể thực hiện những thay đổi nhỏ nhưng không thể suy nghĩ lại về phương pháp của mình một cách căn bản hoặc thử những phương pháp mới từ đầu.

Các tác nhân cũng không kết hợp được phản hồi từ các tác nhân phụ hoặc các công cụ đánh giá AI bên ngoài. Thay vì sửa đổi phương pháp luận, các tác nhân lại thu hẹp các tuyên bố và thêm vào các cảnh báo. Chúng cũng không thể sử dụng hiệu quả các tài nguyên như token, khả năng tính toán và thời gian. Và chúng không thể tuân theo các hướng dẫn về những việc như dành bao nhiêu thời gian cho các giai đoạn nghiên cứu khác nhau hoặc bài báo của chúng có thể dài bao nhiêu.

Bất chấp mọi thất bại, các tác nhân không tham gia vào hành vi sai trái mà các nhà nghiên cứu gọi là "hack phần thưởng" (reward hacking), tức là che giấu hoặc trình bày sai lệch các thí nghiệm hoặc dữ liệu. Mặc dù các tác nhân phụ, hay các AI hỗ trợ do tác nhân chính tạo ra để xử lý các phần công việc, đôi khi bị ảo giác hoặc trình bày sai kết quả, nhưng những điều này đã được phát hiện bởi tác nhân điều phối (orchestrator agent), AI chính giám sát dự án.

Lý do các mô hình AI giỏi về kỹ thuật nghiên cứu nhưng không giỏi về nghiên cứu mở có thể nằm ở cách chúng được huấn luyện, Kapoor nói. Các mô hình trở nên giỏi bất cứ thứ gì chúng có thể được rèn luyện trong một chế độ huấn luyện gọi là học tăng cường (reinforcement learning), vốn dễ áp dụng hơn cho các nhiệm vụ mà sự thành công có thể được kiểm tra tự động. "Nhưng khó hơn để tạo ra các môi trường huấn luyện các mô hình này khi bản thân nhiệm vụ đó là mở," ông nói.

Kapoor cho biết nhóm hiện đang thực hiện thí nghiệm với Mythos, mô hình tiên tiến nhất của Anthropic, ra mắt vào tháng 4. Sau đó, nó được chính quyền Trump yêu cầu đáp ứng các hạn chế an toàn khác nhau và hiện chỉ dành cho các tổ chức được phê duyệt. Anthropic đã không phản hồi yêu cầu bình luận.

Nghiên cứu này có một số hạn chế. Nó chỉ bao gồm hai bài báo nghiên cứu, và các tác giả gốc biết rằng các bài báo họ đang chấm điểm được tạo ra bởi các tác nhân AI, điều này có thể đã ảnh hưởng đến đánh giá của họ. Và các nhà nghiên cứu có quyền quyết định đáng kể trong việc thiết kế và thực hiện nghiên cứu, nghĩa là những niềm tin và định kiến sẵn có của họ có thể đã lọt vào kết quả. Các đánh giá về nghiên cứu mở phải đánh đổi một phần tính khách quan để có được một bài kiểm tra phong phú hơn bất kỳ tiêu chuẩn nào có thể cung cấp.

Tuy nhiên, kết quả này có thể làm giảm bớt các tuyên bố rằng sự tự cải thiện đệ quy đang ở gần. Vào tháng 6, Anthropic đã xuất bản một bài đăng trên blog có tiêu đề "Khi AI tự xây dựng chính nó", vạch ra tiến trình hướng tới các mô hình giúp tăng tốc sự phát triển của chính chúng. Vào tháng 7, OpenAI đã quảng cáo thực tế rằng mô hình mới GPT-5.6 Sol của họ đã giúp hậu huấn luyện một mô hình nhỏ hơn, giúp các nhà nghiên cứu tiết kiệm hàng tuần làm việc.

Phát hiện mới này có thể phản ánh những gì các công ty AI đang tìm thấy nội bộ, bất kể những tuyên bố công khai lạc quan nhất của họ. Đồng sáng lập Anthropic, Jack Clark, đã viết trong bản tin Import AI của mình rằng nó tương đồng với những gì công ty tìm thấy khi cố gắng tự động hóa một số khía cạnh của nghiên cứu an toàn AI.

"Có một sự thiếu vắng nhất định về sự sáng tạo trực quan, có giá trị trong các hệ thống AI ngày nay, và mặc dù chúng là những kỹ sư cực kỳ có năng lực, chúng dường như có một đặc tính tư duy máy móc, công thức có thể ngăn cản chúng trở thành những nhà nghiên cứu giỏi," ông viết. Ông gọi sự thiếu sáng tạo của các hệ thống AI là một "tín hiệu bi quan về các mốc thời gian tự cải thiện đệ quy ngắn hạn".

Các công ty AI có mọi động lực để phát triển các hệ thống AI có thể nhanh chóng thúc đẩy sự tiến bộ của chính chúng, giống như cách họ đã làm để giúp các mô hình giỏi hơn trong việc viết mã. OpenAI đã đặt mục tiêu rõ ràng là xây dựng một nhà nghiên cứu AI tự động, và Anthropic xác định AI tự cải thiện là cột mốc tiếp theo của ngành.

"Nếu có sự đầu tư và sau đó là nỗ lực có ý thức theo hướng này, tôi cảm thấy sẽ có những tiến bộ thú vị, ngay cả khi hiện tại nó đang thất bại," Najoung Kim, giáo sư ngôn ngữ học và khoa học máy tính tại Đại học Boston, người nghiên cứu cách các tác nhân AI có thể tự động hóa nghiên cứu AI nhưng không tham gia vào nghiên cứu này, cho biết. Mặt khác, có khả năng tiến bộ AI có thể bị phân tách. Các hệ thống AI có thể chạy đua trước ở các nhiệm vụ hẹp—loại có thể được chấm điểm—trong khi tiến bộ chậm chạp ở các nghiên cứu mở.

Câu hỏi lớn chưa có lời giải, vì vậy, là nghiên cứu mở quan trọng như thế nào đối với sự tự cải thiện đệ quy—liệu các hệ thống AI có thể đạt được điều đó mà không cần nó, chỉ bằng cách cải thiện các nhiệm vụ hẹp hơn hay không. "Nếu chúng ta nhìn lại những tiến bộ lớn nhất trong lĩnh vực này, việc phát minh ra các transformer hoặc phát minh ra các kiến trúc lớn mới cho phép chúng ta đạt được nhiều tiến bộ AI—tất cả những điều đó đều đòi hỏi những bước nhảy vọt về sáng tạo," Kapoor nói.

"Điều đó nói lên rằng, những người khác có giả thuyết này rằng tất cả những gì chúng ta cần cho AI mang tính biến đổi, đặc biệt là cho sự tự cải thiện đệ quy, đã có ở đó rồi." Điều đó bao gồm việc làm cho một mô hình huấn luyện nhanh hơn và tăng điểm số chuẩn của nó.

"Thành thật mà nói, đó là câu hỏi trị giá hàng nghìn tỷ đô la ngay lúc này," ông nói.

a dart board against a stack of research papers with darts just shy of hitting the target
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.