The Decoder: AI News
92

Nghiên cứu

Google DeepMind nâng cấp Co-Scientist: Trợ lý AI tự vận hành phòng thí nghiệm và viết báo cáo khoa học

(giờ Việt Nam)

Tóm tắt AI

Google DeepMind phát triển hệ thống đa tác nhân Co-Scientist thành cộng sự nghiên cứu toàn diện, có khả năng lập kế hoạch, điều khiển thiết bị và viết bài báo khoa học. Hệ thống này đã chứng minh hiệu quả vượt trội trong các lĩnh vực vật liệu, sinh học và khoa học máy tính.

Bản dịch AI

Google Deepmind's AI Co-Scientist now plans experiments, runs lab equipment, and writes scientific papers

Google Deepmind đã mở rộng hệ thống đa tác nhân (multi-agent system) Co-Scientist từ một công cụ tạo giả thuyết thành một đối tác nghiên cứu tích hợp trong phòng thí nghiệm. Theo Google, hệ thống này đã mang lại những kết quả được kiểm chứng bằng thực nghiệm trên ba lĩnh vực khác nhau.

Được xây dựng dựa trên các mô hình Gemini hiện tại, Co-Scientist giờ đây có thể lập kế hoạch thí nghiệm, viết mã và điều khiển thiết bị phòng thí nghiệm thay vì chỉ tạo ra các giả thuyết. Điểm mới về mặt kỹ thuật chính là quy trình nghiên cứu khép kín: hệ thống tự rút ra giả thuyết từ một câu hỏi nghiên cứu, tạo ra các kế hoạch thí nghiệm, chương trình hoặc giao thức phòng thí nghiệm mà máy có thể đọc được, phân tích kết quả và tạo ra các bản thảo khoa học.

Các mô-đun xác minh sẽ đối chiếu các tuyên bố bằng số trong văn bản với nhật ký thực thi của mã được tạo ra để cắt giảm các kết quả bị làm giả. Google lần đầu giới thiệu Co-Scientist vào tháng 2 năm 2025, khi đó dựa trên Gemini 2.0 và còn nhiều thiếu sót trong việc kiểm chứng thực tế cũng như tổng quan tài liệu.

Hệ thống mở rộng này đã được kiểm chứng trên ba lĩnh vực với mức độ tự chủ ngày càng tăng. Co-Scientist đã thiết kế các công thức tổng hợp cho con người thực hiện trong lĩnh vực khoa học vật liệu, xây dựng quy trình dự đoán với phản hồi từ chuyên gia trong lĩnh vực sinh học và làm việc hoàn toàn độc lập trong lĩnh vực khoa học máy tính.

Co-Scientist tổng hợp, dự đoán và thiết kế

Đối với tổng hợp vật liệu, các nhà nghiên cứu đã kết hợp Co-Scientist với một lò nung nhiệt độ cao bán tự động. Hệ thống đã tìm ra một lộ trình an toàn hơn cho một loại vật liệu 2D được săn đón, vốn trước đây chủ yếu được sản xuất thông qua quá trình ăn mòn nguy hiểm, và tạo ra các công thức tăng trưởng hoàn chỉnh phù hợp với thiết bị của phòng thí nghiệm. Sau 25 vòng tinh chỉnh với sự tham gia của con người, nhóm nghiên cứu đã tạo ra các cấu trúc phân lớp có đặc tính giống với vật liệu mục tiêu, nhưng việc xác nhận chính xác cấu trúc nguyên tử vẫn đang chờ xử lý.

Trong thí nghiệm thứ hai, ba màng mỏng bán dẫn đã được tổng hợp ngay trong lần thử đầu tiên. Co-Scientist đã sử dụng Gemini 3 Deep Think để điều khiển thiết bị trực tiếp, rút ngắn thời gian phát triển công thức từ vài ngày xuống còn vài phút. Con người vẫn phải nạp mẫu và nguyên liệu thô theo cách thủ công, và chế độ nhanh đã tạo ra các tinh thể nhỏ hơn, kém đồng nhất hơn so với các công thức được tối ưu hóa kỹ lưỡng. Tác giả chính Samuel Schmidgall viết rằng việc liệu các công thức này có thể chuyển giao sang các phòng thí nghiệm khác hay không vẫn còn là một câu hỏi bỏ ngỏ.

Trong lĩnh vực sinh học, Co-Scientist đã tự động xây dựng một quy trình phân tích hình ảnh để dự đoán các mô hình mà các khuẩn lạc E. coli biến đổi gen hình thành ở các nồng độ hóa chất khác nhau. Các dự đoán được tạo ra với Gemini 3 Pro Image khớp với các kết quả phòng thí nghiệm chưa được công bố ở ba trong số bốn đặc điểm hình dạng. Các nhà nghiên cứu thừa nhận hệ thống chỉ suy luận giữa các điều kiện đã biết và không thể dự đoán hành vi trong các hệ thống hoàn toàn mới. Điều đó sẽ còn đáng kinh ngạc hơn nhiều.

Một thí nghiệm khoa học máy tính đã được thực hiện mà không có bất kỳ sự can thiệp nào của con người ngoài khâu thiết lập ban đầu. Co-Scientist đã thiết kế "Agent_H", một kiến trúc AI y tế có khả năng phân loại các truy vấn đầu vào, tạo ra hàng chục ứng viên phản hồi song song và tinh chỉnh chúng. Sau khi sửa lỗi các phản hồi quá dài, Agent_H đã vượt qua sáu mô hình tiên phong trên các tiêu chuẩn đánh giá sức khỏe, bao gồm cả GPT-5 và Claude Opus 5.

Tuy nhiên, kết quả từ các tiêu chuẩn đánh giá lại không đứng vững trước sự đánh giá của con người. Ba bác sĩ có chứng chỉ hành nghề đã chấm điểm các phản hồi trên chín danh mục, và Agent_H chỉ cho thấy ưu thế vượt trội có ý nghĩa thống kê so với mô hình cơ sở Gemini 3.1 Pro ở duy nhất một khía cạnh: giảm thiểu rủi ro đối với các phản hồi có khả năng gây hại.

Các trình đánh giá tiêu chuẩn tự động cũng chỉ có mối tương quan yếu với đánh giá của các bác sĩ. Các nhà nghiên cứu cho biết, điểm số tiêu chuẩn cao không có nghĩa là một hệ thống thực sự đưa ra câu trả lời tốt hơn từ góc độ lâm sàng, điều này đặt ra câu hỏi về việc các tiêu chuẩn này thực sự đang đo lường điều gì.

Các mô-đun độ tin cậy giúp giảm tỷ lệ ảo giác xuống còn 4 phần trăm

Một vấn đề cốt lõi với các hệ thống nghiên cứu tự chủ dựa trên LLM là tình trạng "AI bullshit" (AI nói nhảm/bịa đặt). Khi một tác nhân AI được khen thưởng vì kết quả tốt, nó có động lực để bịa đặt thông tin. Các phân tích trước đây đã ghi nhận tỷ lệ bịa đặt từ 80 đến 100 phần trăm ở các hệ thống hiện có. Co-Scientist giải quyết vấn đề này theo hai cách. Hệ thống sẽ bị phạt nếu nội dung bịa đặt hoặc đạo văn, và một mô-đun xác minh riêng biệt sẽ đối chiếu mọi tuyên bố bằng số với kết quả thực tế của mã đã thực thi.

Trong một nghiên cứu mù đôi với 30 chuyên gia trong ngành và 450 bài đánh giá độc lập, các nhà nghiên cứu đã đánh giá 150 bài báo được tạo tự động. Với các mô-đun độ tin cậy được kích hoạt, Co-Scientist đã bịa đặt các kết quả chính trong 4 phần trăm các trường hợp. Nếu không có chúng, tỷ lệ này lên tới 46 phần trăm. Hệ thống đối chứng đạt tới 90 phần trăm.

Dữ liệu hoàn toàn bịa đặt không bao giờ xuất hiện trong kết quả đầu ra của Co-Scientist nhưng lại xuất hiện trong 44 phần trăm các bài báo của hệ thống đối chứng. Nội dung gần như đạo văn đã giảm từ 60 phần trăm xuống còn 16 phần trăm. Một kiến trúc an toàn tích hợp đã từ chối 98,7 phần trăm các hướng nghiên cứu có khả năng gây hại.

Mặc dù có những cải thiện, các nhà nghiên cứu vẫn quan sát thấy những sai sót còn sót lại. Hệ thống có xu hướng báo cáo chọn lọc và theo Schmidgall, nó viết "các phương pháp rất hợp lý trong bài báo nhưng lại không khớp với mã thực tế của nó".

Khoảng cách giữa trợ lý phòng thí nghiệm và nhà nghiên cứu tự chủ vẫn còn rất lớn

Các nhà nghiên cứu coi những kết quả này là bước tiến hướng tới các hệ thống AI đa tác nhân khép kín, có khả năng cải thiện thông qua phản hồi thực nghiệm và có thể đẩy nhanh tốc độ nghiên cứu khoa học. Schmidgall viết: "Còn một chặng đường dài phía trước trước khi các hệ thống AI có thể điều hướng được thực tế vật lý của khoa học. Nhưng chúng tôi vô cùng hào hứng về tiềm năng của các LLM trong việc hỗ trợ con người và thúc đẩy sự tiến bộ trong thế giới thực".

Nghiên cứu tự động hiện là một trong những ứng dụng AI được thổi phồng nhiều nhất. OpenAI dự định ra mắt một hệ thống tác nhân AI vào mùa thu này, có khả năng thực hiện nghiên cứu ít nhất ở cấp độ thực tập sinh. Tuy nhiên, vẫn còn một cuộc tranh luận đang diễn ra về việc liệu các hệ thống dựa trên LLM hiện nay có thực sự khám phá ra tri thức mới hay chỉ đang làm rõ những gì đã có sẵn trong dữ liệu huấn luyện của chúng.

Google DeepMindAI trong khoa họcTự động hóaNghiên cứuCo-Scientist
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.