Google Research: Blog (Web)
92

Nghiên cứu

Science One: Khung nghiên cứu khoa học tự hành với cơ chế kiểm chứng bằng chuỗi bằng chứng

(giờ Việt Nam)

Tóm tắt AI

Google Research giới thiệu Science One, khung nghiên cứu tự hành tích hợp chuỗi bằng chứng (Chain-of-Evidence) nhằm loại bỏ ảo giác AI, đi kèm giao thức kiểm định tự động CoE Audit.

Bản dịch AI

Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence

Các mô hình ngôn ngữ lớn (LLM) ngày càng được triển khai không chỉ với vai trò trợ lý lập trình mà còn là các tác nhân tự hành có khả năng thực hiện toàn bộ quy trình nghiên cứu khoa học từ đầu đến cuối. Các hệ thống gần đây (ví dụ: AI-Scientist của Sakana, AutoResearchClaw, DeepScientist, AI-Researcher) có thể đánh giá tài liệu, xây dựng giả thuyết, thực hiện thí nghiệm và viết các bản thảo hoàn chỉnh có chất lượng tương đương với các bài báo do con người viết. Tuy nhiên, khi chất lượng bề mặt của các bản thảo do AI tạo ra ngày càng cải thiện, một vấn đề cấu trúc nghiêm trọng đã xuất hiện: khả năng kiểm chứng. Vì các quy trình nghiên cứu tự hành hiện nay tạo văn bản theo phương thức lặp, các lỗi phát sinh ở bất kỳ giai đoạn nào cũng đều bị khuếch đại. Một số hệ thống hiện có có thể tạo ra các trích dẫn không tồn tại, thể hiện sự sai lệch giữa phương pháp được mô tả và mã nguồn thực tế, cũng như báo cáo các kết quả thí nghiệm không thể tái lập hoàn toàn từ mã nguồn được cung cấp.

Trong bài báo này, chúng tôi giải quyết vấn đề trên bằng cách giới thiệu Chain-of-Evidence (CoE), một khung kiểm chứng mới dành cho nghiên cứu dựa trên AI. Chúng tôi hiện thực hóa CoE thông qua Science One Framework, một nguyên mẫu nghiên cứu tự hành có khả năng xây dựng và duy trì các chuỗi bằng chứng một cách tự nhiên, cùng với CoE Audit, một bộ các chỉ số đánh giá tự động nhằm đo lường tính toàn vẹn của các bài báo do AI tạo ra so với mã nguồn và bằng chứng nền tảng của chúng. Kết quả của chúng tôi cho thấy các hệ thống cơ sở (baseline) tạo ra các tài liệu tham khảo ảo (hallucination) lên tới 21% và thường xuyên làm sai lệch giữa mã nguồn và văn bản, trong khi Science One Framework đạt tỷ lệ tài liệu tham khảo ảo bằng 0 và các kết quả có thể kiểm chứng hoàn toàn, đồng thời đạt hiệu suất tiên tiến nhất trên các tiêu chuẩn đánh giá (benchmark) hàng đầu như MLE-Bench và Parameter-Golf.

Chain-of-Evidence: Một khung làm việc cho nghiên cứu có thể kiểm chứng

CoE là một khung khái niệm xác định những yếu tố tạo nên độ tin cậy cho một sản phẩm nghiên cứu, tương tự như cách ACID xác định tính tin cậy của một giao dịch cơ sở dữ liệu. Thay vì quy định cách xây dựng một tác nhân nghiên cứu, khung làm việc này chỉ định các thuộc tính mà đầu ra của tác nhân đó phải có. Nó tuân theo một nguyên tắc duy nhất với hai khía cạnh: mọi tuyên bố trong một sản phẩm nghiên cứu phải đi kèm với một chuỗi bằng chứng được ghi lại (tính đầy đủ), và mỗi chuỗi phải thực sự hỗ trợ cho tuyên bố mà nó gắn liền (tính đúng đắn). Một tuyên bố có thể là tài liệu tham khảo, một con số được báo cáo, mô tả phương pháp hoặc kết luận, và phải liên kết ngược lại với bằng chứng tương ứng, chẳng hạn như bài báo đã qua bình duyệt, dòng nhật ký thí nghiệm, mã nguồn thực tế đã chạy hoặc bảng kết quả.

Một tài liệu tham khảo ảo trỏ đến một bài báo không tồn tại. Một kết quả không thể tái lập sẽ không xuất hiện lại khi chạy lại mã nguồn. Một phương pháp được mô tả sai sẽ tuyên bố sử dụng thuật toán này trong bài báo trong khi mã nguồn lại triển khai thuật toán khác. Mỗi trường hợp trên đều là một tuyên bố có chuỗi bằng chứng bị đứt gãy; CoE Audit giúp các điểm đứt gãy này trở nên có thể đo lường được.

Science One Framework

Để chứng minh rằng nghiên cứu AI có thể kiểm chứng mà không làm giảm hiệu suất giải quyết vấn đề, chúng tôi đã thiết kế Science One Framework. Không giống như các tác nhân trước đây tạo ra bài báo rồi mới cố gắng liên kết các dữ kiện một cách hồi tố, Science One Framework hiện thực hóa khung làm việc CoE ngay từ quá trình xây dựng thông qua ba mô-đun chính:

CoE Audit: Đo lường khả năng kiểm chứng

Để đánh giá nghiêm ngặt nguyên mẫu Science One Framework so với các hệ thống cơ sở tiên tiến nhất (ví dụ: AI Scientist v2 của Sakana AI, AutoResearchClaw, DeepScientist, AI-Researcher), chúng tôi đã phát triển CoE Audit. Giao thức đánh giá hậu kiểm này đóng vai trò như một người đánh giá pháp y tự động, thực hiện bốn kiểm tra tính toàn vẹn nghiêm ngặt trên các sản phẩm được tạo ra (bài báo, giải pháp, mã nguồn và tài liệu tham khảo):

Kết quả

Chúng tôi đã áp dụng CoE Audit cho 75 bài báo được tạo ra trên năm tác vụ tối ưu hóa hệ thống (Prism, Cloudcast, EPLB, LLM-SQL và lập lịch giao dịch) từ tiêu chuẩn đánh giá Automated Design of Research Systems (ADRS).

Science One Framework vượt trội đáng kể so với các hệ thống cơ sở hiện có về khả năng kiểm chứng. CoE Audit áp dụng cùng một giao thức độc lập cho mọi hệ thống, kiểm tra lại từng tài liệu tham khảo đối chiếu với các cơ sở dữ liệu học thuật trực tuyến, và theo đó, Science One Framework dẫn đầu ở cả bốn kiểm tra tính toàn vẹn. Không có tài liệu tham khảo nào của hệ thống này là ảo: mỗi tài liệu đều trỏ đến một bài báo có thật và có thể truy xuất, so với tỷ lệ ảo hóa lên tới 21% ở các hệ thống cơ sở, bởi vì Problem Investigator truy xuất mọi tài liệu tham khảo thay vì tạo ra chúng từ bộ nhớ. Hệ thống cũng đạt được khả năng kiểm chứng kết quả hoàn hảo và sự liên kết giữa phương pháp-mã nguồn ở mức cao nhất. Ngược lại, các hệ thống cơ sở thường mô tả các thuật toán phức tạp (như "bộ giải thần kinh-biểu tượng lai") trong khi mã nguồn được gửi lại chỉ là một thuật toán heuristic đơn giản, tất định.

Quan trọng hơn, việc triển khai khả năng kiểm chứng nghiêm ngặt không làm ảnh hưởng đến năng lực khoa học của tác nhân. Science One Framework đạt hoặc vượt hiệu suất của chuyên gia con người trên cả năm tác vụ ADRS, đạt điểm tổng thể tốt nhất trong số tất cả các hệ thống ở hai trong số các tác vụ đó (Cloudcast và EPLB).

Để kiểm tra khả năng tổng quát hóa, chúng tôi đã triển khai Science One Framework trên sáu tác vụ bên ngoài có độ phức tạp cao:

Hướng tới tương lai

Khi các hệ thống nghiên cứu tự hành mở rộng quy mô để giải quyết các vấn đề khoa học ngày càng khó khăn, chất lượng của bộ giải đơn thuần sẽ không còn đủ để tạo ra sự khác biệt. Điều sẽ phân biệt đầu ra của chúng chính là liệu nghiên cứu thu được có thể tin cậy được hay không. Các phát hiện của chúng tôi chứng minh rằng khả năng kiểm chứng phải được coi là một ràng buộc kiến trúc ưu tiên hàng đầu. Bằng cách xây dựng các chuỗi bằng chứng ngay tại thời điểm tuyên bố được tạo ra thay vì cố gắng tái tạo cơ sở dữ liệu sau đó, Science One Framework chứng minh rằng các tác nhân AI có thể tạo ra các nghiên cứu khoa học nghiêm túc, đáng tin cậy và có tính cạnh tranh cao. Chúng tôi hy vọng khung làm việc Chain-of-Evidence và quy trình kiểm toán của nó sẽ đóng vai trò là những công cụ hữu ích cho cộng đồng khi chúng ta tiếp tục xây dựng thế hệ các nhà khoa học AI tiếp theo.

Lời cảm ơn

Chúng tôi xin cảm ơn Bhavana Dalvi Mishra, Jiefeng Chen, Chun-Liang Li, Palash Goyal, Mihir Parmar, Yiwen Song, Yale Song, Raj Sinha, Parthasarathy Ranganathan, Burak Gokturk và Jinsung Yoon vì những đóng góp quý báu của họ cho công trình này.

Tuyên bố miễn trừ trách nhiệm

Science One Framework là một nguyên mẫu nghiên cứu thực nghiệm, không phải là các công cụ sẵn sàng cho sản xuất.

Science-One-4-FinalScience-One-3-FinalScience-One-2
Google ResearchAI tự hànhNghiên cứu khoa họcChain-of-EvidenceKiểm chứng AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google Research: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.