Nghiên cứu
Một bài báo khoa học làm thay đổi quy chuẩn đánh giá AI: Doanh nghiệp Trung Quốc dẫn đầu bảng xếp hạng
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu mới từ một công ty Trung Quốc đã thiết lập tiêu chuẩn đánh giá thống nhất cho lĩnh vực nghiên cứu AI, vốn đang là tâm điểm đầu tư của các tập đoàn công nghệ toàn cầu.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
24-08-2026 21:21:22 Nguồn: QbitAI
Nghiên cứu khoa học bằng AI mà các tập đoàn lớn toàn cầu đang đặt cược cuối cùng đã có tiêu chuẩn thống nhất
Yun Zhong đưa tin từ Aofeisi
QbitAI | Kênh chính thức QbitAI
Tháng 8 năm nay, nhà khoa học trưởng của Google, Jeff Dean, đã tuyên bố rời công ty để thành lập Discovery Loop, một công ty chuyên về AI4S (AI for Science).
Cũng trong năm nay, các gã khổng lồ công nghệ như OpenAI, Anthropic và NVIDIA lần lượt công bố gia nhập lĩnh vực AI4S.
Mục tiêu của nhóm các "ông lớn" lấn sân này rất đồng nhất: không chỉ dừng lại ở việc tạo ra các công cụ hỗ trợ nghiên cứu, mà là xây dựng những "nhà khoa học AI" có khả năng tự vận hành toàn bộ chu trình nghiên cứu khoa học từ "giả thuyết → thiết kế thí nghiệm → thực thi xác thực → tối ưu hóa lặp lại".
Không chỉ các tập đoàn công nghệ này, nhiều công ty khác đã tham gia từ sớm hơn. Deep Principle, doanh nghiệp Trung Quốc thành lập năm 2024, là một trong những công ty đầu tiên trên thế giới đặt cược vào hướng nghiên cứu khoa học tự chủ bằng AI.
Đằng sau đường đua này là một "mỏ vàng" rộng lớn. Một khi AI có thể hiện thực hóa chu trình nghiên cứu khép kín tự chủ, nó sẽ nâng cấp từ việc "bán phần mềm" trở thành nền tảng năng suất cho các ngành công nghiệp thực thể trị giá hàng nghìn tỷ đô la như vật liệu mới và dược phẩm mới.

Ở cấp độ chiến lược quốc gia, lĩnh vực này cũng rất được coi trọng. Khám phá khoa học dựa trên AI đã được đưa vào chiến lược quốc gia về cường quốc khoa học công nghệ mới của Trung Quốc.
Ngành càng nóng, một câu hỏi càng trở nên không thể né tránh: Làm thế nào để đánh giá xem những "nhà khoa học AI" này thực sự làm tốt đến đâu?
Thước đo cũ đã không còn đủ dùng
Từ lâu, thước đo chung của ngành để đánh giá trình độ nghiên cứu khoa học của AI là các bài kiểm tra kiến thức đóng như HLE.
Về bản chất, chúng chỉ là những bài thi chỉ nhìn vào đáp án cuối cùng, không xem xét quá trình tạo ra đáp án đó.
Các công cụ nghiên cứu AI đạt điểm cao trong những bài thi này thường bộc lộ vấn đề khi thực hiện thí nghiệm thực tế: chúng có thể trích dẫn tài liệu một cách trôi chảy, nhưng không thể dừng lại để xem xét và phản tư về các dữ liệu bất thường, hoặc có thể đưa ra các phương án thí nghiệm nghe có vẻ hợp lý nhưng thực tế lại không thể thực thi.
Ngày 19 tháng 8, một bài báo khoa học có tiêu đề "Measuring AI Scientists: From Exams to Discovery" (Đo lường các nhà khoa học AI: Từ thi cử đến khám phá) đã được công bố, lần đầu tiên đề xuất một hệ thống đánh giá hoàn chỉnh và có hệ thống cho "trình độ nghiên cứu khoa học thực tế của AI", chính thức lấp đầy khoảng trống của thước đo này.
Bài báo được thực hiện bởi doanh nghiệp AI4S Trung Quốc là Deep Principle, phối hợp cùng các tổ chức học thuật và công nghiệp hàng đầu thế giới như Microsoft Research, Đại học Stanford, FutureHouse, Edison Scientific, Viện Trí tuệ nhân tạo Allen và Đại học California, Berkeley.

Sự tham gia của các học giả tầm cỡ trong lĩnh vực AI4S đã tạo nên tính thẩm quyền học thuật cho khung đánh giá này, bao gồm: Kristin Persson - người sáng lập dự án dữ liệu mở vật liệu lớn nhất thế giới Materials Genome và Materials Project; Andrew White - người sáng lập FutureHouse và Edison Scientific, tác giả chính của bài báo Co-Scientist trên tạp chí Nature gần đây; Peter Jansen - nhà phát triển cốt lõi của chuẩn đánh giá tác nhân khoa học ScienceWorld; Yuanqi Du - tác giả chính của bài đánh giá AI4S trên Nature năm 2023; và Ludwig Schmidt - tác giả liên hệ cuối cùng của Terminal Bench.
Với tư cách là đại diện công nghiệp duy nhất từ Trung Quốc, Deep Principle đã đóng góp kinh nghiệm thực chiến từ các quy trình nghiên cứu và phát triển thực tế, giúp khung đánh giá này có tính khả thi khi áp dụng vào thực tế.

Trong bài báo thậm chí còn có chữ ký của Frances Arnold, người đoạt giải Nobel Hóa học. Việc một nhà khoa học không chuyên về AI và hiếm khi xuất hiện trong giới AI4S tham gia cho thấy sự coi trọng ngày càng tăng của giới khoa học đối với lĩnh vực này.
Năm 2026, từ các tập đoàn công nghệ lớn đến các công ty khởi nghiệp, nhiều bên tham gia đã đổ xô vào đường đua nghiên cứu khoa học bằng AI, khiến sự cạnh tranh trong ngành ngày càng gay gắt. Sự xuất hiện của hệ thống đánh giá này vào thời điểm hiện tại là một tất yếu.
Làm thế nào để đánh giá trình độ nghiên cứu khoa học của AI một cách hệ thống và toàn diện
Đổi mới cốt lõi của bài báo là đề xuất hệ thống đánh giá "vòng khám phá" (discovery episode).
Logic cốt lõi của hệ thống này là sử dụng hình thức "kiểm tra tổng hợp", ghi lại mọi bước ra quyết định của AI trong toàn bộ chu trình nghiên cứu, cuối cùng chấm điểm tổng thể về tính khoa học, tính nghiêm ngặt và tính hiệu quả của toàn bộ quỹ đạo nghiên cứu.
Phương thức kiểm tra này hoàn toàn khác biệt với logic "thi cử" trước đây.
Xoay quanh ba giai đoạn của chu trình nghiên cứu khép kín: giả thuyết khoa học, thực thi phương án và giải thích kết quả thí nghiệm, hệ thống đánh giá này thiết lập các chiều đánh giá riêng biệt, cuối cùng thực hiện "kiểm tra khép kín toàn bộ quy trình" để đo lường khả năng tổng hợp của AI trong việc tạo ra các khám phá khoa học thực sự.
△ Bài báo chỉ ra sự khác biệt giữa đánh giá kiến thức và đánh giá khám phá, đồng thời định nghĩa các điểm đánh giá có trong "vòng khám phá".

Hệ thống này cũng định nghĩa lại giá trị của dữ liệu thất bại: dữ liệu thí nghiệm thất bại chính là tài sản cốt lõi để huấn luyện và đánh giá AI trong nghiên cứu khoa học.
Các nhà khoa học là con người có thể rút kinh nghiệm từ thất bại để tránh đi đường vòng, thì AI khi làm nghiên cứu cũng cần học cách rút kinh nghiệm từ thất bại.
Hơn nữa, bài kiểm tra này còn đặt ra yêu cầu cao về tính xác thực và tính độc lập của kết quả nghiên cứu AI, đảm bảo kết quả thí nghiệm là những khám phá mới "hàng thật giá thật", không phải là những "thành tựu tự tuyên bố" không thể kiểm chứng.
MIRA của Deep Principle chính là mẫu hình thực tế của hệ thống này
Trước khi bài báo tiêu chuẩn này được công bố, các bên dẫn đầu đã vận hành thành công logic khép kín trong sản phẩm của họ, và nền tảng MIRA của Deep Principle là mẫu hình công nghiệp điển hình nhất trong số đó.
Định vị của các AI nghiên cứu khoa học thông thường là "công cụ trả lời câu hỏi": nhà nghiên cứu đưa ra câu hỏi cụ thể, AI trả về đáp án tương ứng.
Logic thiết kế của MIRA hoàn toàn khác biệt với các AI nghiên cứu khoa học thông thường. Nó xây dựng một hệ thống khép kín hoàn chỉnh bao phủ các giai đoạn "tạo giả thuyết → tính toán mô phỏng → xác thực thí nghiệm → tích lũy tri thức", sử dụng kiến trúc ba tầng để hiện thực hóa logic cộng tác hoàn chỉnh của một đội ngũ nghiên cứu khoa học thực thụ.
△ Giao diện vận hành thực tế của AI Scientist Mira
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.