Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Nghiên cứu

Terminal-Bench-Science 0.1: Bộ tiêu chuẩn mới đánh giá năng lực AI trong nghiên cứu khoa học

(giờ Việt Nam)

Tóm tắt AI

Các nhà nghiên cứu tại Stanford vừa ra mắt Terminal-Bench-Science 0.1, bộ benchmark gồm 70 tác vụ chuyên sâu thuộc nhiều lĩnh vực khoa học nhằm đo lường khả năng thực hiện quy trình nghiên cứu thực tế của các AI agent.

Bản dịch AI

TERMINAL-BENCH-SCIENCE

Terminal-Bench-Science đánh giá các tác nhân AI (AI agents) dựa trên các quy trình làm việc từ chính công việc của các nhà nghiên cứu. Các nhà khoa học, chứ không phải các nhà phát triển mô hình hay nhà cung cấp dữ liệu, là những người đặt ra tiêu chuẩn cho năng lực khoa học trong AI.

Terminal-Bench-Science là một bộ tiêu chuẩn đánh giá (benchmark) được dẫn dắt bởi các nhà nghiên cứu tại Đại học Stanford và được xây dựng bởi đội ngũ đứng sau Terminal-Bench, với sự cộng tác của các chuyên gia trong nhiều lĩnh vực khoa học và các tổ chức nghiên cứu trên toàn thế giới. Nó đo lường năng lực của các tác nhân AI thông qua một tập hợp đa dạng các quy trình làm việc đầy thách thức, được tuyển chọn bởi các chuyên gia từ các nghiên cứu khoa học thực tế.

Terminal-Bench-Science là một bộ tiêu chuẩn đánh giá liên tục, phát triển song hành cùng AI tiên phong, tạo ra một vòng lặp phản hồi giữa nhu cầu khoa học và sự phát triển của AI. Phiên bản đầu tiên của chúng tôi bao gồm 70 tác vụ từ các lĩnh vực khoa học sự sống, khoa học vật lý, khoa học Trái đất, toán học và kỹ thuật. Mô hình mạnh nhất được đánh giá, Claude Opus 5, đạt tỷ lệ giải quyết 30% trên Terminal-Bench-Science 0.1.

Bảng xếp hạng Terminal-Bench-Science 0.1

0%25%50%75%100%Claude Opus 5Claude Code30.0%GPT-5.6 SolCodex22.4%Claude Fable 5Claude Code21.4%Claude Opus 4.8Claude Code10.5%GPT-5.6 TerraCodex8.6%GLM 5.3Claude Code8.1%Kimi K3Claude Code7.1%Grok 4.6Grok Build7.1%GPT-5.6 LunaCodex3.3%

Trong khi Terminal-Bench đã thúc đẩy sự tiến bộ của các tác nhân AI trong kỹ thuật phần mềm, Terminal-Bench-Science mang tham vọng tương tự đến với khoa học. Mục tiêu của chúng tôi là thúc đẩy sự phát triển của các tác nhân có năng lực khoa học để trở thành những trợ lý nghiên cứu hữu ích. Các tác nhân này sẽ thực hiện các quy trình làm việc đòi hỏi kỹ thuật cao và tốn thời gian, giúp các nhà khoa học tập trung nhiều thời gian hơn vào những phần quan trọng nhất của khoa học đòi hỏi sự phán đoán của con người: xác định câu hỏi nghiên cứu, hình thành giả thuyết, diễn giải và xác thực kết quả, cũng như truyền đạt các phát hiện. Trong vai trò này, các tác nhân AI có thể mở rộng những gì các nhà nghiên cứu đạt được và giúp đẩy nhanh quá trình khám phá khoa học.

Để đạt được điều này, cần có các bộ tiêu chuẩn đánh giá phản ánh thực tiễn khoa học, cung cấp bằng chứng xác thực về năng lực và phát triển song hành cùng sự tiên phong của AI.

Chúng ta cần các bộ tiêu chuẩn đánh giá được rút ra từ các quy trình làm việc khoa học thực tế. Năng lực khoa học nên được đánh giá dựa trên thực tiễn nghiên cứu thực tế, không phải các câu hỏi trong sách giáo khoa hay các bài tập tiêu chuẩn hóa, và phải được đóng góp bởi chính các nhà khoa học đang làm việc. Terminal-Bench-Science mang đến cho các nhà khoa học trên mọi lĩnh vực một tiếng nói trực tiếp và một nền tảng chung để đặt ra tiêu chuẩn cho sự tiến bộ của AI đối với các vấn đề mà họ quan tâm. Rủi ro trong khoa học là quá lớn, và các bộ tiêu chuẩn đánh giá của nó phải phản ánh các ưu tiên của cộng đồng khoa học thay vì các lợi ích bên ngoài.

Chúng ta cần bằng chứng xác thực về năng lực khoa học. Nếu không có đánh giá đáng tin cậy, chúng ta không thể biết liệu năng lực của các tác nhân có đang cải thiện hay không hoặc những hạn chế của chúng vẫn còn ở đâu. Terminal-Bench-Science đánh giá các tác nhân trong môi trường thực tế và chấm điểm các sản phẩm cụ thể như phân tích, mô phỏng, chứng minh, mã nguồn và dữ liệu bằng các bài kiểm tra có thể tái lập và đặc thù cho từng tác vụ.

Chúng ta cần một bộ tiêu chuẩn đánh giá bắt kịp với sự tiên phong. Quá thường xuyên, các bộ tiêu chuẩn khoa học bị coi là các bài báo để xuất bản thay vì là cơ chế để thúc đẩy sự tiến bộ. Chúng được phát hành một lần rồi bị bỏ rơi khi các mô hình tiến bộ và những hạn chế đã biết vẫn tồn tại. Terminal-Bench-Science là một bộ tiêu chuẩn đánh giá liên tục, phát triển song hành cùng sự tiên phong của AI. Thông qua các đợt phát hành định kỳ, các nhà khoa học có thể đóng góp các quy trình làm việc mới, cải thiện các tác vụ hiện có và tạo ra vòng lặp phản hồi giữa nhu cầu khoa học và sự phát triển của AI.

Vòng lặp phản hồi Terminal-Bench-Science

Terminal-Bench-Science 0.1 bao gồm 70 tác vụ thuộc các lĩnh vực khoa học sự sống, khoa học vật lý, khoa học Trái đất, toán học và kỹ thuật. Các tác vụ bao gồm phân tích dữ liệu khoa học, suy luận thống kê, mô phỏng, tối ưu hóa, chứng minh định lý, tái tạo hình ảnh, xử lý tín hiệu, các bài toán ngược, hiệu chuẩn cảm biến, khớp mô hình, phân loại và học máy khoa học.

Phạm vi tác vụ của Terminal-Bench-Science 0.1

KHOA HỌC SỰ SỐNG 19 Sinh học 8 Y học & Sức khỏe 6 Khoa học thần kinh 4 Sinh thái học & Tiến hóa 1 KHOA HỌC VẬT LÝ 17 Thiên văn học & Vũ trụ học 6 Vật lý 5 Khoa học vật liệu 4 Hóa học 2 KHOA HỌC TRÁI ĐẤT 8 Khoa học địa chất 5 Khí quyển & Khí hậu 1 Đại dương & Biển 1 Môi trường & Bền vững 1 KHOA HỌC TOÁN HỌC 17 Toán ứng dụng & Tính toán khoa học 6 Nghiên cứu vận hành & Tối ưu hóa 5 Toán học hình thức & Chứng minh định lý 3 Thống kê 3 KHOA HỌC KỸ THUẬT 9 Kỹ thuật cơ khí & Hàng không vũ trụ 5 Kỹ thuật điện & Máy tính 2 Kỹ thuật hóa học & Quy trình 1 Kỹ thuật dân dụng & Kết cấu 1

Các tác vụ được đóng góp bởi các nhà nghiên cứu thông qua quy trình mở trên GitHub, với các cuộc thảo luận và phản hồi trong kênh #tb-science trên Discord. Các đóng góp bắt đầu dưới dạng đề xuất, nơi các nhà đánh giá thảo luận về từng ý tưởng, để lại phản hồi và phê duyệt những ý tưởng phù hợp: các quy trình làm việc có cơ sở khoa học đáng để đo lường trong bộ tiêu chuẩn. Các đề xuất được phê duyệt sẽ được triển khai dưới dạng pull request, nơi các nhà đánh giá xác nhận rằng mỗi tác vụ đều có thể kiểm chứng khách quan, thực sự thách thức đối với các tác nhân AI và không phải là thứ mà các hệ thống tiên phong ngày nay đã giải quyết dễ dàng. Để hợp nhất, các nhà đánh giá chuyên môn sẽ thẩm định tính hợp lệ và tính thực tế của khoa học, các nhà đánh giá kỹ thuật kiểm tra việc xây dựng và xác minh tác vụ, và một người kiểm soát chất lượng (bar raiser) thực hiện kiểm tra chất lượng cuối cùng. Trong số 920 đề xuất, 464 đề xuất đã được phê duyệt để triển khai và 386 pull request đã được mở, nhưng chỉ có 70 tác vụ được đưa vào Terminal-Bench-Science 0.1. Sự chọn lọc đó phản ánh mức độ khó khăn khi tạo ra các tác vụ vừa thú vị về mặt khoa học, vừa thách thức đối với các tác nhân tiên phong, và vừa được quy định đủ rõ ràng để đánh giá nghiêm ngặt. Tiến độ của các đề xuất, pull request và đánh giá được theo dõi trên bảng điều khiển tác vụ công khai.

Terminal-Bench-Science 0.1 để lại nhiều dư địa cho sự tiến bộ của các tác nhân AI trong nghiên cứu khoa học. Mỗi mô hình được đánh giá đã chạy ba thử nghiệm độc lập cho mỗi tác vụ trên tất cả 70 tác vụ. Claude Opus 5 với Claude Code đạt tỷ lệ giải quyết cao nhất là 30,0%, theo sau là GPT-5.6 Sol với Codex là 22,4% và Claude Fable 5 với Claude Code là 21,4%. Claude Opus 4.8 đứng ở mức trung bình với 10,5%. GPT-5.6 Terra, Kimi K3 và Grok 4.6 đều giải quyết được dưới 10% tác vụ. GLM 5.3 là mô hình mở mạnh nhất với 8,1%, và GPT-5.6 Luna đứng cuối với 3,3%.

Terminal-Bench-Science phân biệt giữa các hệ thống tốt tương đương với Terminal-Bench 3.0 trong khi đẩy tỷ lệ giải quyết giảm hơn 10 điểm phần trăm đối với mọi mô hình được đánh giá trên cả hai. Khoảng cách đó là có chủ đích: trong quá trình đánh giá, các tác vụ đã được hiệu chuẩn để thách thức các mô hình tiên phong mới nhất.

Terminal-Bench-Science so với Terminal-Bench

Hiệu suất chỉ là một khía cạnh của sự tiến bộ. Biểu đồ chi phí-tỷ lệ giải quyết cho thấy tổng chi phí đánh giá trên tất cả 70 tác vụ so với tỷ lệ giải quyết. GPT-5.6 Luna, Kimi K3 và GPT-5.6 Terra chiếm phân khúc chi phí thấp của sự tiên phong. GPT-5.6 Sol và Claude Opus 5 đạt tỷ lệ giải quyết cao nhất với chi phí lớn hơn, với Opus 5 ở mức 7,0 nghìn USD. GPT-5.6 Sol đạt hiệu suất tương đương Claude Fable 5 với chi phí chưa bằng một phần ba (4,2 nghìn USD so với 14,2 nghìn USD). Việc sử dụng token cho thấy một biên giới khác. Claude Fable 5 đạt hiệu suất tương đương GPT-5.6 Sol trong khi sử dụng ít hơn khoảng một phần tư số token (6,4 tỷ so với 8,4 tỷ). Kimi K3 neo ở phân khúc ít token và Claude Opus 5 ở phân khúc tỷ lệ giải quyết cao. Chỉ có Kimi K3 và Claude Opus 5 xuất hiện trên cả hai biên Pareto.

Chi phí so với Tỷ lệ giải quyết của Terminal-Bench-Science 0.1

Token so với Tỷ lệ giải quyết của Terminal-Bench-Science 0.1

Tỷ lệ giải quyết cũng thay đổi theo lĩnh vực khoa học. Các mô hình của Anthropic và OpenAI chiếm hai vị trí dẫn đầu trong mọi lĩnh vực ngoại trừ khoa học kỹ thuật, nơi Grok 4.6 đồng hạng với GPT-5.6 Sol ở vị trí thứ hai (14,8%) với chi phí và mức sử dụng token thấp hơn. Claude Opus 5 dẫn trước cả GPT-5.6 Sol và Claude Fable 5 trong mọi lĩnh vực ngoại trừ khoa học toán học, nơi Claude Fable 5 (33,3%) và GPT-5.6 Sol (31,4%) chiếm hai vị trí dẫn đầu. Phân tích đầy đủ theo lĩnh vực có sẵn trên bảng xếp hạng.

Tỷ lệ giải quyết theo lĩnh vực của Terminal-Bench-Science 0.1

Terminal-Bench-Science 0.1 là một nỗ lực cộng đồng của các nhà nghiên cứu trong các lĩnh vực khoa học sự sống, khoa học vật lý, khoa học Trái đất, toán học và kỹ thuật, cùng với đội ngũ Terminal-Bench và Harbor. Đây là bộ tiêu chuẩn đánh giá nghiêm ngặt nhất về năng lực tác nhân khoa học mà chúng tôi có thể xây dựng công khai, và chúng tôi chỉ mới bắt đầu: Terminal-Bench-Science 0.1 là phiên bản đầu tiên của một bộ tiêu chuẩn đánh giá liên tục.

Các đợt phát hành định kỳ sẽ bổ sung các tác vụ, mở rộng phạm vi bao phủ trên năm lĩnh vực khoa học, loại bỏ các tác vụ mà các tác nhân đã bão hòa hoặc các tác vụ được đánh giá là chưa được quy định rõ ràng, và giữ cho bảng xếp hạng luôn cập nhật khi các mô hình tiên phong mới được phát hành. Mỗi phiên bản được hiệu chuẩn dựa trên sự tiên phong tại thời điểm đó. Đối với Terminal-Bench-Science 0.1, đó là Claude Opus 5 và GPT-5.6 Sol, và khi các mô hình mạnh hơn xuất hiện, chúng tôi sẽ sử dụng chúng để đánh giá và hiệu chuẩn các tác vụ mới và cải tiến. Các tác vụ được đánh số phiên bản để các thử nghiệm có thể được sử dụng lại, chấm điểm lại hoặc chạy lại bằng một lệnh Harbor duy nhất, giúp giữ chi phí cập nhật kết quả ở mức thấp. Tiến độ được theo dõi công khai trên bảng điều khiển tác vụ, và mỗi phiên bản đều được gắn thẻ trên GitHub và Harbor Hub.

Công việc cho Terminal-Bench-Science 0.2 đã được tiến hành, với thời hạn chót cho pull request là ngày 5 tháng 10 năm 2026. Nếu bạn là một nhà nghiên cứu có quy trình làm việc mà các tác nhân tiên phong nên làm được nhưng chưa làm được, chúng tôi muốn đưa nó vào bộ tiêu chuẩn đánh giá. Quy trình đóng góp là Đề xuất → Xây dựng → Đánh giá: đề xuất tác vụ của bạn thông qua biểu mẫu đề xuất tác vụ, xây dựng nó theo hướng dẫn đóng góp, và nó sẽ trải qua các bước kiểm tra tự động, đánh giá chuyên môn và kỹ thuật song song, và phê duyệt cuối cùng của người kiểm soát chất lượng trước khi hợp nhất.

Hãy tham gia nỗ lực này trong kênh #tb-science trên Discord và trên GitHub, đồng thời tham gia các cuộc họp hàng tuần và giờ làm việc của chúng tôi thông qua lịch dự án. Hãy để các nhà khoa học xác định năng lực khoa học trong AI trông như thế nào và cùng nhau đo lường nó một cách nghiêm ngặt.

Nếu bạn thấy công trình này hữu ích, vui lòng trích dẫn nó. Bạn có thể sử dụng nút "Cite this repository" trên GitHub (được tạo từ CITATION.cff) hoặc trích dẫn thủ công bằng cách sử dụng thông tin bên dưới.

Cảm ơn tất cả những người đóng góp tác vụ, các nhà đánh giá và cố vấn đứng sau Terminal-Bench-Science.

Đặc biệt cảm ơn các cố vấn dự án chính của chúng tôi là Ludwig Schmidt và Sanmi Koyejo; các nhà đánh giá cấp cao Allen Hart, Ivan Bercovich, Joseph Janssen, Jiaming Hu, Steffen Bollmann và Sergey Aganezov; các cố vấn nghiên cứu AI Ryan Marten, Alex Shaw, Lin Shi, Benjamin Feuer, Mike A. Merrill, Alex Dimakis, Jenia Jitsev, Bodhisattwa Majumder, Peter Clark, Thomas Wolf, Braden Hancock và Andy Konwinski; và các cố vấn khoa học Sara Beery, Jo Dunkley, J. Nathan Kutz, Ching-Yao Lai, Scott Linderman, Emma Lundberg, Russ Poldrack, Aviv Regev và Risa Wechsler.

Terminal-Bench-Science là một sự hợp tác học thuật mở được tổ chức bởi Đại học Stanford và Viện Laude, với sự hợp tác của Phòng thí nghiệm AI Stanford (SAIL), Viện Trí tuệ nhân tạo lấy con người làm trung tâm Stanford (HAI), Khoa học đo lường AI Stanford (AIMS), Viện AI NSF về nền tảng học máy (IFML), Viện Allen và Viện AI Allen (Ai2). Là một phần của thương hiệu Terminal-Bench, nó được xây dựng bởi đội ngũ Terminal-Bench và Harbor cùng với một cộng đồng các nhà đóng góp khoa học.

Chúng tôi cảm ơn Viện Laude đã hỗ trợ thông qua chương trình Slingshots, Snorkel AI đã hỗ trợ thông qua chương trình Tài trợ tiêu chuẩn đánh giá mở, Quỹ nguồn mở 2077AI đã cung cấp tín dụng PP API hỗ trợ việc đánh giá và tuyển chọn tác vụ, và UniPat AI cùng Modal đã hỗ trợ Terminal-Bench-Science. Chúng tôi cảm ơn Bespoke Labs, Anthropic, Google, Moonshot AI, SpaceXAI và Z.ai đã cung cấp tín dụng API hỗ trợ các đánh giá trên bảng xếp hạng.

Tác giả: Steven Dillmann

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.