Nghiên cứu
ScienceDiscovery: Dùng tìm kiếm cây để khám phá quy luật vật lý chỉ trong vài giờ
(giờ Việt Nam)
Tóm tắt AI
Phương pháp ScienceDiscovery kết hợp tìm kiếm cây và RSI giúp tự động tìm ra các quy luật vật lý phức tạp mà không cần huấn luyện mô hình hay tinh chỉnh tham số.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
2026-09-04 16:57:14 Nguồn: QbitAI
Không huấn luyện mô hình, không điều chỉnh tham số
Yun Zhong, đưa tin từ Aofeisi
QbitAI | Tài khoản chính thức QbitAI
Một tình huống phổ biến trong nghiên cứu khoa học là: viết một chương trình tính toán chính xác tích phân dao động, tối ưu hóa mã nguồn số học nhanh gấp mười lần, hoặc suy ngược ra phương trình từ một bảng dữ liệu số — phiên bản đầu tiên thường không đủ tốt.
Khối lượng công việc chính không nằm ở việc thực hiện phiên bản đầu tiên, mà ở hàng chục đến hàng trăm lần thử sai sau đó.
Hình thức của loại công việc này là tìm kiếm, không phải là thực thi đơn lẻ.
ScienceDiscovery của cộng đồng openJiuwen đã giao quá trình thử sai này cho chính chương trình thực hiện: thứ được tiến hóa chính là mã nguồn nghiên cứu, mô hình không cần huấn luyện, quy tắc tìm kiếm cũng không thay đổi, thứ duy nhất thay đổi trong mỗi vòng lặp là sản phẩm đầu ra.
Thực hiện sản phẩm RSI trong kịch bản nghiên cứu khoa học thông qua tìm kiếm trên cây
Hình dạng của quá trình tìm kiếm được triển khai như một cái cây. Mỗi phiên bản sản phẩm là một nút trên cây, có thể được chọn lại, viết lại và phát triển thành các nhánh mới, hoặc tạm thời gác lại để chọn ra sửa đổi tiếp sau hàng chục phiên bản; các nhánh có điểm số cao hơn sẽ có nhiều cơ hội được viết lại hơn.
Mỗi vòng lặp bao gồm bốn bước: chọn một phiên bản cha, giao cho mô hình viết lại, đưa vào sandbox để chấm điểm và gắn thành nút mới, cuối cùng ghi nhận lượt truy cập này cho tất cả các nút tổ tiên của nó. Các phiên bản chạy thất bại cũng được đưa vào cây và đánh dấu là thất bại.
Sandbox được cung cấp bởi nền tảng của ScienceDiscovery, các lỗi thực thi, vòng lặp vô tận và quá thời gian đều được cách ly, do đó không cần phải đặt ra các giới hạn định sẵn cho mã nguồn do mô hình tạo ra. Với điểm số, chương trình mới biết phiên bản nào tốt hơn và vòng tiếp theo nên tiếp tục sửa đổi từ đâu. Khi cái cây này có thể liên tục phát triển mà không cần sự can thiệp thủ công từng vòng, sản phẩm sẽ tự tiến hóa.
Đây chính là một dạng của RSI: sau khi mục tiêu được xác định, hướng đi, việc quay lại phiên bản nào, hay đào sâu ở đâu đều do chương trình tự quyết định.
Trường hợp 1: Tích phân dao động trên khoảng bán vô hạn
Tích phân dao động trên khoảng bán vô hạn là một loại đại lượng không thể tránh khỏi trong tính toán vật lý. Các bộ tích phân thông thường thường thất bại ở đây: chúng dựa vào ước tính sai số cục bộ để quyết định nơi lấy mẫu dày đặc, nhưng các hàm này dao động không ngừng, khiến phương pháp này không đưa ra được đánh giá hội tụ đáng tin cậy.
Lấy 38 bài toán tích phân như vậy, AI hoàn toàn không thấy đề bài và đáp án, phản hồi duy nhất là điểm độ chính xác — 0 điểm nghĩa là tính đúng hoàn toàn, điểm càng thấp thì sai số càng lớn. Gọi trực tiếp scipy.integrate.quad cho kết quả −3.40: trong 19 bài chỉ có 3 bài đạt sai số cho phép 3%, bài tệ nhất sai lệch khoảng 2,4 tỷ lần so với giá trị thực.
Khi tìm kiếm đến phiên bản thứ 119, điểm số là −0.0007: tất cả 19 bài dùng để chấm điểm đều được tính đúng, sai số tương đối trung bình là 0,07%. Loại tích phân này trước đây không có công cụ chung khả dụng, giờ đây đã có một bộ giải có thể gọi trực tiếp.
△ Các chấm xám là điểm số của từng phiên bản, đường màu xanh là thành tích tốt nhất tính đến thời điểm đó

Chương trình 247 dòng cuối cùng sẽ tự đánh giá hàm cần tích phân phân kỳ ở đâu, dao động nhanh như thế nào, sau đó chọn thuật toán theo từng trường hợp — không phải viết mỗi nhánh cho 38 bài toán, mà là một bộ quy tắc chung, do đó nó cũng hiệu quả trên 19 bài toán không tham gia chấm điểm.
Toàn bộ quá trình tìm kiếm kéo dài 2 giờ, tạo ra 236 phiên bản, hoàn toàn không có sự can thiệp của con người.
Thay đổi đối tượng cho cùng một loại nhiệm vụ: Đánh giá độ chính xác kép của ₂F₁
Đánh giá độ chính xác kép của hàm siêu hình học Gauss ₂F₁(a,b;c;z) là mắt xích quan trọng trong hệ thống hàm đặc biệt, được công nhận là không có thuật toán đơn lẻ nào bao phủ được toàn bộ miền tham số. Cơ sở scipy.special.hyp2f1 đã được sử dụng hàng chục năm, trong phân phối tham số mà chúng tôi thử nghiệm, khoảng 1/3 số điểm có số chữ số có nghĩa chính xác dưới 10.
Sử dụng glm-5.2 chạy 48 lần mở rộng, 598 giây, tạo ra một chương trình 199 dòng. Trên 1000 điểm chưa từng thấy, số chữ số chính xác trung bình tăng từ 9,836 lên 11,771, số điểm tính được trên 10 chữ số tăng từ 659 lên 965, phần lớn các điểm vốn dưới 10 chữ số đã được sửa chữa.
Mở chương trình ra có thể thấy nó đã tìm được gì: khi z nhỏ hơn −1, thuật toán tiêu chuẩn không hội tụ, quá trình tìm kiếm đã tìm ra một đẳng thức cổ điển, thay z bằng 1/z để tránh đoạn này và tự xác định điều kiện chuyển đổi.
△ Số chữ số có nghĩa chính xác trung bình của bốn phương pháp trên cùng một nhóm điểm

Trường hợp 2: Tăng tốc mã nguồn trên AlgoTune
AlgoTune thu thập 154 nhiệm vụ tính toán số học thực tế từ numpy, scipy, networkx, cvxpy, mã nguồn được giao phải tạo ra kết quả giống hệt, điểm số là tỷ lệ tăng tốc so với bản thực thi tham chiếu.
Kết luận của bài báo gốc là: các mô hình hiện tại "có xu hướng tối ưu hóa bề mặt mà không thể tìm ra sự đổi mới ở cấp độ thuật toán".
Theo quy tắc chấm điểm của AlgoTune, ScienceDiscovery sử dụng cùng một cấu hình chạy hai hạt giống (seed), tăng tốc trung bình 2,279 lần, thời gian thực thi cho cùng kết quả giảm xuống còn hơn 40% so với ban đầu. Trong câu lệnh nhắc (prompt) không hề nhắc đến bất kỳ kỹ thuật tăng tốc nào, các thay đổi đều do quá trình tìm kiếm tự tìm ra.
Để đối chiếu, vị trí cao nhất trên bảng xếp hạng chính thức là claude-opus-4.6 với 1,837, MetaEvolve cần huấn luyện mô hình bằng RL đạt 2,045; trong khi ở đây sử dụng mô hình có sẵn, không thực hiện bất kỳ quá trình huấn luyện nào.
△ Tỷ lệ tăng tốc trên tám bài toán, màu nhạt là thành tích của các bên trên bảng xếp hạng chính thức

Trường hợp 3: Suy ngược phương trình từ dữ liệu quan sát
Trường hợp thứ ba thuộc về chính khám phá khoa học: chỉ đưa ra dữ liệu quan sát, suy ngược ra biểu thức giải tích đằng sau. Trong lịch sử, nhiều định luật vật lý đã được đúc kết theo cách này, ví dụ như Kepler đã quy nạp ra bình phương chu kỳ tỷ lệ thuận với lập phương bán trục lớn từ bảng vị trí hành tinh của Tycho.
Tập con LSR-Transform của LLM-SRBench đưa ra một bảng số thuần túy: 4000 dòng điểm lấy mẫu, một cột giá trị mục tiêu. Mỗi nút trên cây là một đoạn chương trình Python hoàn chỉnh, trả về một biểu thức giải tích.

Thông qua tìm kiếm trên cây, 41,4% trong số 111 bài toán đã viết ra được phương trình chính xác, bao gồm giải ngược số lượng tử chính từ mức năng lượng Bohr, giải ngược nhiệt độ từ phân phối Planck, hiệu ứng Doppler tương đối tính, mỗi bài trung bình chỉ cần 16,5 lần gọi mô hình, chi phí sử dụng deepseek-v4-flash chưa đến 3 nhân dân tệ.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.