Nghiên cứu
Báo cáo OpenAI: Tác nhân AI giúp tăng tốc dự án tính toán khoa học lên tới 60 lần
(giờ Việt Nam)
Tóm tắt AI
OpenAI công bố báo cáo cho thấy các tác nhân lập trình như Codex và Claude Code giúp rút ngắn thời gian chạy dự án khoa học từ 31% đến 60 lần. Dù tối ưu hóa hiệu suất vượt trội, báo cáo nhấn mạnh con người vẫn đóng vai trò then chốt trong việc kiểm chứng tính chính xác của kết quả.
Bản dịch AI

OpenAI vừa công bố một báo cáo thực địa mới, theo dõi tám dự án tính toán khoa học nơi các tác nhân lập trình (coding agents) đã giúp cắt giảm thời gian chạy chương trình.
Báo cáo ghi lại các dự án sử dụng Codex độc lập trong năm trường hợp và kết hợp Codex với Claude Code của Anthropic trong ba trường hợp còn lại. Cần lưu ý ngay từ đầu: đây là một nhà cung cấp tự công bố khảo sát về ứng dụng sản phẩm của chính mình trong môi trường nghiên cứu, được xây dựng từ các nghiên cứu tình huống do chính những người đóng góp viết ra.
Điều đó không làm giảm đi giá trị của mô hình cơ bản cần được xem xét. Phần mềm nghiên cứu vốn có vấn đề về bảo trì đã được ghi nhận. Các công cụ được xây dựng để phục vụ một bài báo khoa học duy nhất, do các nhóm học thuật nhỏ lập trình mà không có sự hỗ trợ kỹ thuật chuyên biệt, thường tích tụ nợ kỹ thuật mà không ai có ngân sách hoặc nhiệm vụ để giải quyết.
Báo cáo của OpenAI lập luận rằng các tác nhân có thể giải quyết khoản nợ đó, và tám dự án được trích dẫn bao gồm các lĩnh vực di truyền học, miễn dịch học, thống kê và giải trình tự RNA.
Các tác nhân đã thực hiện những nhiệm vụ gì
Các nhiệm vụ được chia thành ba loại chính: đóng gói và dọn dẹp hệ thống xây dựng (build-system), tối ưu hóa hiệu suất trên mã nguồn hiện có, và chuyển đổi toàn bộ ngôn ngữ hoặc backend.
cyvcf2, một thư viện Python dùng để đọc các tệp biến thể di truyền, đã được thay thế hệ thống xây dựng và đóng gói cũ bằng một quy trình mới, thống nhất hơn. Theo người đóng góp Brent Pedersen, việc tăng tốc với các tác nhân là một chuyện, nhưng để tiến xa trong khoa học vẫn cần đến "sự hướng dẫn chuyên môn, sự hiểu biết, gu thẩm mỹ và sự cẩn trọng."
HI.SIM, một trình mô phỏng giải trình tự DNA, đã trải qua hai đợt tối ưu hóa phần lớn tự động từ GPT-5.2 và GPT-5.6. Người đóng góp Andrew Ho cho biết điều này đã cắt giảm 31% thời gian chạy trên một tập kiểm thử đại diện mà không làm thay đổi kết quả đầu ra.
Ho, người tự nhận mình không phải là chuyên gia di truyền học hay lập trình viên C, gọi kết quả này là "không gì khác ngoài phép màu" từ góc độ người dùng cuối, sau khi trước đó đã mất nhiều thời gian cho các lỗi hiệu suất và vấn đề đóng gói mà anh có thể nhận ra nhưng không thể tự mình sửa chữa.
Hifiasm, được sử dụng để lắp ráp bộ gen từ các tệp đọc PacBio HiFi, đã đạt mức cắt giảm 25% thời gian chạy trên mục tiêu tối ưu hóa và khoảng 15% trên dữ liệu giải trình tự người riêng biệt, theo người đóng góp Suyash Shringarpure.
Shringarpure mô tả việc tác nhân tự thiết lập khung kiểm chuẩn (benchmark scaffolding) và tự đề xuất các ứng viên, mặc dù anh nhấn mạnh rằng việc cung cấp kết quả phân tích (profiling) và điều hướng mô hình tránh các kiểu lỗi lặp đi lặp lại vẫn là công việc chỉ con người mới làm được.
MHCflurry, công cụ dự đoán các mảnh protein trình diện cho tế bào T, đã được chuyển đổi backend từ TensorFlow/Keras sang PyTorch trong khi vẫn giữ khả năng tương thích với các trọng số mô hình đã phát hành trước đó. Những người đóng góp Alex Rubinsteyn, Sergey Feldman và Timothy O’Donnell coi đây là kiểu "bảo trì tẻ nhạt, tốn nhiều công sức" giúp duy trì các dự án khoa học mã nguồn mở thay vì để chúng bị mai một.
bayesm-rs, một bản chuyển đổi sang Rust của các mô hình thống kê từ gói bayesm của R, đã khớp với các ước tính của phần mềm gốc trong phạm vi sai số cho phép và chạy nhanh hơn từ 2,3–2,7 lần trên một luồng bộ xử lý đơn lẻ, và tăng lên 4,4–9,5 lần trên tám luồng. Theo các người đóng góp Andrew Bai và Andrew Ho, các tác nhân xử lý nhanh chóng và chính xác bất cứ thứ gì có tài liệu tham khảo trực tiếp để đối chiếu; các phần mở rộng đòi hỏi sự phán đoán thống kê mà mã gốc chưa xác định rõ thì cần sự xác nhận trực tiếp từ con người.
Các bản chuyển đổi sang Rust và thiết kế lại GPU đẩy mô hình này đi xa hơn
Ba dự án khác – rustar-aligner, svb và kuva – liên quan đến các bản dựng Rust được thực hiện với các tác nhân lập trình, bao gồm việc tái tạo hoàn toàn STAR, một công cụ căn chỉnh trình tự RNA được sử dụng rộng rãi nhưng đã không còn được bảo trì tích cực.
Người đóng góp James M. Ferguson cho biết các tác nhân thay đổi những gì đáng để thử nghiệm: viết lại một trình căn chỉnh 20.000 dòng bằng tay không phải là cách sử dụng thời gian hợp lý, nhưng với một tác nhân, nó trở thành công việc kéo dài vài tuần dưới sự điều hướng. Ông nói thêm, việc xác minh là một vấn đề hoàn toàn khác. Một mô hình có thể khẳng định một biểu đồ trông ổn, nhưng việc kiểm tra hơn 900 biểu đồ bằng mắt trước khi phát hành vẫn thuộc về con người.
RustQC đã hợp nhất 15 công cụ kiểm soát chất lượng giải trình tự RNA riêng biệt thành một chương trình duy nhất. Người đóng góp Phil Ewels cho biết điều này đã cắt giảm thời gian chạy 60 lần và giảm đầu vào/đầu ra đĩa 25 lần, với các bản dựng lại đi kèm là FastQC-Rust và Trim Galore chạy nhanh hơn lần lượt bảy và ba lần trong khi vẫn bảo toàn hành vi của các công cụ gốc.
Ewels cũng cảnh báo về mặt trái: các bản dựng lại giá rẻ mang theo rủi ro riêng, vì các công cụ có hành vi khác biệt sẽ làm phân mảnh cộng đồng và khiến kết quả từ các phòng thí nghiệm khác nhau không thể so sánh được theo thời gian. "Công nghệ là phần dễ," ông nói. "Sự quản lý mới là câu hỏi mở."
HelixForge, một bản dựng lại dựa trên GPU của công cụ mô phỏng đột biến BAMSurgeon, được cho là đã cắt giảm thời gian chạy khoảng 60 lần trên một bài kiểm chuẩn liên quan đến dữ liệu người thật, theo các người đóng góp Mamad Ahangari, Varun Goyal và Hassan Masoudi. Họ cũng cho biết nó tạo ra tần suất đột biến gần với các mục tiêu yêu cầu hơn và giải quyết được một số lỗi tạo ra các hiện vật (artefacts) trong công cụ gốc.
Xác minh, không phải tạo mã, mới là rào cản hiện nay
Điều thể hiện rõ qua tất cả các bài viết là các tác nhân xử lý tốt các yêu cầu triển khai có phạm vi rõ ràng nhưng không thể đánh giá liệu kết quả đầu ra của chính chúng có hợp lý về mặt khoa học hay không.
Những người đóng góp mô tả các tác nhân thể hiện sự tự tin vào công việc chứa đầy lỗi rõ ràng, điều này đẩy gánh nặng thực tế lên con người trong việc xây dựng các bài kiểm tra chấp nhận: khớp kết quả đầu ra chính xác, kiểm tra tính tương đương với một công cụ hiện có, hoặc các câu trả lời đã được thiết lập trước bằng dữ liệu mô phỏng.
Các dự án thường tiến hành theo từng giai đoạn, với các tác nhân tạo ra các bản nháp nhanh ban đầu và thời gian còn lại dành cho các trường hợp biên (edge cases) và những sai lệch số nhỏ mà chỉ riêng kiểm chuẩn sẽ không phát hiện ra.
Chi phí kỹ thuật thấp hơn mang lại cả lợi ích và rủi ro. Chúng cho phép một nhóm hai người thực hiện việc xây dựng lại vốn trước đây cần phải thuê kỹ sư được tài trợ bởi các khoản trợ cấp, và chúng giúp ba phòng thí nghiệm khác nhau dễ dàng tạo ra ba phiên bản không tương thích của cùng một công cụ. Các thay đổi đối với MHCflurry và cyvcf2 đã được đưa trở lại các dự án thượng nguồn ban đầu của chúng. rustar-aligner đã chuyển sang sự quản lý cộng đồng mới vì công cụ mà nó thay thế đã bị bỏ rơi.
Báo cáo của OpenAI hướng tới một lựa chọn cụ thể thay vì một sự ủng hộ chung chung: hãy quyết định ai sở hữu một công cụ được xây dựng lại và đảm bảo cam kết đó trước khi dòng mã đầu tiên do tác nhân tạo ra được phát hành.
Xem thêm: Guardoc Health xử lý tài liệu lâm sàng bằng cách sử dụng các mô hình Amazon Nova.

Bạn muốn tìm hiểu thêm về AI và dữ liệu lớn từ các nhà lãnh đạo ngành? Hãy xem AI & Big Data Expo diễn ra tại Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng với các sự kiện công nghệ hàng đầu khác bao gồm Cyber Security & Cloud Expo. Nhấp vào đây để biết thêm thông tin.
AI News được vận hành bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới tại đây.
Bài viết được AI dịch và tổng hợp tự động từ Artificial Intelligence News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.