Microsoft Research Blog
92

Mô hình

Microsoft Research ra mắt RetroChimera: Mô hình AI đột phá trong tổng hợp phân tử trên tạp chí Nature

(giờ Việt Nam)

Tóm tắt AI

Microsoft Research giới thiệu RetroChimera, mô hình AI kết hợp Transformer và đồ thị thần kinh để tối ưu hóa dự đoán tổng hợp phân tử, vừa được công bố trên tạp chí khoa học uy tín Nature.

Bản dịch AI

Improving synthesis prediction of small molecules at scale with RetroChimeraExample of a retrosynthesis tree. For a single target molecule, many disconnections are possible, which introduces a high branching factor. The figure shows many incomplete routes in pale colors that

Tổng quan

Việc phát triển các loại thuốc và vật liệu mới đòi hỏi phải tạo ra các phân tử mới, nhưng việc lập kế hoạch để tạo ra chúng vẫn chủ yếu dựa vào phương pháp thủ công, tốn thời gian và chi phí đắt đỏ. RetroChimera tự động đề xuất các lộ trình tổng hợp chất lượng cao. Mô hình này kết hợp hai mô hình mạnh mẽ với những ưu điểm bổ trợ cho nhau, đồng thời học cách xếp hạng các đề xuất của chúng để tạo ra những dự đoán tốt hơn so với việc sử dụng riêng lẻ từng mô hình. Trong các thử nghiệm mù, các nhà hóa học trình độ tiến sĩ ưu tiên các dự đoán phản ứng riêng lẻ của RetroChimera hơn so với các mô hình trước đây và các phản ứng đã được ghi chép trong tài liệu.

Các phân tử được thiết kế riêng đang mở ra những tiến bộ trong y học hiện đại, vật liệu thông minh và nông nghiệp bền vững. Tuy nhiên, tiến độ này đang bị chậm lại bởi quá trình tổng hợp hóa học—một quy trình tốn nhiều thời gian để tạo ra các phân tử mới từ những khối xây dựng đơn giản hơn trong phòng thí nghiệm. Ngoài ra, quá trình tổng hợp còn là yếu tố chính đẩy chi phí phát triển thuốc lên cao. Vì vậy, ngay cả khi các phương pháp tính toán giúp con người có thể khám phá một lượng lớn các phân tử mới, việc tìm ra các cách thực tế để tổng hợp chúng vẫn là một thách thức quan trọng.

Figure 1: 

Example of a retrosynthesis tree. For a single target molecule, many disconnections are possible, which introduces a high branching factor. The figure shows many incomplete routes in pale

Retrosynthesis (tổng hợp ngược) tiếp cận vấn đề này bằng cách làm việc ngược từ một phân tử mục tiêu, chia nhỏ nó từng bước thành các tiền chất đơn giản hơn (Hình 1). Quá trình này có thể so sánh với việc chơi các trò chơi chiến thuật trên bàn cờ như cờ vua hay cờ vây. Nó đòi hỏi việc cân nhắc hàng loạt các nước đi tức thời khả thi, hay các điểm ngắt kết nối riêng lẻ, đồng thời đòi hỏi tư duy chiến lược cấp cao để đạt được kế hoạch tổng hợp toàn diện. Tuy nhiên, số lượng nước đi khả thi trong tổng hợp ngược lớn hơn nhiều so với các trò chơi trên bàn cờ, và không rõ ràng nước đi nào sẽ khả dụng cho một phân tử nhất định. Các hệ thống hiện tại đang đối mặt với những thách thức lớn, bao gồm việc ghi nhớ các phản ứng hiếm gặp nhưng quan trọng về mặt chiến lược, tính ổn định ngoài phân phối huấn luyện và sự phù hợp với kỳ vọng của các nhà hóa học. Kết quả là, tổng hợp ngược thường đòi hỏi chuyên môn cao, điều này gây cản trở việc mở rộng quy mô và tự động hóa các khám phá khoa học.

Figure 2: 

Outline of the RetroChimera workflow. RetroChimera takes a single target molecule, its sub-models give predictions for a disconnection, and learned voting gives a ranked output.

Trong một bài báo vừa được công bố trên tạp chí Nature (mở trong tab mới), chúng tôi giới thiệu RetroChimera (mở trong tab mới), một khung làm việc mới cho dự đoán tổng hợp ngược. Nó được xây dựng dựa trên hai mô hình (Hình 2). R-SMILES 2, một mô hình de-novo dựa trên Transformer, dự đoán trực tiếp các phân tử tiền chất từ phân tử đầu vào. Điều này mang lại cho nó sự linh hoạt để học các mô hình phản ứng trực tiếp từ dữ liệu. Tuy nhiên, việc tạo dữ liệu không bị ràng buộc cũng có thể khiến nó dễ bị "ảo giác" (hallucination).

Ngược lại, NeuralLoc là một mô hình dựa trên mạng thần kinh đồ thị (GNN) mã hóa cả phân tử mục tiêu và các mẫu phản ứng dưới dạng đồ thị. Nó chọn các mẫu phản ứng và dự đoán nơi chúng nên được áp dụng vào phân tử mục tiêu. Các dự đoán của nó dựa trên các mô hình phản ứng được trích xuất từ dữ liệu huấn luyện, vì vậy nó có xu hướng tạo ra kết quả chính xác và đáng tin cậy hơn. Tuy nhiên, nó bị hạn chế hơn khi gặp các phản ứng không nằm trong thư viện mẫu.

Những khác biệt này thực tế lại trở thành một thế mạnh. Thay vì đưa ra cùng một loại dự đoán, hai mô hình này nắm bắt các mô hình bổ trợ trong hóa học và chuyên biệt hóa cho các loại phản ứng khác nhau. R-SMILES 2 hoạt động đặc biệt hiệu quả với các phản ứng liên quan đến những thay đổi lớn trong quá trình phản ứng, trong khi NeuralLoc lại vượt trội ở các phản ứng có độ ưu tiên thấp và các phản ứng liên quan đến những thay đổi cục bộ hơn.

RetroChimera kết hợp các dự đoán đã được xếp hạng của cả hai mô hình phụ bằng cách sử dụng chiến lược học tập kết hợp (learned ensembling strategy). Mỗi mô hình gán một phiếu bầu dựa trên thứ hạng đã học cho mỗi tập hợp chất phản ứng được dự đoán, và các phiếu bầu sẽ được cộng dồn khi cả hai mô hình cùng đề xuất một phản ứng. Bằng cách học mức độ tin cậy vào mỗi mô hình ở các thứ hạng khác nhau, RetroChimera có thể tận dụng thế mạnh bổ trợ của chúng, đạt hiệu suất xấp xỉ mô hình phụ hoạt động tốt hơn trên các lớp phản ứng.

Figure 3:  

Outputs of RetroChimera and other models were ranked by PhD-level expert chemists. Retrosynthetic disconnections predicted by RetroChimera had the highest acceptance rate (left). A single

Kết quả là, RetroChimera hoạt động mạnh mẽ trên cả các lớp phản ứng phổ biến và hiếm gặp, đồng thời tạo ra các dự đoán tổng hợp ngược phù hợp hơn với đánh giá của các nhà hóa học (Hình 3). Trong các thử nghiệm mù, các nhà hóa học chuyên gia ưu tiên các điểm ngắt kết nối của các phân tử phức tạp do RetroChimera đề xuất hơn so với những kết quả thu được từ các mô hình phụ cấu thành, cũng như từ các phương pháp đã được thiết lập lâu đời hơn, và thậm chí là từ chính tập dữ liệu thử nghiệm.

Chúng tôi tin rằng RetroChimera có thể giúp các nhà nghiên cứu xác định lộ trình tổng hợp đầy hứa hẹn một cách hiệu quả hơn, hỗ trợ chu trình thiết kế-chế tạo-thử nghiệm nhanh hơn trên các ứng dụng khoa học phân tử, bao gồm khám phá thuốc và thiết kế vật liệu thông minh. RetroChimera có thể cho phép các nhà hóa học đánh giá nhiều hơn—và phức tạp hơn—các phân tử ứng viên ở quy mô lớn. Kết hợp với mức độ tự động hóa phòng thí nghiệm ngày càng tăng, chúng tôi kỳ vọng sẽ đẩy nhanh hơn nữa tiến trình hướng tới các hệ thống vòng lặp kín, tự cải thiện cho việc lập kế hoạch và thực hiện tổng hợp.

RetroChimera hiện có sẵn trên GitHub (mở trong tab mới) (giấy phép MIT) và có thể truy cập thông qua Microsoft Foundry (mở trong tab mới). Để biết hướng dẫn về cách truy cập checkpoint, vui lòng tham khảo kho lưu trữ GitHub.

Chúng tôi mời cộng đồng hóa học rộng lớn hơn cùng thử nghiệm với RetroChimera, giúp chúng tôi xác định những điểm mạnh và hạn chế để có thể cải thiện nó trong tương lai. Chúng tôi rất mong nhận được phản hồi về hiệu suất của nó trên các mục tiêu khác nhau mà các bạn quan tâm!

Để có cái nhìn sâu sắc hơn về các phát hiện, bao gồm các thí nghiệm đánh giá với các cộng tác viên nghiên cứu bên ngoài của chúng tôi, hãy xem toàn bộ ấn phẩm trên Nature (mở trong tab mới) và bài viết đi kèm trên Microsoft Source (mở trong tab mới).

AIHóa họcMicrosoftNghiên cứuTổng hợp phân tử
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Microsoft Research Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.