Mô hình
Mở rộng quyền truy cập Skala: Bước tiến mới cho mô phỏng hóa học lượng tử DFT
(giờ Việt Nam)
Tóm tắt AI
Microsoft Research ra mắt Skala 1.1, mô hình học sâu giúp tăng độ chính xác và khả năng tiếp cận trong tính toán hóa học, đồng thời thiết lập chuẩn mực mới cho hiệu suất mô phỏng DFT.
Bản dịch AI


Sơ lược
Đưa lý thuyết hàm mật độ (DFT) đạt đến độ chính xác dự đoán là một hành trình, không phải là một bước đột phá đơn lẻ. Kể từ khi giới thiệu Skala, hàm trao đổi-tương quan dựa trên học sâu (deep-learning) của chúng tôi, chúng tôi đã tiếp tục tiến bước trên hai mặt trận bổ trợ cho nhau: cải thiện độ chính xác và mở rộng khả năng tiếp cận trong hệ sinh thái hóa học tính toán.

Về mặt độ chính xác, việc phát hành Skala-1.1 (mở trong tab mới) cung cấp minh chứng đầu tiên cho mô hình cải tiến liên tục làm nền tảng cho Skala. Được huấn luyện trên lượng dữ liệu lớn gấp 2,5 lần so với phiên bản công khai đầu tiên của Skala, mô hình cập nhật này mang lại hiệu suất cải thiện đáng kể trên các thách thức chính trong mô phỏng phân tử, bao gồm nhiệt hóa học nhóm chính, động học phản ứng và dự đoán cấu trúc phân tử.
Nhưng độ chính xác thôi là chưa đủ. DFT là động cơ tính toán đằng sau hàng loạt quy trình làm việc khoa học và công nghiệp, trải dài từ hóa học, khoa học vật liệu, xúc tác, công nghệ năng lượng cho đến khám phá thuốc. Để tạo ra tác động thực tế, các hàm nâng cao phải có thể tiếp cận được ngay tại nơi các nhà khoa học thực hiện tính toán của họ. Đó là lý do tại sao chúng tôi cũng đang mở rộng hệ sinh thái Skala thông qua sự hợp tác với các nhà phát triển phần mềm cấu trúc điện tử hàng đầu.
Hôm nay, chúng tôi thông báo rằng Skala đã có sẵn trong CP2K và đang được tích hợp vào Psi4, FHI-aims, ORCA và VASP, đưa độ chính xác DFT thế hệ mới đến gần hơn với các cộng đồng vốn dựa vào những mã nguồn này mỗi ngày. Song song với các nỗ lực tích hợp này, chúng tôi đang giới thiệu một bộ chuẩn sống (living benchmark) theo dõi hiệu suất tính toán của các bản phát hành Skala kế tiếp, ngày càng được tối ưu hóa. Bằng cách cung cấp một tài liệu tham khảo minh bạch và được cập nhật liên tục cho các triển khai trên nhiều gói phần mềm và nền tảng phần cứng, tài nguyên này sẽ giúp cộng đồng đo lường và đẩy nhanh tiến độ hướng tới độ chính xác và hiệu quả cao hơn nữa.
Cùng với nhau, những phát triển này đánh dấu một cột mốc quan trọng khác hướng tới tương lai, nơi các mô phỏng hóa học tính toán vừa có khả năng dự đoán cao, vừa dễ tiếp cận trên phạm vi rộng hơn các quy trình làm việc khoa học và công nghiệp liên quan.
Bạn muốn tìm hiểu thêm về Skala và lý do tại sao DFT đóng vai trò quan trọng như vậy trong khám phá in-silico? Hãy đọc bài đăng trên blog đầu tiên của chúng tôi (mở trong tab mới).
Skala là một hàm cải tiến liên tục
Không giống như "vườn bách thú hàm" (functional zoo) truyền thống, nơi các hàm mới tích tụ mà không thay thế các hàm cũ, Skala tuân theo một triết lý khác: mỗi bản phát hành được thiết kế để thay thế bản trước đó. Khi dữ liệu, kiến trúc mô hình và chiến lược huấn luyện mới xuất hiện, mô hình sẽ được cải thiện trong khi vẫn duy trì chi phí tính toán thực tế như cũ.
Skala-1.1 là minh chứng mới nhất cho phương pháp tiếp cận này. Nó đạt được sai số trung bình có trọng số là 2,8 kcal/mol trên GMTKN55, một bộ chuẩn được sử dụng rộng rãi bao gồm 55 danh mục hóa học, bao gồm nhiệt hóa học, rào cản phản ứng và tương tác phi cộng hóa trị. Mức độ chính xác này vượt qua các hàm lai (range-separated) toàn cầu hàng đầu hiện nay trong khi vẫn giữ được hiệu quả của một hàm bán cục bộ. Ngoài năng lượng, Skala-1.1 còn cung cấp mật độ electron, mômen lưỡng cực và hình học phân tử với độ chính xác cao.
Những tiến bộ này có được là nhờ sự mở rộng đáng kể của Microsoft Research Accurate Chemistry Collection (mở trong tab mới) (MSR-ACC), bộ sưu tập dữ liệu tham chiếu hóa học lượng tử độ chính xác cao quy mô lớn của chúng tôi, được tạo ra bằng các phương pháp hàm sóng đắt đỏ. Đối với Skala-1.1, chúng tôi đã thêm các danh mục mới, bao gồm ái lực electron và các cụm phi cộng hóa trị, làm tăng cả quy mô và quan trọng hơn là sự đa dạng của dữ liệu huấn luyện. Phương pháp dựa trên dữ liệu này cho phép Skala cải thiện một cách hệ thống qua từng thế hệ, đưa chúng ta đến gần hơn với một khung DFT có khả năng mở rộng và dự đoán thực sự.
Có sẵn tại nơi các nhà khoa học làm việc
Để hiện thực hóa đầy đủ tiềm năng của phương pháp tiếp cận DFT không ngừng phát triển của Skala, chúng tôi cần cơ sở hạ tầng chuyên dụng cho phép các bản phát hành mới được tích hợp nhanh chóng và liền mạch vào các gói phần mềm chính mà các nhà khoa học trong ngành và giới học thuật sử dụng. Đổi lại, điều này sẽ thiết lập vòng phản hồi nhanh cần thiết để thúc đẩy sự phát triển liên tục của Skala.
Chúng tôi đã cung cấp Skala lần đầu tiên thông qua bản phát hành cộng đồng mã nguồn mở (mở trong tab mới), được xây dựng trên (GPU4)PySCF (mở trong tab mới) và tích hợp với ASE (mở trong tab mới). Điều này cho phép các nhà nghiên cứu đánh giá và áp dụng Skala với nỗ lực tối thiểu trong khi vẫn hưởng lợi từ hiệu suất CPU và GPU được tối ưu hóa cao.
Nhưng không một gói phần mềm đơn lẻ nào có thể đáp ứng nhu cầu của mọi ứng dụng hoặc cộng đồng nghiên cứu. Hóa học tính toán và khoa học vật liệu dựa vào một hệ sinh thái phong phú các mã nguồn cấu trúc điện tử, mỗi mã nguồn được định hình qua nhiều thập kỷ để giải quyết các thách thức khoa học và công nghiệp cụ thể. Do đó, việc đưa Skala vào hệ sinh thái rộng lớn hơn này đã là trọng tâm chính trong năm qua. Chúng tôi may mắn được xây dựng trên những nền tảng đáng kinh ngạc do cộng đồng DFT tạo ra và biết ơn nhiều nhà nghiên cứu cũng như nhà phát triển đang giúp đưa Skala vào các nền tảng phần mềm mà các nhà khoa học sử dụng hàng ngày.

Azure AI Foundry Labs
Hãy nhìn thoáng qua các hướng đi tiềm năng trong tương lai của AI với những công nghệ thử nghiệm này từ Microsoft Research.
Với sự hợp tác của nhóm Giáo sư Thomas D. Kühne tại Trung tâm Hiểu biết Hệ thống Tiên tiến (CASUS) (mở trong tab mới), Skala đã được tích hợp thành công vào gói phần mềm mã nguồn mở CP2K (mở trong tab mới). Với hơn 25 năm phát triển, CP2K là một "cỗ máy" mạnh mẽ cho các mô phỏng DFT, đặc biệt là đối với các hệ thống quy mô lớn và động lực học phân tử thang thời gian dài, đồng thời cung cấp danh mục phong phú các phương pháp cấu trúc điện tử độ chính xác cao. Skala mở rộng biên giới của những gì có thể thực hiện được trong CP2K, mang lại bước tiến về độ chính xác DFT trong khi vẫn bảo toàn hiệu quả tính toán cần thiết cho các mô phỏng ở quy mô lớn. Chúng tôi rất hào hứng khi thấy quy mô và tính linh hoạt của CP2K, kết hợp với độ chính xác không ngừng cải thiện của Skala, sẽ cho phép tạo ra các ứng dụng và khám phá khoa học mới trong những năm tới.
Sẽ còn nhiều điều thú vị nữa. Cùng với cộng đồng nhà phát triển sôi động, chúng tôi đang tích cực tích hợp Skala vào gói phần mềm mã nguồn mở Psi4 (mở trong tab mới), một nền tảng thiết yếu cho nghiên cứu cấu trúc điện tử phân tử. Kết hợp với Skala Community Edition dựa trên PySCF, điều này sẽ giúp Skala có sẵn trong ba gói hóa học lượng tử mã nguồn mở được sử dụng rộng rãi.
Ngoài phần mềm mã nguồn mở, chúng tôi đang hợp tác chặt chẽ với các nhà phát triển hàng đầu đằng sau FHI-aims (mở trong tab mới), ORCA (mở trong tab mới) và VASP (mở trong tab mới), với mục tiêu làm cho Skala có thể tiếp cận rộng rãi trên các nền tảng phần mềm chính được sử dụng trong hóa học tính toán và khoa học vật liệu.
Xác thực độ chính xác trên các triển khai: CP2K làm nghiên cứu điển hình
Kiểm thử kỹ lưỡng là điều cần thiết cho bất kỳ triển khai mới nào. Chúng tôi muốn đảm bảo rằng Skala mang lại độ chính xác nhất quán trên các mã nguồn và thiết lập tính toán khác nhau. Cùng với nhóm CP2K, chúng tôi đã phát triển một bộ kiểm thử tích hợp toàn diện để xác minh rằng Skala tạo ra các kết quả chính xác và đáng tin cậy về mặt số học. Chúng tôi đặc biệt biết ơn nhóm CASUS, những người có chuyên môn sâu về xác minh số học các phương pháp tính toán đã đóng vai trò quan trọng trong việc thiết kế và xác thực khung kiểm thử này.

Một cuộc thảo luận chi tiết về việc triển khai, chiến lược xác thực và cơ sở hạ tầng kiểm thử cho Skala trong CP2K có thể được tìm thấy trong bài báo chung của chúng tôi với nhóm CASUS: “Molecular Implementation of the Machine-Learned Skala Exchange-Correlation Functional in CP2K through GauXC.”
Báo cáo hiệu suất sống cho Skala
Độ chính xác và khả năng tiếp cận rộng rãi chỉ chuyển thành tác động khoa học nếu Skala cũng nhanh. Ngày nay, Skala có thể mang lại hiệu suất tương đương với các meta-GGA bán cục bộ trên cả CPU (với chi phí phụ trợ biến mất đối với các phân tử có hơn 20-30 nguyên tử) và GPU, và chúng tôi cam kết duy trì hiệu quả đó khi nó được tích hợp trên toàn bộ hệ sinh thái phần mềm cấu trúc điện tử.
Nhưng hiệu suất không phải là một thuộc tính cố định. Các bản phát hành Skala mới, những cải tiến trong các thư viện như GauXC và các tối ưu hóa dành riêng cho phần cứng liên tục cải thiện hiệu quả và mở ra những cơ hội mới để đạt được kết quả cao hơn. Việc nắm bắt tiến trình này đòi hỏi nhiều hơn là một ảnh chụp nhanh chuẩn mực đơn lẻ.
Để cung cấp cái nhìn minh bạch và cập nhật về hiệu suất của Skala, chúng tôi đang xuất bản một bộ công cụ đo lường (benchmarking harness) cùng với báo cáo hiệu suất sống (mở trong tab mới) sẽ được cập nhật khi có các tối ưu hóa mới. Báo cáo này theo dõi hiệu suất trên một loạt các tác vụ và nền tảng phần cứng, trong khi bộ công cụ cho phép các nhà phát triển gói phần mềm đo lường, xác thực và cải thiện các triển khai Skala của riêng họ.

Lời cảm ơn
Skala là sản phẩm của một nỗ lực hợp tác thực sự trên toàn bộ bộ phận AI for Science, và chúng tôi cảm ơn các nhóm kỹ thuật, quản lý dự án và vận hành kinh doanh đã giúp hiện thực hóa công việc này. Chúng tôi cũng cảm ơn MSR Accelerator vì sự hợp tác của họ trong việc thúc đẩy các nỗ lực tạo dữ liệu và tăng tốc tích hợp phần mềm, giúp đưa Skala đến với cộng đồng khoa học rộng lớn hơn.
Bài viết được AI dịch và tổng hợp tự động từ Microsoft Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.