# NVIDIA và Google DeepMind công bố bộ dữ liệu cấu trúc protein của hơn 2.800 loại virus

- Nguồn: NVIDIA Blog
- Thời gian phát hành: 2026-09-24 21:00 (giờ Việt Nam)
- Điểm AI: 61/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/1a051243b2c4ad14
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmufo8rn007i8ro8wylbdcop0
- Link gốc: https://blogs.nvidia.com/blog/open-protein-dataset

## Lý do tinh chọn

Bài viết cung cấp quy mô tập dữ liệu, phạm vi bao phủ và quy trình dự đoán mã nguồn mở có thể tái sử dụng, giúp độc giả đánh giá cách áp dụng vào nghiên cứu cấu trúc protein của riêng mình.

## Tóm tắt AI

NVIDIA hợp tác cùng Google DeepMind và EMBL-EBI phát hành bộ dữ liệu 3D dự đoán cấu trúc phức hợp protein của hơn 2.800 loại virus thông qua AlphaFold Database, nhằm hỗ trợ nghiên cứu và ứng phó với các đại dịch trong tương lai.

## Thân bài

![How Open Science Can Help Researchers Prepare for the Next Pandemic](https://blogs.nvidia.com/wp-content/uploads/2026/09/AF-0000000212056767-master-black-background-scaled.png)

Khi đại dịch COVID-19 bùng phát, các nhà khoa học đã có một lợi thế quan trọng: Hàng thập kỷ nghiên cứu trước đó về virus corona giúp họ hiểu rõ các protein chủ chốt của virus, từ đó thiết kế vaccine trong thời gian kỷ lục. Đại dịch tiếp theo có thể sẽ không mang lại sự khởi đầu thuận lợi như vậy.

Để giúp cải thiện tình hình, NVIDIA đã tham gia một liên minh các tổ chức nghiên cứu toàn cầu, bao gồm Google DeepMind và Viện Tin sinh học Châu Âu thuộc Phòng thí nghiệm Sinh học Phân tử Châu Âu (EMBL-EBI), nhằm công bố các cấu trúc 3D dự đoán cho các phức hợp protein của hơn 2.800 loại virus — được cung cấp công khai cho bất kỳ nhà khoa học nào, ở bất cứ đâu, thông qua Cơ sở dữ liệu AlphaFold.

Các cấu trúc trong bộ dữ liệu mới được công bố đã được suy luận bằng AlphaFold2 — mô hình AI của Google DeepMind dùng để dự đoán cách các protein cuộn lại thành hình dạng 3D — với sự tối ưu hóa từ [NVIDIA BioNeMo Inference Runtime](https://docs.nvidia.com/bionemo/inference-runtime/overview). Điều này cho phép nhóm nghiên cứu mở rộng quy mô suy luận cho hàng nghìn hệ protein virus, dự đoán các phức hợp hoặc nhóm protein tương tác được mã hóa bên trong mỗi loại virus.

“Tham vọng của chúng tôi với Cơ sở dữ liệu AlphaFold luôn là dân chủ hóa quyền truy cập vào nền tảng sinh học ở quy mô lớn,” Risha Patel, quản lý quan hệ đối tác khoa học sự sống tại Google DeepMind cho biết. “Sự hợp tác này nhằm đưa hàng nghìn phức hợp virus vào cơ sở dữ liệu sẽ trang bị cho các nhà khoa học trên khắp thế giới những hiểu biết cần thiết để giúp chuẩn bị cho các đợt bùng phát dịch trong tương lai.”

NVIDIA cũng đang công khai phát hành [BioNeMo Structure Prediction Pipeline](https://github.com/NVIDIA-BioNeMo/BioNeMo-Structure-Prediction-Pipeline), quy trình làm việc tăng tốc bằng GPU được sử dụng để tạo ra bộ dữ liệu này, để các nhà nghiên cứu có thể chuyển từ trình tự protein sang cấu trúc 3D dự đoán cho các mục tiêu của riêng họ.

Việc chuẩn bị cho đại dịch tiếp theo phải bắt đầu ngay từ bây giờ. Một phân tích của Trung tâm Phát triển Toàn cầu ước tính có [khoảng 50% khả năng](https://www.cgdev.org/blog/the-next-pandemic-could-come-soon-and-be-deadlier) thế giới sẽ đối mặt với một đại dịch nghiêm trọng như COVID-19 vào năm 2050.

“Khi đại dịch tiếp theo xảy ra, có thể sẽ có một thứ gì đó xuất hiện bất ngờ, và chúng ta sẽ thiếu hụt kiến thức như đã từng có với COVID,” Joe Grove, giáo sư virus học phân tử tại Trung tâm Nghiên cứu Virus thuộc Hội đồng Nghiên cứu Y khoa - Đại học Glasgow và là cộng tác viên của dự án cho biết. “Những gì chúng tôi đang cố gắng làm là tích trữ một phần kiến thức đó trước.”

Khoảng 30% các tương tác protein được thêm vào cơ sở dữ liệu là hoàn toàn mới đối với khoa học, cho thấy các hình dạng tương tác chưa từng được ghi lại trong Ngân hàng Dữ liệu Protein (Protein Data Bank), kho lưu trữ chính các cấu trúc protein được xác định bằng thực nghiệm. Điều này mang lại những hiểu biết mới cho cộng đồng sinh học để khám phá và khai thác nhằm tạo ra tri thức mới.

“Cơ sở dữ liệu này là một động cơ để tạo ra các giả thuyết,” Chris Dallago, trưởng nhóm nghiên cứu khoa học ứng dụng về sinh học kỹ thuật số tại NVIDIA cho biết. “Chúng tôi đang cho phép các nhà sinh học và cộng đồng AI điều tra các tương tác protein, không chỉ dưới dạng các phân tử đơn lẻ mà còn là các phức hợp, để toàn bộ lĩnh vực này có thể tiến xa hơn.”

### Dự đoán cấu trúc phức hợp protein

Hầu hết các protein không hoạt động đơn lẻ — chúng kết hợp với nhau trong các phức hợp gồm nhiều phân tử để thực hiện các chức năng phức tạp. Những cấu trúc đó thường là mục tiêu mà vaccine hoặc thuốc phải nhắm tới để phá vỡ chức năng của virus.

Ví dụ, việc hiểu cấu trúc 3D của protein gai trên virus COVID-19 đã chứng minh là nền tảng cho việc thiết kế vaccine. Đối với hàng nghìn loại virus khác, hiện nay vẫn chưa có kiến thức cấu trúc như vậy. Bộ dữ liệu này bắt đầu lấp đầy khoảng trống đó.

Các phương pháp truyền thống để xác định cấu trúc protein — kết tinh protein và chiếu tia X vào chúng — có thể mất nhiều năm và tốn hàng nghìn đô la cho mỗi cấu trúc. AlphaFold2, được tối ưu hóa với [NVIDIA BioNeMo](https://github.com/NVIDIA-BioNeMo) để chạy hiệu quả trên GPU NVIDIA, dự đoán cấu trúc chỉ trong vài phút và có thể chạy hàng loạt. Sau đó, các nhà khoa học có thể xác minh các dự đoán có độ tin cậy cao thông qua các phương pháp thực nghiệm.

Đối với dự án này, nhóm đã làm việc một cách hệ thống thông qua các cấu trúc protein của các họ virus được biết là lây nhiễm sang người, từ các loại virus gây cảm lạnh thông thường đến các mối đe dọa mới nổi như Mpox.

### Một sự hợp tác toàn cầu với quyền truy cập toàn cầu

Sự hợp tác bao gồm Liên minh Đổi mới Sẵn sàng cho Dịch bệnh (CEPI), EMBL-EBI, Google DeepMind, NVIDIA, Đại học Quốc gia Seoul, Đại học Sungkyunkwan, Viện Tin sinh học Thụy Sĩ và Đại học Glasgow.

Việc phát hành bộ dữ liệu — trùng với cuộc họp Đại hội đồng Liên Hợp Quốc do Diễn đàn Kinh tế Thế giới triệu tập về phòng chống, chuẩn bị và ứng phó đại dịch diễn ra trong tuần này tại Thành phố New York — đóng góp vào Cơ sở dữ liệu AlphaFold, nơi hiện lưu trữ hơn 260 triệu dự đoán về protein và phức hợp protein, bao phủ gần như mọi protein đã được lập danh mục trong khoa học.

“Việc công khai dữ liệu này là rất quan trọng để hiểu về chẩn đoán virus và phát triển các phương pháp điều trị cũng như vaccine,” Jo McEntyre, giám đốc lâm thời của EMBL-EBI cho biết. “Bộ dữ liệu cũng bao gồm các loại virus ít được nghiên cứu hơn và giảm bớt rào cản cho các nhà khoa học ở những nơi có nguồn lực hạn chế, những người đang trực tiếp đối mặt với các đợt bùng phát dịch.”

Các dự đoán trong bộ dữ liệu mở được dán nhãn theo độ tin cậy. Các cấu trúc cho thấy hình dạng của các phức hợp virus và cách các protein riêng lẻ có thể tương tác trong một hệ protein virus.

Nhìn chung, dữ liệu mới đại diện cho một đóng góp lớn vào thông tin sẵn có cho các nhà khoa học trong lĩnh vực sinh học kỹ thuật số và nghiên cứu bệnh học.

“Khi tôi làm luận án tiến sĩ, không có cấu trúc nào cho bất kỳ protein nào mà chúng tôi đang nghiên cứu. Nó giống như làm việc trong bóng tối — chúng tôi phải đoán xem chuyện gì đang xảy ra,” Grove nói. “Bộ dữ liệu này là một công cụ mạnh mẽ cho tất cả các nhà nghiên cứu đang làm tiến sĩ hiện nay, cung cấp cho họ dữ liệu cấu trúc chất lượng cao sẽ thúc đẩy khoa học cơ bản.”

Khám phá bộ dữ liệu phức hợp protein virus trên [AlphaFold Database Pandemic Preparedness Portal](https://alphafold.ebi.ac.uk/), dự đoán cấu trúc cho các mục tiêu protein với [BioNeMo Structure Prediction Pipeline](https://github.com/NVIDIA-BioNeMo/BioNeMo-Structure-Prediction-Pipeline), và tìm hiểu thêm về [NVIDIA BioNeMo](https://github.com/NVIDIA-BioNeMo).
