Latent Space
85

Tin ngành

Mô hình nhân quả cần dữ liệu nhân quả: Xaira và bước tiến trong khám phá thuốc với X-Cell

(giờ Việt Nam)

Tóm tắt AI

Xaira Therapeutics tập trung mạnh mẽ vào việc tự tạo dữ liệu để huấn luyện mô hình. Chúng tôi trò chuyện cùng Bo Wang và Ci Chu về chiến lược và lý do đằng sau cách tiếp cận đột phá này trong lĩnh vực dược phẩm.

Bản dịch AI

Causal Models Need Causal Data - Xaira’s X-Cell model for Drug Discovery (Bo Wang & Ci Chu, Chief Discovery Officer & Chief AI Scientist)

Nếu test loss đi ngang sau khi đạt 1,5 tỷ tham số trong khi training loss vẫn tiếp tục giảm khi bạn tăng quy mô, điều đó cho thấy mô hình của bạn đang bị giới hạn bởi lượng thông tin trong dữ liệu.

Việc huấn luyện trên một tập dữ liệu đơn lẻ, tương đối nhỏ đã bộc lộ một khoảng trống thông tin: mô hình 3,1 tỷ tham số bị chệch khỏi xu hướng mở rộng (scaling trend). Cả tham số lẫn năng lực tính toán đều không thể cải thiện hiệu suất vượt qua "bức tường" này. Để dự đoán những thay đổi trong biểu hiện gen, bạn cần dữ liệu giàu thông tin hơn.

Đây chính là điều mà các nhóm của Chu và Bo đã thực hiện, và dưới đây là những gì mà lượng thông tin gấp khoảng 30 lần mang lại cho bạn:

Giờ đây, chúng ta có thể mở rộng quy mô với các tham số và năng lực tính toán huấn luyện! Chúng ta không biết nỗ lực này tiêu tốn bao nhiêu, nhưng có thể đoán rằng các thí nghiệm thu thập dữ liệu và cơ sở hạ tầng tốn vài chục triệu, còn tính toán + nhân sự + nghiên cứu tốn vài triệu. Ngân sách này giống ngân sách triển khai RL (RL rollout) hơn là ngân sách cho tiền huấn luyện (pre-training) giàu dữ liệu.

Chúng tôi đã rất may mắn khi có được hai nhân vật trung tâm trong câu chuyện này trên podcast của mình. Dưới sự dẫn dắt của Ci Chu và Bo Wang, Xaira Therapeutics đang đặt cược rằng dữ liệu giàu thông tin chính là chìa khóa cho sự phát triển thuốc dựa trên AI. Chu gần đây đã được thăng chức làm Giám đốc Khám phá (Chief Discovery Officer) và Bo làm Giám đốc Khoa học AI (Chief AI Scientist), nhấn mạnh tầm quan trọng chiến lược mà Xaira dành cho canh bạc này.

Nếu bạn phải tìm hiểu cách một tế bào người hoạt động, bạn sẽ làm gì? Một điểm khởi đầu tốt có thể là ghi lại những gen nào được biểu hiện (ví dụ: loại RNA nào đang tồn tại) trong các loại tế bào khác nhau, trong các hoàn cảnh khác nhau.

Đó chính là CELLxGENE, một cơ sở dữ liệu gồm 168 triệu tế bào do Chan Zuckerberg Institute xây dựng, ánh xạ mỗi tế bào với số lần phát hiện 20.000-30.000 gen trong tế bào đó, cùng với siêu dữ liệu chi tiết về từng tế bào. Một ma trận khoảng 4 nghìn tỷ mục.

Nếu Protein Data Bank (PDB) mở ra các mô hình sinh học cấu trúc [link Boltz, BioHub], thì CELLxGENE cũng làm điều tương tự cho các mô hình Virtual Cell. Giống như PDB, CELLxGENE đã truyền cảm hứng cho một "vườn thú" các mô hình AI về biểu hiện RNA; đến mức các mô hình biểu hiện RNA đã trở thành đồng nghĩa với các mô hình Virtual Cell. Bo Wang đã xây dựng một trong những mô hình có ảnh hưởng nhất, scGPT, vốn trở thành điểm khởi đầu cho mô hình mới của Xaira.

Các mô hình được huấn luyện trên CELLxGENE mô tả mối quan hệ giữa các loại tế bào và trạng thái tế bào, nhưng chúng không giỏi dự đoán điều gì sẽ xảy ra nếu chúng ta thay đổi biểu hiện RNA. Những thay đổi trong biểu hiện gen có tính tương quan cao, và trong hầu hết các trường hợp, rất khó (hoặc không thể) xác định được nguyên nhân dẫn đến kết quả.

Tuy nhiên, nếu bạn có thể "vặn nút điều chỉnh" từng gen một, bạn sẽ có thể quan sát được những gì nằm ở thượng nguồn và hạ nguồn của một gen nhất định. Bạn có thể biết liệu A → B & C hay B → A & C hay B → A, C → B → … Nếu bạn làm điều này cho tất cả các gen, thì có lẽ bạn có thể huấn luyện một mô hình dự đoán được điều gì sẽ xảy ra với một tế bào nếu bạn thay đổi một gen (ví dụ: bằng thuốc hoặc chỉnh sửa gen). Hoặc có lẽ bạn có thể tìm ra cách ít xâm lấn nhất để thay đổi biểu hiện của một gen cụ thể.

Đây chính xác là những gì các nhóm của Chu và Bo đã thực hiện. Tập dữ liệu được gọi là X-Atlas và mô hình được gọi là X-Cell.

Trong tập này, chúng tôi thảo luận về:

Tại sao nhóm từ bỏ autoregression để chuyển sang diffusion

Các thí nghiệm dựa trên CRISPR chạy hàng triệu thử nghiệm song song và tạo ra dữ liệu thô cho X-Atlas và X-cell

Khả năng tổng quát hóa sang các thí nghiệm phòng lab thực tế trong tế bào người thật

Đánh bại đường cơ sở tuyến tính (linear baseline) vốn đã vượt trội hơn các mô hình trước đó

Việc biện minh cho một "mớ hỗn độn" các giả định tiên nghiệm (priors), và cách chúng so sánh với dữ liệu và kiến trúc

Bo cũng chia sẻ với chúng tôi một số lợi thế (lớn) mà ông có khi là một học giả so với một nhà lãnh đạo trong ngành, và cách các phòng lab của ông bắt kịp tốc độ đổi mới chóng mặt của AI.

Hãy xem tập đầy đủ trên YouTube hoặc nền tảng podcast yêu thích của bạn!

Những đợt thăng chức này diễn ra sau khi chúng tôi ghi hình tập podcast.

Tất nhiên, có thể có các chu kỳ trong phản ứng dây chuyền, và có thể có các hiệu ứng bậc hai, bậc ba, v.v. (nghĩa là những thứ chỉ xảy ra khi nhiều gen thay đổi cùng lúc), nhưng các hiệu ứng bậc một là một điểm khởi đầu tuyệt vời và có thể cho chúng ta biết rất nhiều điều cần thiết.

AI trong y tếKhám phá thuốcMô hình nhân quảXaira TherapeuticsDữ liệu AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.