The Decoder: AI News
Điểm AI 56/100

Hướng dẫn

Basecamp Research gọi vốn 140 triệu USD, phát triển mô hình sinh học EDEN cho y học tương lai

(giờ Việt Nam)

Tóm tắt AI

Startup Basecamp Research huy động thành công 140 triệu USD từ Nvidia, Anthropic và các quỹ lớn để phát triển mô hình AI sinh học EDEN, tập trung thiết kế kháng sinh và liệu pháp gen.

Chính văn · Bản dịch AI

Inside Basecamp Research, the AI startup turning evolution into training data

Basecamp Research đã huy động được 140 triệu USD từ các nhà đầu tư bao gồm Nvidia và Anthology Fund của Anthropic. Công ty có trụ sở tại London này huấn luyện các mô hình AI dựa trên vật liệu di truyền từ các khu rừng nhiệt đới, đại dương và suối nước nóng để thiết kế thuốc kháng sinh và các công cụ cho liệu pháp tế bào. Trong một cuộc phỏng vấn với THE DECODER, CTO Philip Lorenz giải thích lý do tại sao sinh học là một bài toán khó hơn nhiều đối với AI so với ngôn ngữ, và tại sao điểm số tốt trên lý thuyết không đảm bảo tạo ra các phân tử tốt.

Theo công ty, nhà đầu tư S32 đã dẫn đầu vòng gọi vốn này. Nvidia, Anthology Fund của Anthropic, NATO Innovation Fund và Redalpine cũng tham gia, cùng với các nhà đầu tư khác.

Được thành lập vào năm 2020, Basecamp dự định sử dụng số tiền này để tiếp tục phát triển các mô hình AI sinh học của mình, có tên là EDEN, và thúc đẩy các ứng viên liệu pháp của riêng mình tiến tới phát triển lâm sàng. Liệu pháp tế bào được ưu tiên hàng đầu. Những phương pháp điều trị này biến đổi gen các tế bào của bệnh nhân để chúng có thể chống lại ung thư, chẳng hạn. Basecamp muốn thực hiện sự thay đổi đó trực tiếp bên trong cơ thể.

Để đạt được điều đó, công ty tìm kiếm các vi sinh vật từ những môi trường sống mà các nhà nghiên cứu hầu như chưa từng nghiên cứu. Các mô hình này được kỳ vọng sẽ học được các mô hình từ bộ gen của chúng để có thể đưa vào ứng dụng y tế.

"Với sự phức tạp của sinh học, chúng ta chỉ cần lượng dữ liệu lớn hơn gấp nhiều lần," Philip Lorenz, CTO của Basecamp, chia sẻ với THE DECODER. Ông cho biết, điều quan trọng nhất là kết hợp việc thu thập dữ liệu khổng lồ đó với các thí nghiệm nhỏ, có mục tiêu.

Vẫn còn rất nhiều công việc phát triển phía trước trước khi bất kỳ điều gì trong số này trở thành phương pháp điều trị. Cho đến nay, Basecamp mới chỉ có kết quả trong phòng thí nghiệm và dữ liệu từ chuột. Điều đó chưa cho thấy liệu phương pháp của họ có thể tạo ra các liệu pháp an toàn và hiệu quả ở người hay không.

Tại sao các cơ sở dữ liệu bộ gen công cộng không thể hỗ trợ AI sinh học

Tờ The Wall Street Journal gần đây đưa tin rằng các công ty dược phẩm đang đổ hàng tỷ USD vào AI, nhưng bằng chứng vững chắc về tỷ lệ thành công cao hơn đáng kể trong phát triển lâm sàng vẫn còn khan hiếm. Lorenz không coi đó là lý do để nghi ngờ công nghệ này. Việc mở rộng quy mô đã mang lại những bước tiến lớn cho các mô hình ngôn ngữ rất nhanh chóng. Sinh học cũng đang tiến bộ, ông nói, nhưng những câu hỏi lớn chưa có lời giải, như việc đẩy nhanh các thử nghiệm lâm sàng, lại khó khăn hơn nhiều. Là một bài toán, sinh học "phức tạp hơn và lớn hơn rất, rất, rất nhiều."

Dữ liệu cũng khác biệt về cơ bản. Các mô hình ngôn ngữ học từ các bộ sưu tập văn bản khổng lồ, trong khi các công ty dược phẩm thường làm việc với các tập dữ liệu nhỏ, bị cô lập từ các nghiên cứu riêng lẻ.

Lorenz sử dụng một ước tính từ Epoch AI để cho thấy khoảng cách lớn đến mức nào. Nó đặt giới hạn trên của tất cả các từ hiện có vào khoảng 5 triệu tỷ token. Basecamp ước tính số lượng nucleotide trên Trái đất là 10 mũ 37. "Nếu bạn lấy một chồng thẻ, giống như thẻ bài poker, gồm 10 mũ 37 lá, chồng thẻ đó sẽ bao quanh vũ trụ quan sát được một triệu lần," Lorenz nói. Ông cho biết, bạn không cần một tập dữ liệu lớn đến mức đó, nhưng bạn cần một tập dữ liệu lớn hơn nhiều so với những gì tồn tại hiện nay.

Các cơ sở dữ liệu bộ gen công cộng cũng vẽ nên một bức tranh không đầy đủ về tự nhiên. Theo bài báo nghiên cứu về cơ sở dữ liệu BaseData của Basecamp, khoảng 68 phần trăm khối lượng trình tự trong Sequence Read Archive đến từ chỉ năm loài. Riêng con người chiếm khoảng 54 phần trăm.

Sự tập trung đó có ý nghĩa đối với nghiên cứu y tế. Tuy nhiên, đối với một mô hình nhằm mục đích học càng nhiều quy trình sinh học khác nhau càng tốt, Basecamp coi đó là một hạn chế, vì nhiều dạng sống khác hầu như không xuất hiện trong dữ liệu. "Nếu bạn chỉ huấn luyện LLM trên các bài báo từ năm 1975, đó sẽ là một mô hình thực sự, thực sự tồi tệ," Lorenz nói trong một nghiên cứu điển hình từ Microsoft, đối tác đám mây của công ty. "Đó chính là tình trạng của chúng ta trong sinh học hiện nay."

Vì vậy, Basecamp tự thu thập các mẫu của riêng mình với các đối tác nghiên cứu địa phương, từ đất rừng nhiệt đới, mặt đất núi lửa và vùng biển sâu ngoài khơi Nam Cực. Theo thông báo tài trợ mới nhất, mạng lưới này hiện trải rộng hơn 30 quốc gia và tất cả bảy châu lục. Microsoft cho biết số lượng tổ chức tham gia là 208 tại 31 quốc gia.

Tại thời điểm phỏng vấn, tập dữ liệu chứa khoảng 15 nghìn tỷ token, theo Lorenz. Điều đó đã đưa nó vào cùng phạm vi với các tập dữ liệu văn bản được sử dụng để huấn luyện các mô hình như Claude hoặc GPT. Tuy nhiên, ở đây, một token là một khối xây dựng DNA đơn lẻ. AI không xử lý các từ như chatbot. Nó xử lý các chuỗi ký tự mô tả vật liệu di truyền.

Theo Microsoft, thế hệ EDEN đầu tiên được huấn luyện trên 9,7 nghìn tỷ khối xây dựng DNA từ hơn một triệu loài mới được giải trình tự. Basecamp đã thực hiện việc huấn luyện với các nhà nghiên cứu của Microsoft trên Azure, và khả năng tính toán được cho là tương đương với GPT-4. Tuy nhiên, OpenAI chưa bao giờ chính thức tiết lộ con số đó.

Trong một năm rưỡi tới, tập dữ liệu dự kiến sẽ tăng khoảng một trăm lần, vượt qua một triệu tỷ token. Khung cho việc đó là Trillion Gene Atlas được công bố vào tháng 3, trong đó Basecamp, Anthropic, Nvidia, PacBio và Ultima Genomics dự định tập hợp dữ liệu di truyền ở quy mô một nghìn tỷ gen.

Trong thông báo tài trợ mới nhất, Basecamp đã gọi Trillion Gene Atlas là nền tảng huấn luyện cho các mô hình EDEN của mình. Họ không cho biết việc mở rộng theo kế hoạch đã tiến triển đến đâu.

Cuộc chạy đua vũ trang của vi khuẩn cung cấp bản thiết kế cho các loại thuốc mới

Lorenz coi quá trình tiến hóa, vốn thúc đẩy tất cả các quy trình sinh học, là mối liên kết giữa các mẫu môi trường và y học. Cho dù một loại vi khuẩn trong suối nước nóng thích nghi với nhiệt độ hay một tế bào ung thư lây lan, các áp lực chọn lọc tương tự đều đang hoạt động. Bộ gen của con người, động vật có vú và hầu hết các loài động vật có xương sống phần lớn đã được giải trình tự, trong khi phần còn lại của đa dạng sinh học hầu như chưa được lập danh mục. Nhiều loại thuốc cũng có nguồn gốc từ thực vật, vi khuẩn và nấm.

Ông chỉ ra các vi sinh vật cạnh tranh như một ví dụ cụ thể. Một số phân tử trị liệu mạnh mẽ nhất đến từ "chiến tranh sinh học" giữa các sinh vật, ông nói. Khi một loài vi khuẩn cố gắng thống trị một hệ sinh thái, đôi khi nó phát triển các chất ức chế hoặc tiêu diệt các loài đối thủ, đảm bảo thức ăn và môi trường sống cho chính nó. Điều này xảy ra hàng tỷ lần ở vô số nơi trên Trái đất, đặc biệt là nơi khan hiếm chất dinh dưỡng. Trong y học, các chất như vậy có thể hữu ích như thuốc kháng sinh.

Trong nghiên cứu điển hình của Microsoft, Lorenz gọi các thực khuẩn thể (phage) là một ví dụ khác. Những loại virus này lây nhiễm vi khuẩn và tiêm DNA của chúng vào các tế bào. Sự tương tác qua lại đó đã tạo ra các công cụ có thể được sử dụng để chỉnh sửa gen.

Basecamp muốn học hỏi từ một loạt các giải pháp tiến hóa này. Các mô hình không chỉ nhằm mục đích khám phá lại các hợp chất đã biết. Chúng được thiết kế để tạo ra các ứng viên mới từ các mô hình mà chúng đã học được.

Để làm điều này, công ty ghi lại các điều kiện hóa học, vật lý và sinh thái tại mỗi địa điểm cùng với vật liệu di truyền. Họ cũng tập trung vào các đoạn DNA dài, liên tục. Những đoạn này cho thấy gen nào nằm cạnh nhau và có thể hoạt động cùng nhau. Các đoạn ngắn, bị cô lập thường mất đi ngữ cảnh đó.

Một loại thuốc kháng sinh do AI thiết kế đã vượt qua thử nghiệm trên động vật đầu tiên

Lorenz coi các thiết kế kháng sinh của EDEN là bằng chứng ban đầu về giá trị y tế. Ông cho biết: "Chúng tôi đưa ra gợi ý về một mầm bệnh và sau đó mô hình sẽ thiết kế một loại kháng sinh để tiêu diệt nó."

Trong một bài báo nghiên cứu về dòng mô hình EDEN chưa qua bình duyệt, các tác giả đã báo cáo về một tập hợp nhỏ, được chọn lọc gồm các peptide kháng khuẩn, là những chuỗi protein ngắn có khả năng tấn công vi khuẩn. Theo bài báo, 97 phần trăm các ứng viên được thử nghiệm đều cho thấy hoạt tính trong phòng thí nghiệm.

Tỷ lệ đó chỉ áp dụng cho các lựa chọn được thử nghiệm, không áp dụng cho bất kỳ thứ gì mô hình có thể thiết kế. Tuy nhiên, Basecamp cho biết họ không dừng lại ở các thí nghiệm trong ống nghiệm.

Một thông báo của công ty từ tháng 6 mô tả các thử nghiệm với một ứng viên có tên là EDEN-7. Ở những con chuột bị nhiễm vi khuẩn kháng đa thuốc, nó được báo cáo là có hiệu quả tương đương với một loại kháng sinh dự phòng cuối cùng, loại thuốc dành riêng cho các bệnh nhiễm trùng khó điều trị.

Theo Basecamp, mô hình đã tạo ra ứng viên này trực tiếp mà không cần qua các vòng tinh chỉnh trước khi thử nghiệm. Công trình này được thực hiện cùng với các nhà nghiên cứu tại Đại học Pennsylvania dưới sự dẫn dắt của Cesar de la Fuente.

Lorenz đặt rất nhiều kỳ vọng vào bước chuyển từ thiết kế sang thử nghiệm này. Ông cho biết, Basecamp không chỉ đơn thuần là thu thập dữ liệu và huấn luyện mô hình. Điều quan trọng là các phân tử đó có thực sự hoạt động hay không.

Bên cạnh thuốc kháng sinh và các công cụ chèn gen được mô tả bên dưới, theo Microsoft, Basecamp còn để EDEN tạo ra một hệ vi sinh vật đường ruột tổng hợp gồm khoảng 9.000 loài vi khuẩn. Để kiểm tra kết quả, nhóm nghiên cứu đã mời Jill Banfield, nhà nghiên cứu hệ vi sinh vật tại UC Berkeley, người đã đặt ra các tiêu chí nghiêm ngặt và hiện là đồng tác giả của bài báo liên quan. Lorenz nói: "Thật tốt khi hỏi một con người hoài nghi thay vì chỉ dựa vào AI."

Đặt cược vào liệu pháp của Basecamp dựa trên việc chèn gen vào bên trong cơ thể

Đối với công việc trị liệu của riêng mình, hiện tại Basecamp đang sử dụng EDEN theo một cách khác. Mô hình này được thiết kế để tạo ra các công cụ sinh học có khả năng chèn các đoạn DNA lớn hơn vào các vị trí đã chọn trong bộ gen người.

Những công cụ này bao gồm các serine recombinase lớn, là các enzyme có khả năng nối lại DNA. Basecamp muốn thiết kế chúng để chúng chèn thông tin di truyền có lợi về mặt trị liệu vào các tế bào tại những vị trí chính xác.

Phương pháp này nhắm vào một vấn đề cốt lõi trong liệu pháp gen. Nhiều bệnh di truyền bắt nguồn từ các đột biến khác nhau tùy thuộc vào từng bệnh nhân. Thay vì sửa chữa từng đột biến, các enzyme này sẽ chèn một bản sao khỏe mạnh của gen bất kể đột biến cụ thể là gì. Các công cụ chèn này bắt nguồn từ chính cuộc xung đột giữa thực khuẩn thể và vi khuẩn, và chúng phải được lập trình lại trước khi có thể hoạt động trong bộ gen người.

Trong bài báo về EDEN, các tác giả báo cáo có một vài ứng viên enzyme hoạt động tốt cho mỗi vùng mục tiêu liên quan đến bệnh tật mà họ đã nghiên cứu. Một nửa số serine recombinase được tạo ra có hoạt tính trong tế bào người.

Một ứng dụng khả thi là tế bào CAR-T, các tế bào miễn dịch đã được biến đổi gen để nhận diện và tấn công tế bào ung thư. Trong một thông báo từ tháng 1, Basecamp cho biết các tế bào T nguyên phát của người được biến đổi theo cách này, nghĩa là các tế bào miễn dịch được lấy trực tiếp từ người hiến tặng, đã loại bỏ hơn 90 phần trăm tế bào khối u trong phòng thí nghiệm.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Basecamp ResearchEDENAI sinh họcGọi vốnY tế

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Basecamp Research gọi vốn 140 triệu USD, phát triển mô hình sinh học EDEN cho y học tương lai | AIHOT.vn