Google Research: Blog (Web)
85

Nghiên cứu

Google ra mắt khung AI đa tác nhân giúp phát hiện dấu ấn sinh học từ thiết bị đeo

(giờ Việt Nam)

Tóm tắt AI

Google giới thiệu hệ thống đa tác nhân tự động phân tích dữ liệu cảm biến từ thiết bị đeo để sàng lọc các dấu ấn sinh học tiềm năng, giúp cải thiện độ chính xác trong dự đoán sức khỏe lâm sàng.

Bản dịch AI

An AI tool for prioritizing candidate biomarkers from wearable sensor data

Các thiết bị đeo thu thập các tín hiệu sinh lý liên tục trên quy mô dân số. Những luồng dữ liệu này, từ động lực học nhịp tim đến các kiểu hình giấc ngủ, có thể tiết lộ những thay đổi sinh lý sớm trước khi các triệu chứng xuất hiện. Nút thắt cổ chai hiện nay không còn nằm ở việc thu thập dữ liệu, mà là làm thế nào để biến các tín hiệu này thành những dấu ấn sinh học (biomarker) đáng tin cậy và có ý nghĩa lâm sàng.

Các hệ thống tác nhân dựa trên mô hình ngôn ngữ hiện có đã tự động hóa một phần quy trình làm việc khoa học, nhưng thường gặp lỗi khi xử lý dữ liệu chuỗi thời gian sinh lý. Các hệ thống này tối ưu hóa cho hiệu suất dự đoán trong khi bỏ qua tính hợp lệ về mặt thống kê, dẫn đến các tương quan giả, rò rỉ dữ liệu và các đặc trưng thiếu ổn định.

Để giải quyết vấn đề này, chúng tôi giới thiệu Biomarker Discovery Framework, một hệ thống đa tác nhân giúp cấu trúc hóa việc ưu tiên các ứng viên dấu ấn sinh học thành một vòng lặp nghiên cứu lặp lại dưới sự giám sát của con người. Bằng cách kết hợp tạo giả thuyết, phân tích thống kê song song, huấn luyện mô hình, kiểm chứng đối kháng và lập luận dựa trên tài liệu, Biomarker Discovery Framework tăng tốc quá trình khám phá trong khi vẫn duy trì sự chặt chẽ về thống kê và bảo toàn quyền giám sát của con người. Trên ba nhóm đối tượng (N = 9.279 quan sát từ người tham gia), Biomarker Discovery Framework đã khôi phục được các tín hiệu lâm sàng đã biết, xác định các dấu ấn sinh học hội tụ trên các tập dữ liệu độc lập và cải thiện khả năng dự đoán ở giai đoạn sau khi kết hợp với các đặc điểm nhân khẩu học.

Một quy trình đối kháng có cấu trúc với sự giám sát của con người

Biomarker Discovery Framework kết hợp tính toán xác định cho phân tích số liệu với lập luận tạo sinh để hình thành và diễn giải giả thuyết. Một tác nhân Điều phối (Orchestrator) phân tách các chỉ thị nghiên cứu bằng ngôn ngữ tự nhiên thành các kế hoạch thực thi và hướng dẫn các tác nhân chuyên biệt thông qua quy trình sáu giai đoạn. Trong khi đó, bộ nhớ chia sẻ, bảng thông tin có cấu trúc và các công cụ chung giúp duy trì khả năng truy xuất nguồn gốc trong suốt quy trình làm việc:

Ví dụ, với yêu cầu ưu tiên các ứng viên từ thiết bị đeo liên quan đến mức độ trầm cảm, Biomarker Discovery Framework đã lập hồ sơ tập dữ liệu DWB, đề xuất các đặc trưng về sự biến thiên thời gian ngủ và ước tính mối liên hệ giữa sự biến thiên thời lượng ngủ với mức độ nghiêm trọng PHQ-8 (ρ = 0,252). Quy trình sau đó kiểm tra tính ổn định, rò rỉ dữ liệu, tính nhất quán của phân nhóm và các giải thích thay thế trước khi định hình kết quả thành một giả thuyết về sự mất ổn định nhịp sinh học dựa trên tài liệu để con người xem xét.

Kết quả: Ưu tiên các mối liên hệ ứng viên trên các lĩnh vực

Để đánh giá khả năng của Biomarker Discovery Framework trong việc trích xuất các thông tin sinh lý hợp lý từ dữ liệu nhiễu, chúng tôi đã áp dụng nó một cách độc lập trên ba nhóm đối tượng quy mô lớn với tổng cộng 9.279 quan sát từ người tham gia, bao gồm cả lĩnh vực sức khỏe tâm thần (DWB và GLOBEM) và bệnh chuyển hóa (WEAR-ME). Quy trình này đã tự động xác định 41 dấu ấn sinh học kỹ thuật số ứng viên cho sức khỏe tâm thần và 25 cho các kết quả chuyển hóa.

Bảng dưới đây hiển thị một mẫu các mối liên hệ ứng viên đã được chọn lọc. Chỉ số Spearman’s ρ tóm tắt hướng và độ mạnh của mối liên hệ. Khoảng tin cậy 95% định lượng sự không chắc chắn, và giá trị p đã hiệu chỉnh tính đến các so sánh đa biến. Cơ chế này đưa ra một giả thuyết dựa trên tài liệu thay vì một kết luận nhân quả. Quan trọng là, cột cuối cùng mô tả độ mạnh của bằng chứng trước đó — không phải sự xác nhận lâm sàng trong nghiên cứu này — và các dấu sao biểu thị các mức độ bằng chứng thay vì các mã ý nghĩa thống kê.

Biomarker Discovery Framework không chỉ đơn thuần chọn các biến hiện có; nó xây dựng các đặc trưng tổng hợp mới. Ví dụ, trong lĩnh vực sức khỏe tâm thần, nó đã xác định sự biến thiên thời lượng ngủ và sự biến thiên thời điểm bắt đầu giấc ngủ là những yếu tố tương quan hàng đầu với mức độ trầm cảm. Trong lĩnh vực chuyển hóa, nó đã rút ra chỉ số thể lực tim mạch (số bước chân chia cho nhịp tim lúc nghỉ) như một yếu tố tương quan không xâm lấn với tình trạng kháng insulin, liên kết nó với các nghiên cứu trước đây về điều hòa glucose và thể lực tim mạch chuyển hóa.

Khám phá các tín hiệu lâm sàng trên quy mô lớn

Chúng tôi đã triển khai Biomarker Discovery Framework trên ba nhóm đối tượng quy mô lớn riêng biệt với tổng cộng 9.279 quan sát từ người tham gia, bao gồm cả lĩnh vực sức khỏe tâm thần và bệnh chuyển hóa.

Trên hai lĩnh vực trầm cảm, Biomarker Discovery Framework đã ưu tiên các cách vận hành khác nhau của một cấu trúc mất ổn định nhịp sinh học liên quan. Trong DWB, sự biến thiên thời lượng ngủ có liên quan đến mức độ nghiêm trọng PHQ-8 (ρ = 0,252, p < 0,001). Trong GLOBEM, sự biến thiên thời điểm bắt đầu giấc ngủ nổi lên như một mối liên hệ thăm dò, tín hiệu thấp với PHQ-4 (ρ = 0,126, p < 0,001; CV AUC = 0,535). Vì các nhóm đối tượng, điểm cuối và định nghĩa đặc trưng khác nhau — và không có ứng viên giống hệt nào được tái lập — mô hình này nên được hiểu là sự hội tụ ở cấp độ cấu trúc mang tính gợi ý, không phải là sự tái lập trực tiếp.

Tổng cộng, Biomarker Discovery Framework đã xác định 41 dấu ấn sinh học kỹ thuật số ứng viên cho sức khỏe tâm thần và 25 cho các kết quả chuyển hóa. Mặc dù quy mô hiệu ứng phản ánh các mức độ khiêm tốn điển hình của kiểu hình kỹ thuật số cảm biến thụ động, việc tích hợp các đặc trưng do Biomarker Discovery Framework tạo ra cùng với các biến nhân khẩu học đã cải thiện hiệu suất dự đoán khi kết hợp với các đặc điểm nhân khẩu học (ΔR² = 0,040 cho trầm cảm, 0,021 cho kháng insulin).

Đánh giá bởi các chuyên gia lĩnh vực

Để đánh giá chất lượng bản thảo, 15 chuyên gia về y học, khoa học dữ liệu y sinh, học máy, tin sinh học và sức khỏe kỹ thuật số đã xem xét các báo cáo ẩn danh từ Biomarker Discovery Framework và ba hệ thống nghiên cứu AI đương đại (AI đồng khoa học của Google DeepMind, Biomni và Data Science Agent của Google ADK). Biomarker Discovery Framework, Biomni và Data Science Agent được chấm điểm cùng nhau trong 21 phiên, và Biomarker Discovery Framework được chấm điểm trong một bộ 13 phiên riêng biệt sử dụng cùng một công cụ đánh giá.

Trong đánh giá ẩn danh, Biomarker Discovery Framework nhận được điểm trung bình cao nhất trên tất cả bảy khía cạnh chất lượng. Theo quy tắc biên tập mô phỏng của nghiên cứu, đây là hệ thống duy nhất nhận được bất kỳ đề xuất “Chấp nhận” hoặc “Chỉnh sửa nhỏ” nào: 2 Chấp nhận, 8 Chỉnh sửa nhỏ, 8 Chỉnh sửa lớn và 3 Từ chối. Các nhà đánh giá ước tính rằng họ sẽ giữ lại trung bình 56,9% nội dung bản thảo do Biomarker Discovery Framework tạo ra, so với 18,8%–30,4% đối với các hệ thống cơ sở, và xếp hạng Biomarker Discovery Framework ở vị trí đầu tiên trong 9 trên 13 phiên xếp hạng bốn hệ thống.

Kết luận

Khi dữ liệu sức khỏe từ thiết bị đeo tiếp tục mở rộng trên quy mô dân số, nút thắt cổ chai trong y học kỹ thuật số không còn là việc thu thập dữ liệu, mà là việc tạo ra giả thuyết một cách nguyên tắc và nghiêm ngặt. Chỉ riêng việc mở rộng khả năng của mô hình không giải quyết được vấn đề về tính nghiêm ngặt khoa học. Tuy nhiên, khi được triển khai trong một kiến trúc được cấu trúc tỉ mỉ, tách biệt tính toán xác định khỏi lập luận tạo sinh và buộc các tác nhân phải tranh luận bảo vệ các phát hiện của mình, AI có thể hỗ trợ việc tạo, xác thực và ưu tiên giả thuyết có cấu trúc dưới sự giám sát của con người. Bằng cách chuyển từ tự động hóa hộp đen sang các quy trình làm việc minh bạch, có sự tham gia của con người, chúng ta có thể xây dựng các hệ thống AI có khả năng tăng tốc an toàn chu trình từ giả thuyết đến xác thực trong nghiên cứu lâm sàng.

Lời cảm ơn

Bài đăng trên blog này được viết bởi Yubin Kim, Hamid Palangi và Daniel McDuff từ Google Research. Công trình này được dẫn dắt bởi nghiên cứu sinh tiến sĩ MIT Yubin Kim trong kỳ thực tập tại Google dưới sự cố vấn của Daniel McDuff và Hamid Palangi. Chúng tôi biết ơn các đồng tác giả và cộng tác viên từ Google Research, Google DeepMind và giới học thuật vì những đóng góp của họ cho công trình này.

A conceptual diagram illustrating a cyclical AI-driven biomarker discovery process analyzing wearable and clinical data.Biomarker-Discovery-Framework-4Biomarker-Discovery-Framework-5Biomarker-Discovery-Framework-2Biomarker-Discovery-Framework-6
Google AIY tế sốThiết bị đeoDấu ấn sinh họcAI trong y tế
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google Research: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.