Google Research: Blog (Web)
85

Tin ngành

SymptomAI: Bước tiến mới của AI đàm thoại trong việc tự đánh giá triệu chứng sức khỏe hàng ngày

(giờ Việt Nam)

Tóm tắt AI

Google Research giới thiệu SymptomAI, một tác nhân AI đàm thoại được thiết kế để hỗ trợ người dùng tự đánh giá các triệu chứng sức khỏe thông thường một cách an toàn và hiệu quả ngay tại nhà.

Bản dịch AI

SymptomAI: Towards a conversational AI agent for everyday symptom assessment

Một phần lớn các chẩn đoán lâm sàng có thể được đưa ra chỉ dựa trên các cuộc phỏng vấn bằng ngôn ngữ. Các cuộc phỏng vấn chẩn đoán này thường được thực hiện bởi các bác sĩ lâm sàng thông qua tương tác trực tiếp hoặc từ xa giữa bác sĩ và bệnh nhân. Mặc dù những tương tác này là tiêu chuẩn vàng để đánh giá triệu chứng, chúng thường gặp phải các rào cản về tài chính, địa lý và hệ thống làm hạn chế khả năng tiếp cận. Các mô hình ngôn ngữ (LM) hiện nay đã chứng minh khả năng đánh giá chẩn đoán phân biệt mạnh mẽ khi được thử nghiệm trên các ca bệnh y tế đã qua chọn lọc, làm nổi bật tiềm năng hỗ trợ quy trình chẩn đoán. Tuy nhiên, các đánh giá hiện có chủ yếu dựa trên các bệnh án được chọn lọc, chi tiết cao và đôi khi là giả định, vốn có thể không phản ánh đúng trải nghiệm thực tế và sự đa dạng trong biểu hiện lâm sàng. Những đánh giá này không nắm bắt được cách bệnh nhân thông thường mô tả các triệu chứng sức khỏe của họ, ví dụ như với các mức độ hiểu biết y tế khác nhau, thông tin không đầy đủ và các phức tạp khác nảy sinh qua giao tiếp tự nhiên. Đây là một khoảng trống quan trọng, dẫn đến sự không chắc chắn về hiệu suất của các LM trong bối cảnh thực tế.

Để giải quyết khoảng trống này, chúng tôi thực hiện một nghiên cứu so sánh tại chỗ trên một tập hợp các tác nhân AI đàm thoại thử nghiệm, được thiết kế để khám phá cách AI đàm thoại có thể thực hiện các cuộc phỏng vấn triệu chứng toàn diện và đánh giá chẩn đoán phân biệt cho mục đích nghiên cứu. Trong bài báo nghiên cứu gần đây của chúng tôi, “SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment”, chúng tôi chia sẻ kết quả từ một nghiên cứu quy mô quốc gia ngẫu nhiên (n=13.917), trong đó các tình nguyện viên tham gia nghiên cứu đã tương tác với một trong năm tác nhân Gemini Flash 2.0 SymptomAI. Tất cả các chẩn đoán, nhãn và mối liên hệ bệnh lý được tạo ra trong nghiên cứu chỉ dành cho mục đích phân tích nghiên cứu và không cấu thành chẩn đoán lâm sàng xác nhận hoặc đánh giá y tế chính thức. Hai tuần sau khi tương tác với các tác nhân AI, chúng tôi yêu cầu những người tham gia báo cáo bất kỳ chẩn đoán nào họ nhận được từ chuyến thăm khám với nhà cung cấp dịch vụ chăm sóc sức khỏe. Sử dụng dữ liệu này, chúng tôi đã thực hiện một nghiên cứu chú giải chuyên gia lâm sàng để so sánh hiệu suất chẩn đoán của SymptomAI với các đánh giá y tế của bác sĩ lâm sàng thực tế.

Sau khi đánh giá độ chính xác của các chẩn đoán phân biệt (DDx) của SymptomAI, chúng tôi tiếp tục so sánh các chẩn đoán của SymptomAI với các tín hiệu sinh học từ thiết bị đeo Fitbit của người tham gia trong khoảng thời gian trước khi họ trò chuyện với SymptomAI. Chúng tôi cho thấy rằng các cuộc trò chuyện với SymptomAI dẫn đến chẩn đoán bệnh truyền nhiễm trùng khớp với các xu hướng sinh lý có thể chỉ ra phản ứng miễn dịch, cung cấp thêm bằng chứng về hiệu suất của SymptomAI.

Cách thức hoạt động

Chúng tôi đã tuyển chọn 13.917 tình nguyện viên đồng ý tham gia nghiên cứu, mỗi người mô tả triệu chứng của họ với một trong năm tác nhân SymptomAI ngẫu nhiên, mỗi tác nhân có mức độ linh hoạt khác nhau trong cách thực hiện phỏng vấn triệu chứng. Trong các cuộc trò chuyện này, người tham gia mô tả triệu chứng và SymptomAI đặt các câu hỏi tiếp theo, các cuộc trò chuyện kết thúc bằng một chẩn đoán phân biệt cuối cùng (DDx, danh sách các chẩn đoán khả thi) và các khuyến nghị cho các bước tiếp theo. Người tham gia sau đó có thể đến gặp nhà cung cấp dịch vụ chăm sóc sức khỏe và được yêu cầu chia sẻ kết quả của chuyến thăm khám đó thông qua một cuộc khảo sát hai tuần sau đó. Để đánh giá và thiết lập cơ sở cho SymptomAI, chúng tôi đã thực hiện một nghiên cứu chú giải chuyên gia lâm sàng, trong đó một hội đồng gồm ba bác sĩ lâm sàng được chứng nhận đã xem xét các bản ghi chép cuộc trò chuyện và đưa ra đánh giá riêng của họ (tức là chẩn đoán phân biệt). Sau đó, mỗi bác sĩ lâm sàng, theo cách ẩn danh, đã xếp hạng DDx do SymptomAI cung cấp và DDx do các bác sĩ lâm sàng còn lại cung cấp.

Kết quả chính

Sự ưu tiên của các chuyên gia lâm sàng đối với DDx của SymptomAI

Chúng tôi nhận thấy rằng các bác sĩ lâm sàng ưu tiên DDx do SymptomAI tạo ra hơn là DDx do các bác sĩ lâm sàng khác cung cấp trong hơn 50% các trường hợp. Điều này cho thấy DDx của SymptomAI phù hợp với các đánh giá y tế của bác sĩ lâm sàng của chúng tôi thường xuyên hoặc nhiều hơn so với các bác sĩ lâm sàng khác.

Các chuyên gia lâm sàng nhận thấy DDx của SymptomAI chính xác hơn

Tương tự, chúng tôi so sánh độ chính xác của DDx do SymptomAI tạo ra và do các bác sĩ lâm sàng thực tế cung cấp thông qua Độ chính xác top-5 (tức là liệu chẩn đoán đúng do nhà cung cấp dịch vụ chăm sóc sức khỏe cá nhân của người tham gia đưa ra có xuất hiện là một trong năm chẩn đoán khả thi trong DDx hay không). Chúng tôi yêu cầu các bác sĩ lâm sàng xác định xem chẩn đoán được cung cấp có nằm trong mỗi DDx hay không, bao gồm cả DDx do SymptomAI tạo ra và DDx do các bác sĩ lâm sàng cung cấp. Chúng tôi nhận thấy rằng các bác sĩ lâm sàng xếp hạng DDx do SymptomAI tạo ra là chính xác thường xuyên hơn so với DDx do các bác sĩ lâm sàng khác cung cấp.

Khai thác thêm thông tin giúp cải thiện hiệu suất

Là một phần của nghiên cứu này, chúng tôi đã đánh giá các phương pháp khác nhau để thực hiện các cuộc phỏng vấn khai thác bệnh sử. Những người tham gia được phân ngẫu nhiên vào năm nhóm nghiên cứu, mỗi nhóm sử dụng các chiến lược gợi ý khác nhau. Hai nhóm (Dynamic Live và Dynamic Final) được trao toàn quyền đặt các câu hỏi tiếp theo không giới hạn, hai nhóm khác (Fixed Canonical và Flexible Canonical) mỗi nhóm đặt các câu hỏi từ một bộ câu hỏi khai thác bệnh sử tiêu chuẩn được giảng dạy trong trường y, và cuối cùng là một Base unprompted LM, đại diện cho trải nghiệm hoàn toàn do người dùng điều khiển, vốn là trạng thái hiện tại khi truy vấn các chatbot LM. Chúng tôi nhận thấy rằng tất cả các chiến lược gợi ý do tác nhân điều khiển (tức là nơi SymptomAI chủ động đặt câu hỏi tiếp theo) đều vượt trội đáng kể so với điều kiện Cơ sở (Base), chứng minh giá trị của việc khai thác thông tin từ người tham gia để cải thiện độ chính xác của chẩn đoán phân biệt.

Hiệu suất của SymptomAI trên các ví dụ có độ tin cậy thấp

Chúng tôi nhận thấy rằng hiệu suất của SymptomAI vượt trên các tiêu chuẩn lâm sàng là lớn nhất đối với các trường hợp mà bác sĩ lâm sàng cảm thấy ít tự tin nhất vào DDx của chính họ.

Chẩn đoán từ SymptomAI tương quan với các tín hiệu sinh học

Với độ chính xác của SymptomAI so với các tiêu chuẩn lâm sàng, chúng tôi cũng có thể khám phá tiềm năng của nó ở quy mô lớn. Hiện tại, chi phí cho các nhãn lâm sàng ngăn cản việc phân tích thực tế các tập dữ liệu quy mô dân số. Các hệ thống kiểm tra triệu chứng chính xác như SymptomAI có tiềm năng cho phép gắn nhãn tham chiếu tự động cho các chẩn đoán chất lượng lâm sàng, điều này có thể mở ra các phân tích quy mô lớn về dữ liệu sinh lý — một nhiệm vụ hiện không thể thực hiện ở quy mô lớn.

Một ví dụ như vậy là tương quan giữa các tín hiệu sinh học từ thiết bị đeo với các loại bệnh khác nhau. Những thay đổi đáng chú ý nhất trong tín hiệu sinh học từ thiết bị đeo được quan sát thấy ở các bệnh nhiễm trùng đường hô hấp cấp tính. Để nghiên cứu điều này ở quy mô dân số, chúng tôi đã thu thập dữ liệu sinh trắc học hàng ngày từ những người tham gia đồng ý trong tối đa 30 ngày trước khi họ tương tác với SymptomAI. Chúng tôi tìm thấy những thay đổi rõ ràng về tín hiệu sinh học cho thấy sự khởi phát triệu chứng trong những ngày gần đến thời điểm người dùng báo cáo triệu chứng. Quan trọng là, sự phân tách giữa các nhóm thuần tập được rút ra thông qua việc phân loại chẩn đoán ứng viên top-1 của SymptomAI và nhóm các chẩn đoán được phân loại là nhiễm trùng đường hô hấp. Nhóm thuần tập này loại trừ các bệnh hô hấp không truyền nhiễm như viêm mũi dị ứng hoặc bệnh phổi tắc nghẽn mãn tính. Sự tương quan giữa các đỉnh thay đổi tín hiệu sinh học từ thiết bị đeo phù hợp với ngày báo cáo triệu chứng của những người tham gia này đóng vai trò là bằng chứng sinh lý quan sát được, phù hợp với các triệu chứng mà họ đã báo cáo.

Tiện ích cùng với các tín hiệu sinh học

Đánh giá dựa trên AI về các biểu hiện triệu chứng mở ra cánh cửa cho các nghiên cứu mới. Bằng cách sử dụng SymptomAI để phân tích một lượng lớn các báo cáo triệu chứng và kết hợp chúng với dữ liệu Fitbit thời gian thực, chúng tôi có thể khám phá các kiểu hình tín hiệu sinh học kỹ thuật số trên nhiều loại bệnh. Phân tích của chúng tôi cho thấy những thay đổi rõ rệt trong các chỉ số sinh lý — bao gồm chức năng tim mạch, hô hấp, nhiệt độ da và chất lượng giấc ngủ — trong những ngày dẫn đến cuộc trò chuyện với SymptomAI của người dùng. Những thay đổi khách quan này phù hợp chặt chẽ với thời điểm trò chuyện về triệu chứng, cung cấp một cách tiềm năng để xác thực các triệu chứng do bệnh nhân báo cáo hoặc cung cấp dữ liệu thụ động để giúp thông báo chẩn đoán phân biệt cùng với cuộc trò chuyện về triệu chứng của họ. Ngoài ra, khả năng tiếp cận thời gian thực này làm nổi bật một lợi ích cốt lõi của các hệ thống kiểm tra triệu chứng bằng AI. Không giống như các cuộc hẹn lâm sàng truyền thống có thể gặp phải sự chậm trễ trong việc lên lịch, những người tham gia có thể tham gia nghiên cứu SymptomAI cùng lúc khi các triệu chứng còn mới. Điều này có khả năng cải thiện độ chính xác của các mốc thời gian khởi phát do bệnh nhân báo cáo — một chi tiết quan trọng cho phân tích sức khỏe quy mô dân số.

Hạn chế

SymptomAI là một nỗ lực nghiên cứu mang tính khám phá, có thể đại diện cho một bước tiến nghiên cứu quan trọng trong đánh giá triệu chứng dựa trên AI và chứng minh tiềm năng mà nó có thể mang lại cho công chúng đang tìm cách hiểu về các triệu chứng của họ. Mặc dù đánh giá triển khai trên quy mô dân số cho thấy độ chính xác của việc đánh giá triệu chứng thông qua các cuộc phỏng vấn bệnh nhân từ xa, nhưng vẫn có những hạn chế tinh tế khi so sánh với các đánh giá của bác sĩ lâm sàng.

Thứ nhất, chẩn đoán phân biệt bản thân nó là một nhiệm vụ mơ hồ và ngay cả các chẩn đoán được báo cáo cũng có thể thay đổi và phát triển theo thời gian. Đánh giá triệu chứng là một lát cắt tại một thời điểm và ghi lại các triệu chứng khi chúng xuất hiện vào lúc đó. Do quy mô triển khai của chúng tôi, chúng tôi không thể kiểm soát tần suất và thời điểm báo cáo triệu chứng. Kết quả là, một số người tham gia có thể đã báo cáo triệu chứng của họ rất lâu trước khi các chỉ số đại diện hơn phát triển, trong khi những người khác có thể đã báo cáo các chỉ số rõ ràng từ một bối cảnh có hiểu biết sau nhiều năm kinh nghiệm với bệnh mãn tính. Công việc trong tương lai có thể tập trung vào các bệnh cụ thể tại các thời điểm cụ thể trong quá trình phát triển triệu chứng như hội chứng chuyển hóa khởi phát sớm hoặc các triệu chứng được thảo luận khi bắt đầu nhiễm trùng đường hô hấp. Tất cả các chẩn đoán, nhãn và mối liên hệ bệnh lý được tạo ra trong nghiên cứu đều do AI tạo ra chỉ dành cho phân tích nghiên cứu và không cấu thành chẩn đoán lâm sàng xác nhận hoặc đánh giá y tế chính thức.

Thứ hai, trong đánh giá của chúng tôi, các bác sĩ lâm sàng đã xem xét các bản ghi chép trò chuyện tĩnh và không được trao quyền để đặt các câu hỏi tiếp theo của riêng họ. Các bác sĩ lâm sàng có thể đã tìm kiếm thông tin khác một cách trực giác nếu họ trực tiếp thực hiện cuộc phỏng vấn triệu chứng. Hơn nữa, mặc dù nghiên cứu gần đây đã chỉ ra rằng các hệ thống AI đàm thoại có thể tìm kiếm dữ liệu lâm sàng với mức độ chi tiết và độ chính xác ngang tầm bác sĩ lâm sàng, các hệ thống như vậy có thể bỏ lỡ các tín hiệu thay thế như ngôn ngữ cơ thể, đánh giá trực quan, hồ sơ y tế hoặc trong bối cảnh chăm sóc ban đầu, mối quan hệ sẵn có với bệnh nhân.

Tóm lại, chúng tôi giới thiệu SymptomAI, một tác nhân AI đàm thoại mang tính điều tra để thực hiện các cuộc phỏng vấn bệnh nhân và đánh giá triệu chứng trong thế giới thực. Chúng tôi chứng minh hiệu suất thực tế toàn diện của SymptomAI thông qua độ chính xác DDx trên một mẫu dân số và cho thấy cách các chẩn đoán của SymptomAI có thể cho phép phân tích các tín hiệu quy mô dân số như tín hiệu sinh học từ thiết bị đeo để xác định các mối liên hệ trong các tín hiệu sinh lý với bệnh tật được báo cáo.

Lời cảm ơn

Công trình này là kết quả của những đóng góp ngang nhau từ Joe Breda, Jake Sunshine và Daniel McDuff. Chúng tôi xin cảm ơn các đồng tác giả và cộng tác viên của chúng tôi từ Google Research và Google DeepMind vì những đóng góp của họ cho công trình này.

SymptomAI7_BiosignalsSymptomAI2_RankingSymptomAI3_DDXSymptomAI4_Accuracy
AI y tếSymptomAIGoogle ResearchAI đàm thoạiSức khỏe số
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google Research: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.