Google Research: Blog (Web)
92

Tin ngành

Google nâng cấp AMIE: Trợ lý AI thực hiện tư vấn y tế từ xa đạt trình độ chuyên gia

(giờ Việt Nam)

Tóm tắt AI

Google Research giới thiệu bước tiến mới của mô hình AMIE, tối ưu hóa khả năng tư vấn y tế qua âm thanh và hình ảnh với độ chính xác và kỹ năng giao tiếp tương đương bác sĩ chuyên khoa.

Bản dịch AI

Advancing AMIE towards expert-level audio-visual clinical consultations

Khi một bác sĩ gặp bệnh nhân, buổi tư vấn không chỉ dừng lại ở những lời trao đổi. Bác sĩ quan sát dáng đi của bệnh nhân, ghi nhận các dấu hiệu khó chịu có thể nhìn thấy, chú ý đến nhịp thở và hướng dẫn bệnh nhân thực hiện các thao tác thăm khám thể chất. Dòng thông tin hình ảnh và âm thanh liên tục này được tích hợp một cách liền mạch với bệnh sử lâm sàng được thuật lại bằng lời nói. Những tín hiệu phi ngôn ngữ về hình ảnh và âm thanh này đóng vai trò trung tâm trong việc chẩn đoán hiệu quả, xây dựng lòng tin của bệnh nhân và giao tiếp lâm sàng.

Các hệ thống AI có khả năng suy luận lâm sàng và đối thoại có tiềm năng tăng cường đáng kể khả năng tiếp cận chuyên môn và chăm sóc y tế, hướng tới một tương lai nơi các bác sĩ có thể tập trung thời gian vào những khía cạnh ý nghĩa nhất trong tương tác với bệnh nhân. Trong các nghiên cứu ban đầu, Articulate Medical Intelligence Explorer (AMIE), hệ thống AI nghiên cứu của chúng tôi về suy luận lâm sàng và đối thoại, đã chứng minh hiệu suất ở cấp độ chuyên gia trong đối thoại chẩn đoán dựa trên văn bản và tỏ ra hiệu quả như một công cụ hỗ trợ chẩn đoán phân biệt cho các bác sĩ lâm sàng. Gần đây, chúng tôi đã nâng cao khả năng của AMIE vượt ra ngoài việc chẩn đoán để hướng tới điều trị và quản lý bệnh theo thời gian.

Chúng tôi cũng đã mở rộng khả năng của AMIE sang các đánh giá cấp chuyên gia trong các lĩnh vực ung thư học, tim mạch và nhãn khoa, cũng như suy luận chẩn đoán đa phương thức qua hình ảnh và tài liệu lâm sàng, trong các môi trường mô phỏng với các diễn viên đóng vai bệnh nhân. Song song đó, chúng tôi đã bắt đầu chuyển đổi những tiến bộ nghiên cứu này sang thực hành lâm sàng thông qua một khuôn khổ giám sát lấy bác sĩ làm trung tâm, cũng như các nghiên cứu lâm sàng thực tế đầu tiên của chúng tôi, bao gồm một nghiên cứu khả thi lâm sàng với Beth Israel Deaconess Medical Center và một nghiên cứu ngẫu nhiên trên toàn quốc đang được thực hiện với sự hợp tác của Included Health.

Bất chấp những tiến bộ này, một hạn chế cơ bản trong nghiên cứu của chúng tôi vẫn là các giao diện dựa trên văn bản đã loại bỏ các khía cạnh hình ảnh và âm thanh của thực hành lâm sàng. Bệnh nhân phải chuyển đổi các triệu chứng thể chất phức tạp thành mô tả bằng văn bản, một quá trình làm mất đi thông tin chẩn đoán và có thể ảnh hưởng tiêu cực đến những bệnh nhân có trình độ kỹ thuật số hoặc hiểu biết về sức khỏe hạn chế. Các hệ thống chỉ dựa trên văn bản không thể tự quan sát các tín hiệu hình ảnh và âm thanh vốn cung cấp thông tin cho suy luận lâm sàng, cũng như không thể hướng dẫn bệnh nhân thực hiện các thao tác thăm khám thể chất giúp định hình chẩn đoán phân biệt.

Hôm nay, trong bài viết “Hướng tới AI y tế cấp chuyên gia cho tư vấn video thời gian thực”, chúng tôi giới thiệu AMIE trong cấu hình video thời gian thực, AMIE (Video), nhằm giải quyết những hạn chế này. Được xây dựng trên nền tảng Gemini và Project Astra, AMIE (Video) thực hiện các buổi tư vấn lâm sàng qua video đồng bộ, nhận diện các tín hiệu lâm sàng phi ngôn ngữ, hướng dẫn các diễn viên đóng vai bệnh nhân thực hiện các thao tác thăm khám thể chất ảo và suy luận chẩn đoán, tất cả đều diễn ra trong thời gian thực. Trong một nghiên cứu ngẫu nhiên đa nhánh với 100 kịch bản, 300 buổi tư vấn trực tiếp và một nhóm gồm 30 bác sĩ chăm sóc ban đầu (PCP) được cấp chứng chỉ, chúng tôi trình bày minh chứng đầu tiên về một hệ thống AI thể hiện hiệu suất cấp chuyên gia trong các buổi tư vấn lâm sàng qua video thời gian thực.

AMIE (Video): Kiến trúc đa tác nhân không đồng bộ

Việc thực hiện một cuộc hội thoại lâm sàng hiệu quả qua video đòi hỏi phải cân bằng giữa các yêu cầu cạnh tranh: hệ thống phải phản hồi bệnh nhân với tốc độ hội thoại tự nhiên trong khi đồng thời thực hiện suy luận lâm sàng cẩn thận và liên tục xử lý các luồng hình ảnh và âm thanh. Hiện tại, một tác nhân đơn lẻ không thể đáp ứng tất cả các yêu cầu này. Suy luận chuyên sâu cần có thời gian, nhưng những khoảng lặng trong hội thoại sẽ làm xói mòn lòng tin và sự kết nối với bệnh nhân.

Để giải quyết thách thức này, AMIE (Video) sử dụng kiến trúc đa tác nhân không đồng bộ, phân chia công việc cho ba tác nhân chuyên biệt hoạt động liên tục song song:

Thiết kế tách biệt này cho phép AMIE (Video) duy trì độ trễ hội thoại tự nhiên trong khi vẫn thực hiện suy luận chẩn đoán và nhận thức nghe-nhìn, vốn nếu không sẽ gây ra những sự chậm trễ không thể chấp nhận được. Các đánh giá tự động xác nhận rằng mỗi tác nhân trong kiến trúc ba tác nhân này đều đóng góp quan trọng vào việc cải thiện các chỉ số lâm sàng, chẳng hạn như năng lực khai thác bệnh sử, suy luận lâm sàng và khuyến nghị điều trị, cũng như các chỉ số liên quan đến chất lượng đối thoại, bao gồm kỹ năng giao tiếp lấy bệnh nhân làm trung tâm và độ trễ phản hồi.

Định hướng phát triển bằng đánh giá tự động

Một thách thức chính trong việc xây dựng AI y tế nghe-nhìn là xác định đặc điểm năng lực nhận thức và suy luận của hệ thống ở quy mô lớn. Để định hướng phát triển, chúng tôi đã rút ra một hệ thống phân loại các năng lực nghe-nhìn lâm sàng liên quan đến y tế từ xa từ các tài liệu y khoa, bao gồm các tín hiệu hình ảnh phi ngôn ngữ, tín hiệu âm thanh và các thao tác thăm khám thể chất. Sau đó, chúng tôi đã xây dựng một bộ đánh giá tự động được cấu trúc dựa trên hệ thống phân loại này.

Khung đánh giá này kết hợp các đánh giá nghe-nhìn đơn lượt có mục tiêu với các buổi tư vấn âm thanh mô phỏng đa lượt. Các đánh giá nghe-nhìn đơn lượt kiểm tra các trường hợp cụ thể về nhận thức và suy luận lâm sàng (ví dụ: xác định chính xác vị trí giải phẫu hoặc nhận biết các dấu hiệu suy hô hấp). Các buổi tư vấn âm thanh mô phỏng đa lượt đánh giá hiệu suất hội thoại toàn diện trong khi đưa các tín hiệu hình ảnh dưới dạng mô tả văn bản vào quá trình mô phỏng (ví dụ: một trình mô phỏng bệnh nhân AI cho kịch bản Parkinson được yêu cầu hiển thị chữ viết tay của họ có thể đưa ra mô tả bằng lời nói là “[giơ giấy lên camera cho thấy nét chữ nhỏ, nguệch ngoạc]”). Cùng với nhau, các đánh giá bổ sung này cho phép lặp lại nhanh chóng thiết kế hệ thống và mô tả phong phú các khả năng cũng như các chế độ lỗi của AMIE (Video) trước khi đánh giá trên con người.

Đánh giá thông qua nghiên cứu video ngẫu nhiên

Để đánh giá năng lực lâm sàng trong bối cảnh thách thức và thực tế hơn của một buổi tư vấn lâm sàng nghe-nhìn toàn diện, chúng tôi đã thực hiện một nghiên cứu Kiểm tra Lâm sàng Cấu trúc Khách quan (OSCE) ngẫu nhiên quy mô lớn với giao diện tư vấn video đồng bộ.

Để bao quát phạm vi các tình trạng y tế trong đánh giá của chúng tôi, nghiên cứu đã trải dài trên 100 kịch bản lâm sàng bao gồm năm hệ cơ quan, bao gồm tim phổi, bụng, đầu/mắt/tai/mũi/họng (HEENT), thần kinh/tâm thần và cơ xương khớp. Mười lăm diễn viên đóng vai bệnh nhân đã thực hiện 300 buổi tư vấn tiêu chuẩn hóa trên ba nhánh nghiên cứu:

Một hội đồng độc lập gồm 20 bác sĩ chăm sóc ban đầu giàu kinh nghiệm đã đánh giá tất cả các buổi tư vấn bằng cách sử dụng các tiêu chuẩn lâm sàng đã được thiết lập, bao gồm cả thang đo năng lực lâm sàng chung và các tiêu chí chấm điểm chi tiết dành riêng cho từng trường hợp được thiết kế cho mỗi kịch bản.

Kết quả chính

Hiệu suất lâm sàng cấp chuyên gia: Trên các năng lực lâm sàng cốt lõi, sự kỹ lưỡng trong khai thác bệnh sử, độ chính xác trong chẩn đoán, sự phù hợp trong quản lý và chất lượng giao tiếp, các chuyên gia đánh giá lâm sàng đã xếp hạng AMIE (Video) ngang hàng với các bác sĩ chăm sóc ban đầu (PCP). AMIE (Video) cũng đạt hoặc vượt AMIE (Text) trên các khía cạnh này.

Thế mạnh trong quan sát và thăm khám thể chất: AMIE (Video) được đánh giá cao hơn đáng kể, trung bình, so với cả PCP và AMIE (Text) trong việc gợi mở các dấu hiệu thể chất và chủ động hướng dẫn các diễn viên đóng vai bệnh nhân thực hiện các thao tác thăm khám ảo. Lợi thế này cũng được phản ánh trong điểm số đánh giá về nhận thức và thăm khám dành riêng cho từng trường hợp.

Các diễn viên đóng vai bệnh nhân ưa thích trải nghiệm video: Các diễn viên đóng vai bệnh nhân đặc biệt ưa thích giao diện video đồng bộ hơn so với trò chuyện dựa trên văn bản, đánh giá nó dễ sử dụng hơn đáng kể và hiệu quả hơn trong việc truyền đạt các mối quan tâm về sức khỏe. Họ cũng đánh giá AMIE (Video) cao về sự đồng cảm, khả năng kết nối và sự tự tin trong chăm sóc so với cả PCP và AMIE (Text).

Hạn chế và phát triển có trách nhiệm

Nghiên cứu này có những hạn chế quan trọng và việc diễn giải các kết quả này trong bối cảnh của những hạn chế đó là rất quan trọng. Nghiên cứu này được thực hiện hoàn toàn với các diễn viên chuyên nghiệp đóng vai bệnh nhân trong môi trường lâm sàng mô phỏng, không phải với bệnh nhân thực tế đang mắc các tình trạng sức khỏe của riêng họ. Các diễn viên đóng vai bệnh nhân, dù có kỹ năng đến đâu, cũng không thể tái hiện đầy đủ sự phức tạp và khó lường của các cuộc gặp gỡ lâm sàng thực tế, và các kịch bản bị giới hạn trong các tình trạng có thể được khắc họa một cách chân thực thông qua diễn xuất, bỏ qua các biểu hiện lâm sàng quan trọng mà ở đó nhận thức nghe-nhìn sẽ có ý nghĩa chẩn đoán. Ngoài phạm vi nghiên cứu, các đánh giá tự động có mục tiêu đã tiết lộ các lỗi nhận thức và suy luận không thường xuyên, mặc dù chất lượng hội thoại và độ chính xác chẩn đoán tổng thể ở mức cao, và hệ thống vẫn xuất hiện các vấn đề kỹ thuật không liên tục có thể làm gián đoạn sự tự nhiên của hội thoại. Với bản chất nguyên mẫu của Project Astra, điều này bao gồm các cân nhắc kỹ thuật mà sự phát triển trong tương lai có thể giải quyết ở cấp độ hệ thống, vượt ra ngoài ứng dụng y tế cụ thể được khám phá trong công trình này. Việc đánh giá những phát hiện này trong các nghiên cứu với bệnh nhân thực và tình trạng lâm sàng thực là bước tiếp theo cần thiết trước khi có thể đưa ra bất kỳ kết luận nào về tính hữu dụng trong thế giới thực.

Hướng tới tương lai

Công trình này chứng minh rằng quá trình chuyển đổi từ AI lâm sàng dựa trên văn bản sang nghe-nhìn là khả thi với chất lượng cấp chuyên gia. AMIE (Video) tương tác với sự phong phú về nhận thức của thực hành lâm sàng, quan sát các tín hiệu phi ngôn ngữ, hướng dẫn thăm khám thể chất và trò chuyện tự nhiên thông qua đối thoại bằng lời nói — những khả năng tiệm cận hơn với trải nghiệm của một buổi tư vấn video y tế từ xa.

Những câu hỏi quan trọng vẫn còn đó trên con đường hướng tới bằng chứng thực tế có trách nhiệm. Các phát hiện của chúng tôi cần được xác nhận với bệnh nhân thực, mở rộng để bao quát các biểu hiện lâm sàng không thể diễn đạt bằng diễn xuất và được hỗ trợ bởi các khuôn khổ an toàn mạnh mẽ. Chúng tôi đã thực hiện những bước đầu tiên theo hướng này: một nghiên cứu khả thi thực tế với Beth Israel Deaconess Medical Center đã cung cấp bằng chứng ban đầu về sự an toàn và tính hữu dụng của AMIE dựa trên văn bản trong thực hành lâm sàng, và nghiên cứu ngẫu nhiên toàn quốc đang diễn ra của chúng tôi với Included Health đang tiếp tục đánh giá AI trong chăm sóc ảo thực tế. Cùng với nhau, những kinh nghiệm nghiên cứu này sẽ giúp định hình cách các khả năng nghe-nhìn có thể được tích hợp một cách có trách nhiệm vào thực hành lâm sàng. Mặc dù còn nhiều việc phải làm, những kết quả này đánh dấu một cột mốc quan trọng hướng tới các hệ thống AI có thể một ngày nào đó tăng cường chăm sóc bằng cách tương tác với sự phức tạp về cảm giác của thực hành lâm sàng.

Lời cảm ơn

Nghiên cứu được mô tả ở đây là công trình chung của nhiều nhóm tại Google Research và Google Deepmind. Chúng tôi biết ơn tất cả các đồng tác giả của mình - Mahvish Nagda, Jihyeon Lee, Matthew Thompson, CJ Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, Teya Bergamaschi, Suhana Bedi, Meet Shah, Pavel Dubov, Liviu Panait, Toshiyuki Fukuzawa, Sam Schmidgall, Craig Schiff, Joseph Xu, Aliya Rysbek, Yana Lunts, Jan Freyberg, Rebecca Hemenway, Sunny Virmani, David Racz, Carey Radebaugh, Joëlle Barral, Kavi Goel, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Gregory Wayne, Tao Tu, Yun Liu, Ethan Goh, Christina Chen, Ryutaro Tanno và Cameron Chen.

AMIE (Video)-2AMIE (Video)-3AMIE (Video)-1
AI y tếGoogle ResearchAMIEChẩn đoán từ xaAI chuyên gia
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google Research: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.