Nghiên cứu
Tại sao giao diện AI y tế cần tùy biến theo trình độ chuyên môn của người dùng
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu từ MIT chỉ ra rằng các công cụ giải thích AI trong y tế mang lại hiệu quả khác biệt tùy vào trình độ người dùng. Trong chẩn đoán bệnh da liễu, người không chuyên thường phụ thuộc vào AI, trong khi bác sĩ đa khoa lại có cách tiếp cận và phản ứng khác biệt với các gợi ý từ mô hình.
Bản dịch AI

Các nhà nghiên cứu tại MIT và các cộng sự đã phát hiện ra rằng các công cụ giải thích AI (AI explainability tools) trong lĩnh vực y tế có thể tạo ra những kết quả khác biệt rõ rệt tùy thuộc vào người sử dụng chúng.
Khi áp dụng vào việc chẩn đoán bệnh ngoài da, những người không chuyên đã cải thiện độ chính xác nhờ sự hỗ trợ của AI, mặc dù sự cải thiện này chủ yếu đến từ việc phụ thuộc vào mô hình. Các nhà cung cấp dịch vụ chăm sóc sức khỏe ban đầu lại cho thấy một mô hình khác: họ đạt kết quả tốt nhất khi nhận được dự đoán từ AI mà không kèm theo lời giải thích.
Nghiên cứu này – được đăng trên tạp chí Nature Medicine – đã xem xét việc chẩn đoán da liễu, nơi các công cụ AI đã hỗ trợ một số bác sĩ lâm sàng và ngày càng tiếp cận nhiều bệnh nhân hơn thông qua các sản phẩm tìm kiếm tích hợp AI.
Marzyeh Ghassemi, phó giáo sư tại Khoa Kỹ thuật Điện và Khoa học Máy tính của MIT, cho biết những phát hiện này đòi hỏi sự cẩn trọng trong việc thiết kế các giao diện AI y tế.
"Các hệ thống AI tốt có thể cải thiện hiệu suất trong một số môi trường y tế, nhưng điều này phải được cân bằng cẩn thận với sự phụ thuộc vào thuật toán, vốn có thể dẫn đến nhiều sai sót hơn," bà nói. "Chúng ta biết rằng cả AI và các phương pháp giải thích đều có thể gây ra thiên kiến tự động (automation bias) ở con người, và hiệu ứng neo giữ (anchoring effect) này là điều cần phải tính đến khi chúng ta thiết kế các hệ thống AI."
Giao diện làm thay đổi chẩn đoán
AI có khả năng giải thích (Explainable AI) nhằm mục đích cung cấp cho người dùng cơ sở để đánh giá kết quả đầu ra của mô hình. Một hệ thống có thể làm nổi bật các vùng trên hình ảnh y tế đã ảnh hưởng đến chẩn đoán của nó. Một cách tiếp cận khác có thể hiển thị các hình ảnh tương tự để hỗ trợ cho một dự đoán.
Các mô hình ngôn ngữ lớn (Large language models - LLM) cung cấp một lộ trình khác. Chúng có thể tạo ra một bản giải thích bằng ngôn ngữ đơn giản về lập luận của mô hình, trình bày chẩn đoán theo cách dành cho đối tượng khán giả phổ thông.
Nghiên cứu do MIT dẫn đầu đã thử nghiệm một số phương pháp này. Những người tham gia được xem hình ảnh y tế cùng với dự đoán của AI về bệnh ngoài da. Một giao diện cung cấp dự đoán và mức độ tin cậy mà không có bất kỳ lời giải thích nào. Một giao diện khác trả về các hình ảnh tương tự, và một hệ thống riêng biệt sử dụng bản đồ nhiệt (heat maps) để xác định các vùng quan tâm. Các nhà nghiên cứu cũng đã thử nghiệm các giải thích do LLM tạo ra.
Những người không chuyên đánh giá xem hình ảnh nốt ruồi trên da có dấu hiệu ung thư hay không. Các bác sĩ lâm sàng đối mặt với nhiệm vụ rộng hơn: họ phải đưa ra chẩn đoán phân biệt cho bệnh da liễu.
Người không chuyên phụ thuộc nhiều nhất vào các giải thích bằng ngôn ngữ
Mọi phương pháp giải thích đều cải thiện độ chính xác của những người không chuyên trong nghiên cứu. Các công cụ này chủ yếu giúp người tham gia xác định các nốt ruồi không phải ung thư.
Các nhà nghiên cứu cũng đã thử nghiệm một mô hình có ràng buộc về tính công bằng nhằm giải quyết sự thiên kiến đối với các tông màu da tối hơn. Mô hình đó đã cải thiện độ chính xác và giảm bớt sự chênh lệch trong chẩn đoán dựa trên tông màu da. Tuy nhiên, sự gia tăng hiệu suất này đi kèm với một rủi ro. Những người không chuyên dựa quá nhiều vào khuyến nghị của mô hình, và kết quả đầu ra không chính xác của mô hình gây hại cho hiệu suất của họ nhiều hơn là kết quả đúng giúp cải thiện nó.
"Lý do người dùng không chuyên đạt kết quả tốt hơn là vì họ phụ thuộc nhiều hơn vào các mô hình. Khi mô hình sai, nó gây hại cho hiệu suất nhiều hơn là giúp ích khi mô hình đúng. Chúng tôi chỉ đơn giản là đã có thể huấn luyện các mô hình AI rất tốt cho bối cảnh này," Ghassemi nói.
Các giải thích từ LLM tạo ra hiệu ứng phụ thuộc mạnh mẽ nhất. Những người tham gia tin tưởng vào các giải thích đó bất kể kết quả đầu ra của mô hình là đúng hay sai. Theo các nhà nghiên cứu, họ cũng thấy những lời giải thích mơ hồ hoặc chung chung lại có sức thuyết phục hơn.
Những người dùng nhận được sự hỗ trợ từ LLM đã báo cáo mức độ tự tin cao hơn đối với các câu trả lời sai. Kết quả đó gây áp lực lên việc thiết kế giao diện cho các hệ thống chẩn đoán hướng tới người tiêu dùng, nơi một lời giải thích bằng văn bản hợp lý có thể trông rất đáng tin cậy ngay cả khi mô hình đã mắc lỗi.
Roxana Daneshjou, phó giáo sư về khoa học dữ liệu y sinh và da liễu tại Đại học Stanford, cho biết những bệnh nhân có kiến thức y tế hạn chế phải đối mặt với nguy cơ lớn nhất từ kết quả đầu ra không chính xác của AI có khả năng giải thích.
"Những phát hiện này rất quan trọng khi bệnh nhân ngày càng tìm đến AI để hỗ trợ chăm sóc sức khỏe của họ," bà nói. "Kết quả của chúng tôi cho thấy những người có ít kiến thức y tế nhất lại là những người dễ bị dẫn dắt sai lệch nhất khi các mô hình AI có khả năng giải thích đưa ra kết quả sai."
Các nhà cung cấp dịch vụ chăm sóc sức khỏe ban đầu sử dụng AI theo cách khác
Các bác sĩ lâm sàng không tuân theo các giải thích AI không chính xác theo cùng một cách. Họ vẫn giữ được sự tỉnh táo khi hệ thống đưa ra khuyến nghị hoặc giải thích sai. Hiệu suất mạnh mẽ nhất của họ đến từ một giao diện hạn chế hơn, nơi hệ thống chỉ cung cấp cho bác sĩ dự đoán của mô hình mà không kèm theo lời giải thích.
Các giải thích từ LLM tạo ra mức cải thiện độ chính xác thấp nhất trong số các phương pháp giải thích được thử nghiệm đối với các bác sĩ lâm sàng. Kết quả này không cho thấy rằng các giải thích không có vai trò trong thực hành lâm sàng. Nó cho thấy rằng một định dạng giải thích phù hợp với bệnh nhân hoặc người mới bắt đầu có thể không phù hợp với một người dùng đã qua đào tạo đang thực hiện chẩn đoán phân biệt.
Tác giả chính Orson Xu, phó giáo sư tại Khoa Tin học Y sinh của Đại học Columbia, cho biết: "Vấn đề thực sự nằm ở cách mỗi nhóm sử dụng lời giải thích. Một bác sĩ lâm sàng đã có sẵn chẩn đoán trong đầu và kiểm tra AI dựa trên chuyên môn của chính họ, vì vậy một lời giải thích tồi sẽ bị phát hiện."
"Trong khi đó, một người không chuyên có thể sử dụng chính lời giải thích đó để hình thành ý kiến ngay từ đầu, vì vậy một lập luận nghe có vẻ hợp lý và tự tin có thể kéo họ về phía câu trả lời sai. Cùng một công cụ cuối cùng lại trở thành tài sản đối với người dùng này nhưng lại là gánh nặng đối với người dùng khác."
Nghiên cứu lập luận chống lại việc coi khả năng giải thích là một thành phần giao diện tiêu chuẩn hoạt động giống hệt nhau cho mọi vai trò. Kiến thức nền tảng của người dùng ảnh hưởng đến việc liệu một lời giải thích đóng vai trò kiểm chứng mô hình hay trở thành sự thay thế cho khả năng phán đoán độc lập.
Thời điểm ảnh hưởng đến thiên kiến tự động
Các nhà nghiên cứu cũng đã xem xét thời điểm người dùng nhận được sự hỗ trợ từ AI. Mọi người trở nên phụ thuộc nhiều hơn khi hệ thống hiển thị lời giải thích trước khi họ có cơ hội tự đưa ra chẩn đoán của riêng mình. Phát hiện đó chỉ ra một lựa chọn thiết kế thực tế: một giao diện có thể yêu cầu người dùng đưa ra giả thuyết chẩn đoán ban đầu, sau đó mới cung cấp khuyến nghị của AI để nêu ra các tình trạng thay thế cần xem xét.
Nghiên cứu cho thấy những người dùng phụ thuộc nhiều nhất vào AI cũng là những người có hiệu suất kém nhất khi họ hoàn thành nhiệm vụ mà không có sự hỗ trợ của AI. Những người tham gia này có thể được hưởng lợi từ sự hỗ trợ của mô hình, mặc dù họ cũng phải đối mặt với rủi ro lớn nhất khi mô hình đưa ra kết quả không chính xác.
Nghiên cứu đã so sánh hiệu suất của con người và AI trên các cách trình bày bệnh lý khác nhau. Các hệ thống AI vượt trội hơn con người khi các triệu chứng xuất hiện một cách tinh vi. Con người thực hiện tốt hơn nhiều khi hình ảnh chứa các triệu chứng không điển hình hoặc các đặc điểm không liên quan.
Các công cụ dành cho bác sĩ lâm sàng có thể cần kết quả đầu ra trực tiếp từ mô hình để hỗ trợ việc xem xét dựa trên phán đoán chuyên môn. Các công cụ dành cho bệnh nhân đòi hỏi sự cẩn trọng đặc biệt đối với các giải thích từ LLM, đặc biệt là khi hệ thống trình bày một câu chuyện đầy tự tin cho một khuyến nghị không chính xác.
Xem thêm: Mô hình PRISM2 sử dụng đối thoại lâm sàng để diễn giải các tiêu bản bệnh học.

Bạn muốn tìm hiểu thêm về AI và dữ liệu lớn từ các nhà lãnh đạo ngành? Hãy tham khảo AI & Big Data Expo diễn ra tại Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng địa điểm với các sự kiện công nghệ hàng đầu khác bao gồm Cyber Security & Cloud Expo. Nhấp vào đây để biết thêm thông tin.
AI News được vận hành bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới tại đây.
Bài viết được AI dịch và tổng hợp tự động từ Artificial Intelligence News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.