Mô hình
NVIDIA ra mắt NV-Reason-CT: Mô hình VLM mã nguồn mở cho phân tích CT 3D với tư duy như bác sĩ chẩn đoán hình ảnh
(giờ Việt Nam)
Tóm tắt AI
NVIDIA giới thiệu NV-Reason-CT, mô hình VLM mã nguồn mở kết hợp 3D ViT và Qwen3.5-4B, cho phép phân tích CT 3D, tạo báo cáo cấu trúc và suy luận theo chuỗi tư duy như bác sĩ chuyên khoa.
Chính văn · Bản dịch AI

AI trong chẩn đoán hình ảnh đã đạt được những bước tiến đáng kể trong việc phát hiện các bất thường trên ảnh X-quang ngực, tiêu bản bệnh học và các bản quét 2D. Tuy nhiên, một trong những phương thức giàu dữ liệu và có giá trị lâm sàng cao nhất—chụp cắt lớp vi tính (CT) 3D—vẫn chưa được các mô hình ngôn ngữ thị giác (VLM) hiện đại hỗ trợ đầy đủ. Các mô hình đa năng tiên tiến hoạt động kém hiệu quả trên hình ảnh thể tích, và hầu hết các mô hình AI y tế mã nguồn mở đều thiếu chiều sâu hội thoại đa bước mà các bác sĩ chẩn đoán hình ảnh cần để tin tưởng và xác minh các kết quả do AI tạo ra.
NVIDIA đang giải quyết khoảng trống này với NV-Reason-CT, một VLM được xây dựng chuyên biệt cho phân tích CT 3D. NV-Reason-CT mở rộng khả năng suy luận theo chuỗi tư duy (chain-of-thought) sang hình ảnh CT thể tích toàn diện, tạo ra các báo cáo chẩn đoán có cấu trúc, mô phỏng tư duy nội tại của bác sĩ chẩn đoán hình ảnh và hỗ trợ hội thoại tiếp nối đa bước cho vùng ngực và bụng. Mô hình này được xây dựng dựa trên phương pháp suy luận tiên phong từ NV-Reason-CXR, đã được kiểm chứng trong một nghiên cứu lâm sàng đa người đọc được chấp nhận tại RSNA 2026, xác nhận khả năng tiết kiệm thời gian cho bác sĩ trong khi vẫn duy trì độ chính xác chẩn đoán.
NV-Reason-CT là một nền tảng nghiên cứu và phát triển mở; không phải là một hệ thống chẩn đoán tự động hay sản phẩm lâm sàng đã được cấp phép. Đây là một mô hình nền tảng AI được thiết kế cho các nhà nghiên cứu và nhà phát triển xây dựng các ứng dụng phân tích CT chuyên biệt để huấn luyện bổ sung cho trường hợp sử dụng của họ.
Tại sao suy luận CT 3D đòi hỏi một cách tiếp cận khác biệt
Một ca chụp CT bụng đơn lẻ có thể bao gồm 300–600 lát cắt dọc trục, mã hóa bối cảnh giải phẫu trên ba chiều không gian mà một bộ mã hóa 2D tiêu chuẩn không thể tái tạo từ các lát cắt độc lập.
Sự phức tạp về thể tích này tạo ra một loạt các thách thức cộng hưởng cho AI y tế liên quan đến nhận thức, suy luận và chiều sâu hội thoại:
- Nhận thức: Các VLM tiêu chuẩn xử lý đầu vào hình ảnh như một lưới token 2D. Việc xử lý một khối CT như một tập hợp các khung hình 2D độc lập sẽ loại bỏ các mối quan hệ không gian giữa các lát cắt vốn định nghĩa các cấu trúc như khối u, tràn dịch và thâm nhiễm—những cấu trúc mà hình dạng, phạm vi và mật độ chỉ trở nên có ý nghĩa lâm sàng trong không gian ba chiều.
- Suy luận: Ngay cả các mô hình nhận diện đúng bất thường thường cũng chỉ đưa ra nhãn chẩn đoán mà không giải thích lý do. Các bác sĩ chẩn đoán hình ảnh không tư duy theo nhãn—họ tư duy theo các đánh giá giải phẫu hệ thống, chẩn đoán phân biệt và mức độ tin cậy. Một AI không thể tái tạo quy trình suy luận đó sẽ không thể được kiểm chứng, không thể dùng để giảng dạy hoặc tích hợp an toàn vào quy trình làm việc lâm sàng.
- Chiều sâu hội thoại: Một bác sĩ chẩn đoán hình ảnh khi xem xét một phát hiện đáng ngờ sẽ không kết thúc ca bệnh ngay từ cái nhìn đầu tiên. Họ đặt các câu hỏi tiếp nối, xem xét lại các chẩn đoán phân biệt và đối chiếu các phát hiện giữa các vùng giải phẫu. Hầu hết các mô hình hiện có đều thiếu khả năng đối thoại đa lượt để hỗ trợ kiểu suy luận lâm sàng lặp đi lặp lại này.
Cung cấp khả năng suy luận 3D toàn diện cho phân tích CT
NV-Reason-CT kết hợp bộ mã hóa vision transformer (ViT) 3D chuyên dụng với một mô hình ngôn ngữ được huấn luyện để tạo ra suy luận theo chuỗi tư duy, phản ánh cách các bác sĩ chẩn đoán hình ảnh phân tích hệ thống các khối CT.
Không giống như các phương pháp thích ứng bộ mã hóa 2D cho CT bằng cách xử lý các lát cắt độc lập, NV-Reason-CT xử lý khối CT như một đầu vào 3D thực thụ. Điều này bảo toàn tính liên tục giải phẫu xuyên mặt phẳng và cho phép mô hình suy luận về các cấu trúc một cách tổng thể, giống như cách một bác sĩ thực hiện khi cuộn xem một ca chụp.
Các khả năng cốt lõi của mô hình bao gồm:
- Tạo báo cáo có cấu trúc: NV-Reason-CT tạo ra các báo cáo chi tiết có cấu trúc. Nhóm NVIDIA đã biên soạn một hệ thống thuật ngữ (ontology) CT bao gồm 30 bất thường ở ngực và 29 ở bụng để hướng dẫn và đánh giá mô hình—như nốt phổi, tràn khí màng phổi, tổn thương gan, nang thận, v.v.—theo định dạng ánh xạ tự nhiên với quy trình tài liệu lâm sàng.
- Chuỗi tư duy mô phỏng bác sĩ: NV-Reason-CT có thể tạo ra các chuỗi suy luận mô phỏng tư duy của bác sĩ. Mô hình tạo ra các bước tư duy nội tại—kiểm tra các vùng giải phẫu một cách hệ thống, làm nổi bật các phát hiện liên quan, xem xét các chẩn đoán phân biệt và diễn đạt sự không chắc chắn—theo phong cách của một bác sĩ giàu kinh nghiệm khi xử lý một ca bệnh.
- Hội thoại tiếp nối đa bước: Các bác sĩ lâm sàng và nhà nghiên cứu có thể đặt câu hỏi tiếp nối về các phát hiện cụ thể, yêu cầu làm rõ về các chẩn đoán phân biệt hoặc thăm dò suy luận của mô hình ở bất kỳ giai đoạn nào. Khả năng đa lượt này biến NV-Reason-CT từ một công cụ tạo báo cáo thành một đối tác chẩn đoán tương tác.
- Bộ mã hóa ViT 3D toàn diện: Một bộ mã hóa thị giác 3D được xây dựng chuyên biệt xử lý các khối CT một cách tự nhiên, trích xuất các đặc trưng thể tích mà các phương pháp dựa trên 2D không thể khôi phục. Ngoài ra, tọa độ lưới token thị giác 3D được truyền tới LLM để tính đến mối quan hệ không gian giữa các token xuyên suốt các lớp LLM thông qua 3D MRoPE. Lựa chọn kiến trúc này cho phép mô hình suy luận về phạm vi không gian, hình thái mặt cắt và các mối quan hệ giữa các lát cắt—những nền tảng nhận thức cho việc diễn giải CT chính xác.
Kiến trúc NV-Reason-CT được xây dựng chuyên biệt cho suy luận thể tích như thế nào?
Kiến trúc mô hình kết hợp LLM Qwen3.5-4B với 3D ViT (Primus/Colipri). Tất cả trọng số được huấn luyện lại từ đầu đến cuối trên các tập dữ liệu CT lớn với báo cáo có cấu trúc, dấu vết suy luận, VQA đa bước (được thiết kế nội bộ). Các VLM dựa trên transformer tiêu chuẩn được thiết kế cho hình ảnh 2D. Việc thích ứng chúng với CT bằng cách làm phẳng một khối thành chuỗi các lát cắt 2D sẽ làm mất đi cấu trúc không gian định nghĩa bệnh lý thể tích.
Kiến trúc bộ mã hóa được điều chỉnh từ Primus 3D ViT, khởi tạo với trọng số Colipri trước khi huấn luyện; nó xử lý các khối CT được lấy mẫu lại thành 192³ voxel với độ phân giải đẳng hướng 2 mm, sử dụng các token patch 8x8x8 không chồng lấp—tạo ra ngữ cảnh 24x24x24 = 13.824 token thị giác. Thay vì gộp (hoặc giảm kích thước), tất cả các token thị giác được truyền tới LLM (cùng với tọa độ lưới 3D của chúng). LLM bao gồm 3D MRoPE để tính đến mối quan hệ không gian 3D của các token thị giác.
Thành phần mô hình ngôn ngữ được huấn luyện để suy luận theo phong cách của bác sĩ: xem xét hệ thống các vùng giải phẫu, ghi chú các phát hiện bình thường bên cạnh các phát hiện bất thường, thể hiện sự không chắc chắn đã được hiệu chuẩn và đi đến một kết luận có cấu trúc. Mô hình được thiết kế để phản hồi không phải như một bộ phân loại, mà như một người thầy: giải thích vấn đề, dẫn dắt qua các bằng chứng và đi đến chẩn đoán thông qua các bước logic rõ ràng.
Phương pháp huấn luyện NV-Reason-CT là gì?
Dựa trên phương pháp được giới thiệu với NV-Reason-CXR, NV-Reason-CT tuân theo quy trình huấn luyện hai giai đoạn: tinh chỉnh có giám sát (supervised fine-tuning) theo sau là học tăng cường (RL).
Giai đoạn 1: Tinh chỉnh có giám sát trên dữ liệu suy luận của bác sĩ chẩn đoán hình ảnh
Giai đoạn đầu huấn luyện mô hình trên tập dữ liệu hỗn hợp, bao gồm báo cáo có cấu trúc, các chú thích suy luận của bác sĩ chẩn đoán hình ảnh chuyên gia và VQA tổng quát. Các bác sĩ đã đóng góp những bản tường thuật chi tiết về chuỗi suy nghĩ (chain-of-thought) cho các nghiên cứu CT, ghi lại quy trình đánh giá nội bộ của họ, bao gồm những gì họ kiểm tra ở từng vùng giải phẫu, những phát hiện nào họ coi là quan trọng, những chẩn đoán phân biệt nào họ cân nhắc và cách họ đưa ra đánh giá cuối cùng.
Chương trình huấn luyện thu được bao gồm khoảng 550.000 ví dụ QA có cấu trúc trên các vùng ngực và bụng, bao gồm QA giải phẫu theo từng phần, QA về các phát hiện khu trú và tính đối xứng, QA về mức độ nghiêm trọng và xác định bất thường nhị phân. Các ví dụ từ chối đối với các câu lệnh không hợp lệ và các cặp hình ảnh-văn bản không khớp đã được đưa vào để cải thiện độ bền vững.
Dữ liệu huấn luyện bao gồm CT-RATE, các tập dữ liệu NIH CT và CancerVerse. Tập dữ liệu này được bổ sung bằng dữ liệu suy luận tổng hợp chất lượng cao được chắt lọc từ các mô hình ngôn ngữ lớn, sử dụng các chú thích của bác sĩ chẩn đoán hình ảnh chuyên gia làm ví dụ nền tảng. Tập dữ liệu kết hợp cung cấp cho mô hình tín hiệu phong phú về cách thức suy luận chẩn đoán hình ảnh có cấu trúc diễn ra trên phạm vi rộng các phát hiện CT.
Giai đoạn 2: RL để nâng cao chất lượng suy luận
Giai đoạn thứ hai sử dụng Group Relative Policy Optimization (GRPO) để tinh chỉnh chất lượng suy luận. Một hàm phần thưởng dựa trên độ chính xác của các bất thường và chẩn đoán được xác định sẽ hướng dẫn mô hình tạo ra các suy luận không chỉ có cấu trúc tốt mà còn chính xác về mặt lâm sàng. Phần thưởng GRPO có khả năng nhận biết giải phẫu. Mô hình được củng cố về độ chính xác trong từng vùng giải phẫu thay vì sử dụng một tín hiệu toàn cục duy nhất, điều này giúp cải thiện khả năng hiệu chuẩn trên toàn bộ phân phối các phát hiện ở ngực-bụng.
Phương pháp hai giai đoạn này (học các mô hình suy luận trước, sau đó củng cố tính chính xác) cho phép NV-Reason-CT khái quát hóa trên sự đa dạng của các hình ảnh CT mà không cần phải chú thích cặn kẽ các chuỗi suy luận cho toàn bộ phân phối huấn luyện.
Kết quả đánh giá chuẩn
NV-Reason-CT đạt được kết quả tiên tiến nhất trên các tiêu chuẩn đánh giá công khai hàng đầu về hiểu biết CT 3D.
Trên CT-RATE, tiêu chuẩn đánh giá công khai chính về hiểu biết CT 3D, NV-Reason-CT vượt trội hơn tất cả các mô hình cơ sở đã công bố bao gồm các mô hình đối chiếu 3D (VoxelFM, Pillar-0, CT-CLIP, Merlin), MLLM kết hợp 2D/3D (ClinFusion-8B) và các mô hình tiên phong dựa trên lát cắt (MedGemma 1.5). Đây là lần đầu tiên một mô hình mở duy nhất đạt được khả năng phân loại CT và tạo báo cáo cạnh tranh cùng một lúc.
| Mô hình | Loại | Macro-F1 | Macro-AUROC |
|---|---|---|---|
| NV-Reason-CT | VLM tạo sinh 3D gốc | 0.614 | 0.871 |
| VoxelFM | Tiền huấn luyện chỉ với hình ảnh 3D | 0.581 | 0.870 |
| Pillar-0 | Đối chiếu 3D | 0.544 | 0.861 |
| ClinFusion-8B | MLLM tạo sinh kết hợp 2D/3D | 0.442 | n/r |
| CT-CLIP | Đối chiếu 3D | 0.398 | 0.733 |
| Merlin | Đối chiếu 3D | 0.358 | 0.662 |
| MedGemma 1.5 | Lên đến 85 lát cắt dọc | 0.303 | n/r |
Bảng 1. Kết quả phân loại CT-RATE (18 nhãn, ngưỡng đồng nhất cố định). NV-Reason-CT được đánh giá bằng câu lệnh Yes/No trực tiếp mà không có đầu phân loại hoặc điều chỉnh theo tác vụ cụ thể)
Ngoài hiệu suất trên các tiêu chuẩn đánh giá, NV-Reason-CT đã nhận được những đánh giá lâm sàng tích cực từ các bác sĩ chẩn đoán hình ảnh tại Viện Y tế Quốc gia (NIH), những người đã xác nhận cả chất lượng của các báo cáo có cấu trúc và tính hợp lý về mặt lâm sàng của các dấu vết suy luận chuỗi suy nghĩ.
“NV-Reason-CT cung cấp kiểu suy luận có hệ thống, từng bước phản ánh cách chúng tôi thực sự tư duy thông qua một nghiên cứu CT,” Baris Turkbey, M.D., F.S.A.R., Bác sĩ lâm sàng cấp cao tại Viện Y tế Quốc gia cho biết. “Việc có thể xem xét quá trình tư duy của mô hình—chứ không chỉ là các kết luận của nó—là điều giúp chúng ta có thể tin tưởng và hành động dựa trên các phát hiện của nó.”
Xác thực lâm sàng và tác động thực tế
Giá trị của NV-Reason-CT vượt xa các điểm số đánh giá chuẩn. Các bác sĩ chẩn đoán hình ảnh và nhà nghiên cứu lâm sàng đã xem xét kết quả đầu ra của mô hình liên tục nhấn mạnh hai khả năng giúp nó khác biệt với các hệ thống AI CT trước đây:
- Tiết kiệm thời gian trong báo cáo có cấu trúc: Việc tạo ra một báo cáo chi tiết, có cấu trúc bao gồm hơn 60 bất thường là công việc tốn thời gian, ngay cả đối với các bác sĩ chẩn đoán hình ảnh giàu kinh nghiệm. NV-Reason-CT tạo ra kết quả này trong vài giây, với các suy luận mà bác sĩ lâm sàng có thể nhanh chóng quét, xác thực và sửa đổi—giảm tải nhận thức cho việc báo cáo định kỳ trong khi vẫn duy trì sự giám sát của bác sĩ.
- Khả năng giải thích cho phép kiểm toán: Các mô hình AI y tế truyền thống xuất ra nhãn hoặc điểm số. NV-Reason-CT xuất ra các suy luận của nó. Điều này làm cho các kết luận của mô hình có thể kiểm toán theo cách mà các hệ thống hộp đen không làm được: bác sĩ chẩn đoán hình ảnh có thể đọc chuỗi suy nghĩ, xác định nơi suy luận của mô hình phù hợp với suy luận của họ và đánh dấu nơi nó khác biệt. Đây là kiểu minh bạch mà việc áp dụng lâm sàng đòi hỏi.
NV-Reason-CT có thể giúp ích gì cho nghiên cứu và AI y tế?
NV-Reason-CT được thiết kế để trở thành nền tảng mà cộng đồng AI y tế rộng lớn hơn có thể xây dựng dựa trên đó.
Các nhà nghiên cứu có thể sử dụng các điểm kiểm tra (checkpoints) mô hình và công thức hậu huấn luyện để nghiên cứu suy luận chuỗi suy nghĩ trong chẩn đoán hình ảnh y tế, tinh chỉnh trên các tập dữ liệu CT cụ thể của tổ chức hoặc tích hợp NV-Reason-CT vào các quy trình nghiên cứu đa phương thức. Các mô hình bổ sung cho phân đoạn và SDG bao gồm NV-Generate-CTMR và NV-Segment-CTMR.
Các công ty AI y tế bao gồm các nhà cung cấp quy trình làm việc chẩn đoán hình ảnh, nhà phát triển PACS và nền tảng hỗ trợ quyết định lâm sàng có thể điều chỉnh NV-Reason-CT cho các ứng dụng lâm sàng cụ thể. Điều này cho phép tích hợp suy luận CT có cấu trúc vào các quy trình đánh giá chẩn đoán hình ảnh hiện có. Các công ty như Aidoc, HOPPR, Rad AI, Mosaic Clinical Technologies và Raidium hoạt động trong các lĩnh vực mà một mô hình CT 3D hội thoại, mở và có năng lực giải quyết được một khoảng trống năng lực thực sự.
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Technical Blog: Agentic AI / Generative AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.