Ngành
Concurrence quản trị AI lâm sàng ở quy mô nghìn tỷ token với Unity Gateway
(giờ Việt Nam)
Tóm tắt AI
Concurrence sử dụng Unity Gateway trên Databricks để quản lý bảo mật và truy cập cho AI lâm sàng, xử lý hơn 1,2 nghìn tỷ token mỗi năm với hiệu suất vượt trội.
Chính văn · Bản dịch AI

AI trong y tế hầu như không có biên độ cho sai sót. Các tác nhân AI hỗ trợ điều phối chăm sóc bệnh nhân phụ thuộc vào ngữ cảnh bệnh nhân đáng tin cậy, quyền kiểm soát rõ ràng đối với dữ liệu và quyền truy cập mô hình, cũng như khả năng hiển thị mọi tương tác, tất cả trong khi vẫn duy trì các yêu cầu tuân thủ nghiêm ngặt.
Concurrence đang vận hành các hệ thống tác nhân y tế này ở quy mô đáng kể. Công ty xây dựng các tác nhân AI lâm sàng trên các quy trình làm việc dành cho bệnh nhân và nhà cung cấp dịch vụ, từ bác sĩ, y tá và điều phối viên chăm sóc AI đến tài liệu môi trường, tóm tắt kế hoạch chăm sóc và truy xuất kiến thức.
Trên toàn bộ môi trường AI sản xuất, Concurrence hiện xử lý khoảng 100,8 tỷ token đầu vào và 11,2 triệu lệnh gọi LLM mỗi 30 ngày, tương đương với tốc độ chạy hàng năm khoảng 1,2 nghìn tỷ token đầu vào. Khối lượng token hàng tháng đã tăng khoảng 5 lần từ mức cơ sở cuối năm 2025 đến tháng 7 năm 2026.
Trong các quy trình lâm sàng có rủi ro cao, các tác nhân AI đáng tin cậy bắt đầu bằng dữ liệu đáng tin cậy và được quản lý tốt. Việc hỗ trợ độ tin cậy đó ở quy mô lớn đòi hỏi sự tuân thủ mạnh mẽ, kiểm thử tác nhân nghiêm ngặt và quyền truy cập AI được quản lý. Concurrence đang hợp nhất các khả năng này trên Databricks, với Lakebase cho trạng thái tác nhân và hội thoại vận hành, Unity Catalog để quản lý dữ liệu và tài sản AI, và Unity Gateway để truy cập AI tập trung và bảo mật trên các khối lượng công việc AI của nhà phát triển đang phát triển nhanh chóng.
Xây dựng AI lâm sàng đáng tin cậy trên dữ liệu tin cậy
Dữ liệu y tế thường xung đột giữa các hệ thống. Một bệnh nhân có thể cung cấp thông tin khác với hồ sơ hiện có và giá trị mới nhất không phải lúc nào cũng đáng tin cậy nhất.
Concurrence giải quyết vấn đề này bằng cách ghi lại thông tin mới dưới dạng các sự kiện bất biến thay vì ghi đè lên các hồ sơ hiện có. Từ lịch sử đó, Concurrence tính toán trạng thái bệnh nhân hiện tại trong khi vẫn bảo toàn nguồn gốc và xuất xứ của từng thông tin, điều mà họ gọi là mô hình thế giới của mình. Điều này cung cấp cho các tác nhân cái nhìn và lịch sử nhất quán về những gì được biết về một bệnh nhân, đồng thời cho phép những gì họ học được từ bệnh nhân và bác sĩ phản hồi lại trạng thái cho các quy trình làm việc trong tương lai.
Databricks cung cấp nền tảng dữ liệu chia sẻ cho kiến trúc này. Các sự kiện truyền qua Zerobus Ingest vào các bảng Delta được quản lý, bao gồm 2,7 triệu sự kiện mô hình thế giới mỗi tháng và 90.000 sự kiện mỗi ngày vào thời điểm cao điểm. Apache Spark™ Declarative Pipelines dẫn xuất mô hình thế giới và dữ liệu lâm sàng của Concurrence; Unity Catalog quản lý từng môi trường khách hàng; và Lakebase phục vụ trạng thái bệnh nhân, trạng thái tác nhân và hội thoại, cùng dữ liệu cơ sở kiến thức cần thiết cho các ứng dụng vận hành.
Tiếp cận về khoảng cách chăm sóc và tuân thủ dùng thuốc là một ví dụ. Các tác nhân của Concurrence có thể gọi điện hoặc nhắn tin cho những bệnh nhân quá hạn chăm sóc theo dõi hoặc bỏ dùng thuốc, sử dụng ngữ cảnh bệnh nhân hiện có để hướng dẫn cuộc trò chuyện và ghi lại những gì họ học được vào trạng thái bệnh nhân cho các quy trình làm việc trong tương lai. Concurrence cũng chạy các ứng dụng sản xuất trên Databricks Apps, bao gồm hướng dẫn gói chăm sóc, tóm tắt kế hoạch chăm sóc của y tá và giao diện đánh giá nội dung lâm sàng. Mỗi ứng dụng đều được xây dựng trên cùng một ngữ cảnh bệnh nhân và cơ sở hạ tầng được quản lý. Việc chuyển sang kiến trúc này cũng cho phép Concurrence loại bỏ kho lưu trữ nhật ký nhắc lệnh tự xây dựng và các công việc reverse-ETL để chuyển sang sử dụng các bảng Delta được quản lý và Lakebase Synced Tables.
Kiểm thử các tác nhân AI lâm sàng trước khi đưa vào sản xuất
Mọi tác nhân trên nền tảng mới của Concurrence đều được kiểm thử với bệnh nhân mô phỏng trước khi tiếp cận bệnh nhân thực tế. Hiện nay, lưu lượng mô phỏng và đánh giá lớn hơn khoảng bảy lần so với lưu lượng sản xuất trên nền tảng mới.
Kiến trúc dữ liệu của Concurrence giúp việc kiểm thử này trở nên khả thi. Vì trạng thái bệnh nhân được tính toán từ lịch sử sự kiện bất biến, các nhóm có thể phát lại trạng thái đó và kiểm thử các lộ trình khác nhau mà không làm thay đổi hồ sơ bệnh nhân thực tế. Điều này cho phép Concurrence đánh giá cách một tác nhân phản ứng với các tình huống khác nhau trước khi triển khai cho bệnh nhân.
Các dấu vết tác nhân truyền qua Zerobus Ingest và nằm trong các bảng Delta cùng với dữ liệu lâm sàng đã tạo ra chúng. Các công việc ai_query theo lịch trình sử dụng Claude được lưu trữ trên Databricks sau đó sẽ chấm điểm các tương tác đó về chất lượng và độ an toàn của cuộc hội thoại, trích xuất bộ nhớ và ghi kết quả trở lại Delta. Với dữ liệu bệnh nhân, dấu vết, kết quả và đánh giá trên cùng một nền tảng được quản lý, các nhóm có thể điều tra xem những thay đổi về hiệu suất đến từ mô hình, dữ liệu hay quy trình làm việc.
Thực thi quản trị và tuân thủ AI trong y tế
Đối với Concurrence, các yêu cầu HIPAA định hình kiến trúc ngay từ đầu. Concurrence hiện tuân thủ HIPAA, GDPR và SOC 2, với HITRUST và ISO 27001/42001 đang được tiến hành. Mỗi tổ chức y tế có lược đồ và service principal riêng, với các quyền kiểm soát truy cập, dòng dữ liệu và dấu vết kiểm toán được quản lý thông qua Unity Catalog.
Đối với các khối lượng công việc AI hàng loạt, Concurrence chạy các công việc ai_query trên Claude được lưu trữ trên Databricks theo BAA. Trình phân giải điểm cuối của nó chỉ cho phép các mô hình nằm trong không gian tên được BAA bao phủ, ngăn chặn PHI bị định tuyến đến một mô hình không được bảo vệ. Lộ trình được bảo vệ tương tự chạy phân loại an toàn của Concurrence cho hành vi tự hại, ý định tự tử và cấp cứu y tế. Do đó, một số khối lượng công việc AI quan trọng nhất của nó được bảo vệ bởi cùng một ràng buộc kiến trúc. Điều này cũng định hình cách tiếp cận của Concurrence đối với việc định tuyến mô hình: định tuyến được kiểm soát bởi tuân thủ trước khi được kiểm soát bởi chi phí. Các mô hình trước tiên phải đáp ứng các yêu cầu tuân thủ của khối lượng công việc trước khi Concurrence xem xét đến chất lượng, hiệu suất hoặc chi phí.
Suy luận bệnh nhân và bác sĩ theo thời gian thực vẫn nằm trên cơ sở hạ tầng nhà cung cấp hiện có của Concurrence hiện nay. Concurrence đã xây dựng và gắn cờ tính năng tích hợp Unity Gateway cho suy luận thời gian thực, với một canary tổng hợp liên tục kiểm thử nó từ đầu đến cuối. Lưu lượng sản xuất có thể chuyển sang Unity Gateway khi phạm vi tuân thủ cần thiết khả dụng.

Quản trị các tác nhân lập trình với Unity Gateway
Concurrence áp dụng cách tiếp cận tương tự cho AI dành cho nhà phát triển. Các tác nhân lập trình được sử dụng trong kỹ thuật, vận hành và nghiên cứu, bao gồm cả bởi các kỹ sư được triển khai tại chỗ làm việc trong môi trường khách hàng xử lý dữ liệu y tế nhạy cảm.
Concurrence định tuyến tất cả lưu lượng truy cập mô hình và công cụ của tác nhân lập trình thông qua Unity Gateway’s coding CLI, ug. Các nhà phát triển có một lộ trình được quản lý duy nhất đến các mô hình và công cụ MCP đã được phê duyệt, trong khi mỗi yêu cầu vẫn gắn liền với danh tính của người thực hiện. Quyền truy cập MCP được quản lý tập trung thông qua cùng một môi trường, với các quyền được chỉ định theo nhóm kỹ sư và mỗi người dùng xác thực riêng lẻ khi các tác nhân truy cập các công cụ như Databricks, Datadog và Linear.
Quy mô đã rất đáng kể. Trong tháng 7, 14 người dùng cá nhân đã tạo ra 35,85 tỷ token đầu vào thông qua Unity Gateway, trong đó 95,37% là đọc bộ nhớ đệm. Kể từ khi ug ra mắt vào ngày 10 tháng 7, các tác nhân lập trình của Concurrence đã tạo ra khoảng 360.000 yêu cầu và 61 tỷ token đầu vào tích lũy.
Việc tập trung lưu lượng truy cập của coding-agent giúp Concurrence có cái nhìn bao quát về cách AI dành cho nhà phát triển được sử dụng và chi phí đi kèm. Mọi yêu cầu đều được quy cho kỹ sư đã thực hiện, cho phép các cá nhân tự theo dõi mức sử dụng của chính mình thông qua ug usage. Ở cấp độ tổ chức, Concurrence sử dụng dữ liệu sử dụng Databricks từ system.ai_gateway.usage để theo dõi các mô hình đang được sử dụng, mức tiêu thụ token, tỷ lệ bộ nhớ đệm (cache) và chi phí theo từng cá nhân và nhóm.

Tập trung quyền truy cập AI với Unity Gateway
Mục tiêu của Concurrence là đưa AI trong sản xuất, xử lý hàng loạt (batch) và AI dành cho nhà phát triển về chung một điểm kiểm soát suy luận (inference control point) với Unity Gateway. AI dành cho nhà phát triển hiện đã chạy qua Unity Gateway, trong khi suy luận hàng loạt chạy trên các mô hình do Databricks lưu trữ thông qua các đường dẫn được BAA bảo vệ. Hiện nay, Claude Opus 4.8 và GPT-5.6 Sol chiếm phần lớn mức sử dụng mô hình coding-agent, với mức sử dụng Opus 5 đang tăng dần. Suy luận thời gian thực cho bệnh nhân và bác sĩ lâm sàng vẫn được duy trì trên cơ sở hạ tầng nhà cung cấp hiện có của Concurrence cho đến khi có đủ phạm vi tuân thủ cần thiết.
Cách tiếp cận đa mô hình đó đặc biệt quan trọng đối với các khối lượng công việc lâm sàng của Concurrence. Công ty hiện có 14 mô hình phục vụ suy luận sản xuất và một danh mục được quản lý gồm 46 mô hình. Hầu hết khối lượng sản xuất chạy trên các mô hình nhỏ hơn, nhanh hơn, với các mô hình tiên tiến (frontier models) được dành riêng cho các tác vụ suy luận phức tạp hơn. Concurrence đang phát triển các tiêu chuẩn đánh giá suy luận lâm sàng để xác định mô hình nào hoạt động tốt nhất trên các tác vụ chăm sóc sức khỏe khác nhau.
Concurrence cũng rất hào hứng với tốc độ đổi mới của Unity Gateway. Gần đây nhất, họ đã bắt đầu thử nghiệm Unity Gateway Smart Routing so với các phương pháp định tuyến dành riêng cho chăm sóc sức khỏe mà họ đang phát triển và công bố kết quả. Vì tính đủ điều kiện của mô hình trong chăm sóc sức khỏe bắt đầu từ sự tuân thủ, các đánh giá đó sẽ xác định cách định tuyến thông minh có thể tối ưu hóa việc lựa chọn mô hình trong phạm vi giới hạn được thiết lập cho từng khối lượng công việc. Về phía nhà phát triển, Concurrence cũng đang khám phá Omnigent như một meta-harness trong môi trường coding-agent của mình.

Một nền tảng thống nhất cho AI trong chăm sóc sức khỏe
Khi Concurrence chuyển nhiều quy trình công việc hơn sang Databricks, nền tảng này trở nên giá trị hơn sau mỗi tương tác của agent. Công việc của mỗi agent có thể làm phong phú thêm trạng thái bệnh nhân mà agent tiếp theo bắt đầu, cho phép các quy trình công việc mới tái sử dụng ngữ cảnh hiện có thay vì phải xây dựng lại, từ đó giảm chi phí và nỗ lực gia tăng khi thêm các quy trình AI mới.
Với tốc độ hàng năm khoảng 1,2 nghìn tỷ token đầu vào sản xuất, nền tảng tích lũy đó đóng vai trò rất quan trọng. Bằng cách tập hợp ngữ cảnh bệnh nhân, trạng thái vận hành, dấu vết, đánh giá, quản trị và quyền truy cập AI trên Databricks, Concurrence có thể mở rộng quy mô AI lâm sàng có độ rủi ro cao trong khi vẫn duy trì được độ tin cậy và các biện pháp kiểm soát mà ngành chăm sóc sức khỏe yêu cầu.
Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.