AI 在医疗领域的应用,不只是“让模型看病”。它更常见的价值,是在明确任务和人工责任边界下,帮助医务人员识别信息、生成文书、安排资源、发现研究线索或持续监测风险。判断一个项目是否值得做,关键不在模型参数,而在它改变了哪个医疗工作流、错误会伤害谁,以及效果能否被本地数据验证。
WHO 将医疗大模型的潜在应用概括为诊断与临床照护、患者使用、行政文书、医学教育以及科研和药物研发等方向。同时,WHO 强调人的自主权、隐私、公平、透明和问责必须贯穿设计与部署。本文只讨论应用与工程治理,不构成医疗建议。
如果你已经确定具体场景,可直接使用医疗 AI 评估与治理指南建立本地验证、亚组评估与上线监测门禁。
一、医疗 AI 的六类主要应用
| 应用方向 | 典型任务 | AI 的角色 | 主要风险 |
|---|---|---|---|
| 医疗影像 | 病灶检测、分割、优先级排序、图像质量控制 | 提供候选结果或工作列表提示 | 漏诊、误报、设备和人群漂移 |
| 临床决策支持 | 风险预测、用药提醒、指南检索、鉴别诊断提示 | 为专业人员提供参考 | 自动化偏见、错误建议、适用人群不匹配 |
| 病历与文书 | 语音转写、就诊摘要、出院记录草稿、编码辅助 | 生成待审核草稿 | 幻觉、遗漏、错误归因、隐私泄露 |
| 患者服务 | 导诊、预约、随访提醒、健康教育 | 回答流程性问题并升级高风险请求 | 延误就医、错误分诊、语言与无障碍差异 |
| 科研与药物研发 | 文献筛选、队列发现、分子设计、试验匹配 | 缩小候选范围、辅助分析 | 数据偏倚、不可复现、把相关性当因果 |
| 医院运营 | 床位预测、排班、库存、拒付分析、质控 | 预测需求、自动整理信息 | 优化指标伤害公平性、流程锁定、监控不足 |
这些方向不能使用同一套验收标准。预约问答可以重点验证答案正确率和转人工率;影像诊断支持则需要临床参考标准、敏感度与特异度、亚组表现、读片工作流和上市后监测。
二、医疗影像:应用成熟不等于可以跳过本地验证
AI 可以在放射、病理、眼科和超声等图像任务中完成检测、分类、分割、重建或检查队列排序。FDA 维护的 AI-enabled medical devices 清单,能够帮助团队查看在美国获得市场授权的设备及其公开决定信息;该清单本身不是产品排行榜,也不能证明某设备适合另一家医院的人群、设备或流程。
引入影像 AI 前至少应回答:
- 预期用途是辅助发现、优先排序还是给出诊断结论?
- 训练与验证数据是否覆盖本地设备、协议、疾病谱和患者亚组?
- 错误结果在界面中如何呈现,医生能否识别并覆盖?
- 上线后如何监测漏报、误报、漂移和不可用状态?
不要只比较总体 AUC。对于筛查任务,应同时查看敏感度、特异度、阳性预测值、阴性预测值和不同阈值下的工作量;对于分割任务,还要评估结果是否真正改善后续测量与决策。
三、临床决策支持:评估的是“人机团队”
临床决策支持可以做风险预警、药物相互作用提示、指南检索或诊疗路径提醒。但模型输出越接近诊断和治疗决策,错误后果越严重,证据和监管要求通常也越高。
FDA、Health Canada 与 MHRA 的机器学习医疗器械透明度原则强调,应说明预期用途、目标人群、输入输出、性能、局限、已知偏倚和生命周期监测,并关注人机团队的表现。实际验收因此不能只让模型离线答题,还要观察:提示是否在正确时间出现、是否造成告警疲劳、医务人员能否理解适用边界,以及覆盖模型建议时会发生什么。
四、生成式 AI:先从可复核的文书任务开始
生成式 AI 适合把访谈、检查结果和既有记录整理成结构化草稿,例如就诊摘要、出院记录、患者教育材料或编码候选。它能降低重复录入,但不能因为文本流畅就被当作事实正确。
更安全的落地顺序是:
- 从不直接触发诊疗行为的内部草稿开始;
- 限制模型只能使用当前患者的授权上下文;
- 对姓名、药物、剂量、时间和否定词做确定性校验;
- 要求具备权限的专业人员逐项确认后再写回系统;
- 保留输入版本、模型版本、输出、修改和签署记录。
具体工程流程可继续阅读医疗生成式 AI 病历摘要与临床文书落地指南。
五、患者服务:必须设计清晰的升级路径
患者侧 AI 可以回答预约、科室位置、检查准备等低风险问题,也可以辅助健康教育和随访提醒。但症状问答和分诊会直接影响就医行为,必须明确它不是急救通道,并针对胸痛、呼吸困难、意识改变、自伤风险等高风险表达配置确定性升级规则。
一个可接受的患者服务系统至少要做到:说明身份与能力边界;展示信息来源和更新时间;允许快速转人工;不要求用户在非授权渠道提交敏感健康信息;对弱势人群、方言、低健康素养和无障碍场景单独测试。
六、科研和药物研发:AI 用于缩小空间,不用于跳过实验
AI 可帮助检索文献、匹配临床试验、发现患者队列、预测分子性质或提出实验候选。它的价值通常是提高筛选效率,而不是替代统计设计、实验验证、伦理审查和监管证据。
科研团队应记录数据来源、纳排标准、缺失处理、代码与模型版本,区分探索性结果和验证性结果。生成模型提出的靶点、分子或因果解释,都需要独立实验或临床研究支持。
七、判断项目是否值得做的四个问题
第一,目标是否可测? 将“提升效率”改成可验证指标,例如平均文书时间、需人工修改的事实错误数、告警响应时间或单位成功任务成本。
第二,风险是否可控? 先描述最坏错误,再决定人工复核、拒答、回退和停用机制,而不是上线后再补安全策略。
第三,证据是否匹配场景? 供应商演示、公开论文、外院结果和本地真实工作流是不同层级的证据。高风险用途需要更接近本地临床环境的验证。
第四,责任是否明确? 产品负责人、临床负责人、数据保护、信息安全、法务和运维必须知道各自何时审批、监测、响应和停止系统。
八、医疗 AI 项目落地清单
- 写清预期用途、非预期用途、用户和受影响患者;
- 判断软件功能是否可能属于医疗器械或受其他行业规则约束;
- 建立数据授权、最小化、脱敏、访问控制和留存策略;
- 用本地数据验证总体和关键亚组表现;
- 评估人机工作流,而非只测离线模型;
- 对高风险输出设置人工确认和安全回退;
- 记录模型、Prompt、知识库和配置版本;
- 监测质量、漂移、投诉、安全事件和人工覆盖;
- 为更新、回滚、暂停和退出准备明确流程。
医疗 AI 的合理起点不是“能否接入一个大模型”,而是找到一个边界清楚、结果可复核、错误可恢复的任务。价值证据与风险证据应同时增长,规模化部署应发生在本地验证之后。