原创

生成式 AI 如何用于病历摘要与临床文书?架构、评估和安全边界

面向医院信息化与 AI 工程团队,拆解病历摘要、环境语音文书和出院记录草稿的完整链路,说明授权数据最小化、事实与来源校验、人工签署、审计追踪、回滚和上线监测如何落地。

AI 医疗应用与治理专题 · 第 2/3 篇查看专题目录 →

生成式 AI 可以把就诊对话、检查结果和已有记录整理成病历摘要或临床文书草稿,但输出必须被视为待核验文本,不能因为语言专业、结构完整就自动写入正式病历。安全系统的核心不是更长的 Prompt,而是授权数据边界、事实可追溯、确定性校验、人工签署和持续监测。

WHO 将文书与摘要列为医疗大模型的潜在应用,同时指出错误或不完整陈述、偏倚、自动化偏见、隐私和网络安全等风险。下面以“生成待医生确认的就诊摘要”为例,拆解一条可审计的工程链路。

一、先限定用途:草稿、辅助还是自动决策

三个看似相近的产品,风险完全不同:

产品行为 推荐定位 关键控制
把已确认信息整理成固定模板 文书草稿 来源引用、字段校验、人工签署
从长病历中提取问题与待办 信息检索辅助 证据定位、遗漏测试、时效标记
根据记录推荐诊断或治疗 临床决策支持 临床验证、适用人群、监管判断、人机评估

需求文档必须写出“系统不会做什么”。例如:不新增原始记录中不存在的诊断;不推断药物剂量;不把患者转述改写成已确认事实;不在缺少关键上下文时给出完整结论。

二、建立最小化的数据入口

不要默认把整份电子病历发送给模型。每个任务只提取完成目标所需的数据,并在进入模型前完成权限检查、字段筛选和敏感信息策略。

一条推荐链路是:

授权请求
  → 按任务提取必要字段
  → 标准化时间、单位和术语
  → 为每条事实分配 source_id
  → 模型生成结构化草稿
  → 确定性校验与证据对齐
  → 专业人员审核、修改和签署
  → 写回病历并保存审计记录

source_id 很重要。它让系统可以要求每个问题、药物、过敏和检查结果都指回输入中的具体位置,而不是只返回一段无法核验的流畅文字。

三、让模型输出可验证的结构

自由文本很难判断遗漏和事实来源。可以先生成结构化对象,再由模板渲染成人类可读的文书:

{
  "problems": [
    {
      "text": "待确认的问题描述",
      "source_ids": ["note-12:paragraph-4"],
      "certainty": "reported",
      "needs_review": true
    }
  ],
  "medications": [],
  "allergies": [],
  "missing_information": [],
  "warnings": []
}

程序应拒绝未知字段和非法枚举,并检查每个 source_id 是否真实存在。对于药物名称、剂量、频次、检验值、日期、左右侧和否定表达,可增加规则或专用抽取器进行二次比对。

结构化输出只能减少格式不确定性,不能证明内容正确。模型仍可能把错误内容稳定地放进正确字段。

四、重点测四类临床文书错误

普通文本相似度无法覆盖医疗文书风险。测试集应由获得授权、完成脱敏且具备参考答案的数据构成,至少标注以下错误:

  1. 新增事实:原记录没有的诊断、症状、药物或检查结果;
  2. 关键遗漏:过敏、禁忌、异常结果、待办或重要否定信息缺失;
  3. 事实变形:时间、剂量、单位、主体、确定性或左右侧被改变;
  4. 证据错配:陈述存在,但引用了错误患者、错误日期或错误来源位置。

每类错误应按后果分级。一个标点问题和一个剂量错误不能在平均分里拥有同样权重;高严重度错误应直接触发发布阻断。

五、评估不能只看模型,还要看审核者

最终使用者面对的是“AI 草稿 + 界面 + 时间压力”,因此需要比较人机团队与原流程:

  • 完成一份文书的总时间是否下降;
  • 审核者修改了哪些字段,是否出现未发现的错误;
  • 引用能否帮助快速回到原始证据;
  • 长期使用后是否出现自动化偏见;
  • 不同科室、语言和患者亚组的错误是否集中;
  • 系统不可用时能否回到原流程。

FDA 等机构的透明度原则强调,信息应在正确的用户、位置和时间呈现。把免责声明藏在帮助页里,不如在每条高风险输出旁展示来源、适用范围和确认状态。

六、人工签署不是一个形式按钮

有效审核需要让用户看见差异和证据。界面至少应支持:

  • AI 生成内容与原始记录并排查看;
  • 逐条显示证据定位和缺失信息;
  • 对药物、过敏、诊断等关键字段突出确认;
  • 显示模型和知识库版本,但不要求临床用户理解底层参数;
  • 记录接受、修改、拒绝及最终签署者;
  • 一键报告错误并保留当时的输入与配置快照。

“医生看过”不能替代可用性验证。如果界面默认折叠来源、提醒过多或审核时间不现实,人工环节可能只剩形式上的确认。

七、上线前建立可执行门禁

一个示例门禁可以包含:

高严重度新增事实 = 0
关键药物与过敏字段来源覆盖率 = 100%
所有 source_id 可解析 = 100%
结构化输出通过率 ≥ 团队预设阈值
关键亚组均完成单独评估
人工覆盖、停用和回滚演练通过

这里不提供通用数值阈值,因为可接受风险取决于用途、患者影响和替代流程。团队应在测试前登记门禁,避免看到结果后再降低标准。

八、上线后监测什么

生产监测应同时覆盖模型、工作流和安全事件:

  • 结构校验失败、空响应、超时和回退率;
  • 医务人员修改率、拒绝率和字段级修改分布;
  • 新增事实、关键遗漏和证据错配报告;
  • 科室、设备、语言和患者亚组的性能变化;
  • Prompt、模型、检索库或上游字段变更;
  • 数据访问异常、敏感信息泄露和供应商事件;
  • 对文书时长、医生负担和患者沟通的实际影响。

更新模型前应重跑固定回归集,并对一部分真实流量做受控比较。发现严重事实错误、输入分布突变或审计链断裂时,系统应能暂停生成并回到人工流程。

九、常见问题

AI 生成的病历摘要可以直接写入电子病历吗?

不应仅凭模型输出直接写入。是否允许写回取决于用途、机构政策和当地规则;工程上至少需要权限控制、事实与来源校验、具备资质人员审核、签署和完整审计记录。

使用私有化部署就没有隐私风险了吗?

不是。私有化部署减少了部分外部传输风险,但仍需控制内部权限、日志、备份、运维访问、训练再利用、模型反演和终端展示。数据最小化与审计不会因部署位置而消失。

RAG 能消除医疗大模型幻觉吗?

不能。检索增强可以提供更相关的上下文和引用,但检索可能漏召回、选错版本,模型也可能误读证据。仍需验证检索质量、引用一致性和最终输出。

下一步可以用医疗 AI 评估与治理指南建立完整门禁;若需要先了解应用边界,可回到AI 在医疗领域的应用全景指南。

实测与内容说明

实测记录

  • 本文提供系统设计与评估框架,不提供医疗建议,也不声称任何通用大模型可在未经验证时生成可直接进入病历的内容。
  • 示例字段和门禁用于解释工程方法,实际系统必须按机构政策、当地法律、临床风险和所用产品的预期用途调整。
  • 本文未处理真实患者数据,未对具体模型进行临床准确性测试。

参考资料

内容版本 1.0 · 审核:推荐智能手记(技术与资料核验,非临床审核) · 计划复审:2026-12-09