生成式 AI 可以把就诊对话、检查结果和已有记录整理成病历摘要或临床文书草稿,但输出必须被视为待核验文本,不能因为语言专业、结构完整就自动写入正式病历。安全系统的核心不是更长的 Prompt,而是授权数据边界、事实可追溯、确定性校验、人工签署和持续监测。
WHO 将文书与摘要列为医疗大模型的潜在应用,同时指出错误或不完整陈述、偏倚、自动化偏见、隐私和网络安全等风险。下面以“生成待医生确认的就诊摘要”为例,拆解一条可审计的工程链路。
一、先限定用途:草稿、辅助还是自动决策
三个看似相近的产品,风险完全不同:
| 产品行为 | 推荐定位 | 关键控制 |
|---|---|---|
| 把已确认信息整理成固定模板 | 文书草稿 | 来源引用、字段校验、人工签署 |
| 从长病历中提取问题与待办 | 信息检索辅助 | 证据定位、遗漏测试、时效标记 |
| 根据记录推荐诊断或治疗 | 临床决策支持 | 临床验证、适用人群、监管判断、人机评估 |
需求文档必须写出“系统不会做什么”。例如:不新增原始记录中不存在的诊断;不推断药物剂量;不把患者转述改写成已确认事实;不在缺少关键上下文时给出完整结论。
二、建立最小化的数据入口
不要默认把整份电子病历发送给模型。每个任务只提取完成目标所需的数据,并在进入模型前完成权限检查、字段筛选和敏感信息策略。
一条推荐链路是:
授权请求
→ 按任务提取必要字段
→ 标准化时间、单位和术语
→ 为每条事实分配 source_id
→ 模型生成结构化草稿
→ 确定性校验与证据对齐
→ 专业人员审核、修改和签署
→ 写回病历并保存审计记录
source_id 很重要。它让系统可以要求每个问题、药物、过敏和检查结果都指回输入中的具体位置,而不是只返回一段无法核验的流畅文字。
三、让模型输出可验证的结构
自由文本很难判断遗漏和事实来源。可以先生成结构化对象,再由模板渲染成人类可读的文书:
{
"problems": [
{
"text": "待确认的问题描述",
"source_ids": ["note-12:paragraph-4"],
"certainty": "reported",
"needs_review": true
}
],
"medications": [],
"allergies": [],
"missing_information": [],
"warnings": []
}
程序应拒绝未知字段和非法枚举,并检查每个 source_id 是否真实存在。对于药物名称、剂量、频次、检验值、日期、左右侧和否定表达,可增加规则或专用抽取器进行二次比对。
结构化输出只能减少格式不确定性,不能证明内容正确。模型仍可能把错误内容稳定地放进正确字段。
四、重点测四类临床文书错误
普通文本相似度无法覆盖医疗文书风险。测试集应由获得授权、完成脱敏且具备参考答案的数据构成,至少标注以下错误:
- 新增事实:原记录没有的诊断、症状、药物或检查结果;
- 关键遗漏:过敏、禁忌、异常结果、待办或重要否定信息缺失;
- 事实变形:时间、剂量、单位、主体、确定性或左右侧被改变;
- 证据错配:陈述存在,但引用了错误患者、错误日期或错误来源位置。
每类错误应按后果分级。一个标点问题和一个剂量错误不能在平均分里拥有同样权重;高严重度错误应直接触发发布阻断。
五、评估不能只看模型,还要看审核者
最终使用者面对的是“AI 草稿 + 界面 + 时间压力”,因此需要比较人机团队与原流程:
- 完成一份文书的总时间是否下降;
- 审核者修改了哪些字段,是否出现未发现的错误;
- 引用能否帮助快速回到原始证据;
- 长期使用后是否出现自动化偏见;
- 不同科室、语言和患者亚组的错误是否集中;
- 系统不可用时能否回到原流程。
FDA 等机构的透明度原则强调,信息应在正确的用户、位置和时间呈现。把免责声明藏在帮助页里,不如在每条高风险输出旁展示来源、适用范围和确认状态。
六、人工签署不是一个形式按钮
有效审核需要让用户看见差异和证据。界面至少应支持:
- AI 生成内容与原始记录并排查看;
- 逐条显示证据定位和缺失信息;
- 对药物、过敏、诊断等关键字段突出确认;
- 显示模型和知识库版本,但不要求临床用户理解底层参数;
- 记录接受、修改、拒绝及最终签署者;
- 一键报告错误并保留当时的输入与配置快照。
“医生看过”不能替代可用性验证。如果界面默认折叠来源、提醒过多或审核时间不现实,人工环节可能只剩形式上的确认。
七、上线前建立可执行门禁
一个示例门禁可以包含:
高严重度新增事实 = 0
关键药物与过敏字段来源覆盖率 = 100%
所有 source_id 可解析 = 100%
结构化输出通过率 ≥ 团队预设阈值
关键亚组均完成单独评估
人工覆盖、停用和回滚演练通过
这里不提供通用数值阈值,因为可接受风险取决于用途、患者影响和替代流程。团队应在测试前登记门禁,避免看到结果后再降低标准。
八、上线后监测什么
生产监测应同时覆盖模型、工作流和安全事件:
- 结构校验失败、空响应、超时和回退率;
- 医务人员修改率、拒绝率和字段级修改分布;
- 新增事实、关键遗漏和证据错配报告;
- 科室、设备、语言和患者亚组的性能变化;
- Prompt、模型、检索库或上游字段变更;
- 数据访问异常、敏感信息泄露和供应商事件;
- 对文书时长、医生负担和患者沟通的实际影响。
更新模型前应重跑固定回归集,并对一部分真实流量做受控比较。发现严重事实错误、输入分布突变或审计链断裂时,系统应能暂停生成并回到人工流程。
九、常见问题
AI 生成的病历摘要可以直接写入电子病历吗?
不应仅凭模型输出直接写入。是否允许写回取决于用途、机构政策和当地规则;工程上至少需要权限控制、事实与来源校验、具备资质人员审核、签署和完整审计记录。
使用私有化部署就没有隐私风险了吗?
不是。私有化部署减少了部分外部传输风险,但仍需控制内部权限、日志、备份、运维访问、训练再利用、模型反演和终端展示。数据最小化与审计不会因部署位置而消失。
RAG 能消除医疗大模型幻觉吗?
不能。检索增强可以提供更相关的上下文和引用,但检索可能漏召回、选错版本,模型也可能误读证据。仍需验证检索质量、引用一致性和最终输出。
下一步可以用医疗 AI 评估与治理指南建立完整门禁;若需要先了解应用边界,可回到AI 在医疗领域的应用全景指南。