智能AI
morning
把事实核查嵌入诊疗流程:MedGuard给「诊疗安全」当守门人
摘要
一 句“ 不 用担心”背后的医学事实漏洞 在线问诊中,一句 “你的脂肪肝不用担心”,背后可能隐藏着什么? 咨询者是一名既往弥漫大 B 细胞淋巴瘤患者,医生根据影像描述将脂肪肝特征误判为 “影像高密度”,据此排除了脂肪肝。该判断表面看符合医学语境,但关键医学事实与真实影像表现并不一致。 以往针对在线诊疗的安全方案,大多依赖关键词规则或简单的文本分类。这类方法对 “明显错误” 有效,但遇到需要结合患者...
MedGuard
npj
Digital
Medicine
用担心
背后的医学事实漏洞
在线问诊中
你的脂肪肝不用担心
背后可能隐藏着什么
咨询者是一名既往弥漫大
2026-08-25
1 阅读
约10分钟阅读
机器之心
字号:
一 句“ 不 用担心”背后的医学事实漏洞 在线问诊中,一句 “你的脂肪肝不用担心”,背后可能隐藏着什么? 咨询者是一名既往弥漫大 B 细胞淋巴瘤患者,医生根据影像描述将脂肪肝特征误判为 “影像高密度”,据此排除了脂肪肝。该判断表面看符合医学语境,但关键医学事实与真实影像表现并不一致。 以往针对在线诊疗的安全方案,大多依赖关键词规则或简单的文本分类。这类方法对 “明显错误” 有效,但遇到需要结合患者全局上下文、临床指南和证据链才能判断的边界案例,往往力不从心。一个 “不” 字被遗漏,结论就可能完全相反。 最近, 蚂蚁 AI 安全实验室 与厦门大学团队联合提出了 MedGuard,将医学事实核查嵌入诊疗流程。它不是又一个 AI 问诊系统,而是一层可嵌入医疗服务流程的安全基础设施 —— 在医生给出诊疗意见、AI 生成回复、用药方案形成之前,先对关键医学事实进行证据层面的验证。相关论文已被 npj Digital Medicine 接收。 论文标题:MedGuard: An LLM-Based Gatekeeper for Detecting Clinical Risks in Chinese Telemedicine Consultations 合作机构:蚂蚁集团、厦门大学 论文状态:npj Digital Medicine(Nature Portfolio,影响因子 18.0) 论文链接:https://www.nature.com/articles/s41746-026-03116-0_reference.pdf 该研究将重点聚焦于医疗安全中的诊疗安全:面向真人医生和 AI 辅助诊疗等多元医疗服务形态,在医患对话、诊断结论、用药方案和治疗建议形成的过程中,主动发现事实错误、逻辑矛盾、关键遗漏与潜在用药风险。最终沉淀为 MedGuard —— 一个面向中文医疗场景的医疗事实核查与诊疗风险识别系统。 MedGuard 在基准评测和临床专业人员评价中均展现出突出表现:基于 7B 参数量级构建,在研究构建的 MedGuardEval 医疗风险评测基准上,评测覆盖真实在线问诊、复杂临床病例和药品知识三类场景。MedGuard 在细粒度对话级风险识别任务中达到 SOTA 水平,整体优于主流开源模型与 HealthCareAgent 等代表性医疗 Agent 系统,其中 F1 相比基线平均提升 22.1%。不仅如此,在 5 分制临床评价中,按照研究预设标准,3 分及以上表示具备临床辅助参考价值;126 名覆盖 10 个科室的持证临床专业人员对 MedGuard 七项评估维度的平均评分均超过 4.0 分,整体评价达到较高水平,其中事实准确性、错误减少、法律伦理安全与整体可用性等关键维度超过 4.2 分。 难的不是 “生成答案”,而是 “判断是否可靠” 互联网诊疗让患者随时随地能看上医生,但也让诊疗风险的呈现方式发生了根本变化。 一次在线问诊可能持续数小时甚至数天。病史、症状、检查结果、处方和治疗建议分散在十几轮对话中。无论是辅助医生开展诊疗,还是支持 AI 参与医疗服务,AI 真正要发挥作用的不是 “生成一段看似专业的回复”,而是 能否完 整 理解临床语境,并准确识别哪些医学事实需要进一步核查。 研究将在线诊疗中的医学事实核查归纳为三类核心挑战。 第一,关键信息被长对话淹没。 诊疗风险往往隐藏在长链路、多轮次交流中,关键否定词、剂量信息、既往史和患者特殊情况容易被上下文信息淹没,导致重要风险信号遗漏。 第二,风险边界难以界定。 医疗安全不是简单的 “对” “错” 之分。部分诊疗建议需要结合患者具体情况、指南依据和临床经验综合判断。过度敏感会将合理诊疗行为误判为风险,产生大量无效预警,增加医生负担;过于保守则可能遗漏真正需要关注的问题。 第三,医学判断结果需要可追溯。 医疗风险识别 “这里有问题” 并不困难,难的是说清楚 “为什么有问题”。缺乏可追溯证据链的风险提示,医生难以快速复核,也就难以形成有效干预。 MedGuard 让医疗判断具备 可验证性的事实核查框架 将复杂诊疗过程拆解为可核查的医学事实 MedGuard 的思路是:将复杂的医患交流拆解为一组可独立验证的原子医学声明(atomic medical claims)。所谓原子医学声明,是指每条声明只表达一个可以独立判断真伪或风险的临床命题,例如 “该影像表现可排除脂肪肝” 或 “当前剂量适用于该年龄患者”。 系统同时维护患者全局上下文,提取年龄、性别、既往史、过敏史和当前用药等关键信息,对分散在多轮交流中的语句进行去上下文化重写,补全指代和省略信息,并保留否定关系、剂量和时间等关键临床约束。 这一过程包含关键医学信息抽取、患者上下文构建、声明去上下文化、质量审查与去重四个环节。它解决了医疗事实核查中的一个关键问题:如果待核查的医学事实本身不完整,后续检索和推理能力再强,也可能验证错误的对象。通过构建带有患者特异性的原子医学声明,MedGuard 为后续证据核查建立稳定入口。 图 1 展示了 MedGuard 对真实问诊案例的事实核查过程。系统从诊疗交流中提取关键医学声明,并结合医学证据识别潜在风险。 基于不确定性驱动证据核查,形成闭环验证能力 MedGuard 对每条医学声明,不直接进行简单的 “风险 / 无风险” 二分类,而是先进行分层谨慎判断,输出 No Risk、Low Risk、High Risk 三种状态。其中 Low Risk 并不代表低危,而是表示当前判断依据不足或语义存在歧义,需要进一步核查。 高置信的 No Risk 与 High Risk 声明可以沿快速路径完成初步判断;只有进入不确定区域的声明,才触发外部医学证据核查流程。这种 以不确定性驱动核查 的机制,使系统能够将有限的检索和推理资源集中投入最需要复核的边界案例,在降低漏报的同时控制无效预警。 图 2 展示了 MedGuard 的证据核查闭环流程:系统围绕待核查医学声明,通过规划器生成检索策略,调用医学知识资源获取证据,并由推理模块结合声明与证据输出最终风险判断。 进入核查路径后,MedGuard 的规划器会将医学声明转化为结构化检索任务,明确核心医学实体、适应证 / 禁忌证约束,以及对应的疾病或药物知识领域。检索器在由六类权威中文医学资源构建的知识底座中获取相关证据,该知识底座包含 16535 条疾病记录与 187738 条药物记录。 图 3 展示了 MedGuard 的医学知识底座与证据推理过程:系统分别从疾病和药物知识库中提取相关证据,并形成支撑最终风险判断的 Evidence Chain。 总结器进一步抽取与声明直接相关的证据片段,保留剂量、禁忌证、相互作用和定量指标等关键事实。与单次检索后生成不同,MedGuard 会显式判断当前证据是否充分:若证据缺失、相关性不足或无法支撑结论,规划器会分析失败原因,调整检索策略并再次触发检索与总结,直到获得足以支撑判断的证据。 最终,推理器联合医学声明与精炼证据,输出 Risk/No Risk 结论、解释和证据链,形成 声明理解 → 不确定性路由 → 证据规划 → 检索总结 → 充分性判断 → 推理输出 的完整闭环。 不仅发现
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱