智能AI
morning
前沿大语言模型中符合指南和具体案例肿瘤学决策的集体能力边界
摘要
arXiv:2608.28592v1 Announce Type: new Abstract: Large language models (LLMs) achieve high scores on medical knowledge examinations, yet real-world oncology is not a knowledge test--it is a sequence of...
the
and
models
decision
that
clinical
LLMs
knowledge
not
model
2026-09-02
1 阅读
约2分钟阅读
Zhang Sheng, Jinming Li, Wangyang Chen, Zhiwei Bao, Yu YoSean Wang
字号:
arXiv:2608.28592v1 公告类型:新 摘要:大型语言模型(LLM)在医学知识考试中取得高分,但现实世界的肿瘤学并不是知识测试,而是不确定性下的一系列指南路径选择、升级判断和承诺。现有的基准主要衡量事实回忆,而前沿法学硕士是否存在组合模型无法修复的决策路径盲点仍悬而未决。我们建立了肿瘤学决策边界基准 (ODBB)——跨越 NCCN 指南和结直肠癌病例的 2,005 个肿瘤学决策点——并评估了 2025 年 6 月至 2026 年 4 月期间发布的 9 个前沿法学硕士(4 个闭源、5 个开放权重系列)。完全确定性评分器(零 LLM 推断)将输出分为 14 种失败类型,由两名肿瘤学家独立验证(科恩加权) $\kappa$ = 0.939 和 0.790) 在 225 项分层样本上。将这九个项目视为汇总的超级模型,所有项目中的 42.1%(威尔逊 95% CI 40.0--44.3%)——1,586 个 NCCN 项目中的 35.7% 和 419 个结直肠癌病例中的 66.4%——都没有正确回答,失败集中在在推理之前在指南路径之间进行选择:临床中一致的盲点元判断可能需要架构干预而不是更多的训练数据。两个针对果断性进行调整的模型(GPT-5.5、Gemini 3.1 Pro Preview)做出不安全承诺的频率是七个谨慎模型的三到五倍,但得分却没有更高。在 3--9% 的项目中,模型陈述了正确的下一步临床步骤,但没有承诺执行——决策失败,而不是知识失败。模型质量不再是临床LLM部署的主要瓶颈;约束约束是假设任何单一模型都可以作为临床决策的唯一基础。进步需要架构能够检测模型何时达到其能力边界并将决策发送给临床医生。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱