首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

大型语言模型显示医学推理中的元认知敏感性

摘要

arXiv:2608.14552v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly evaluated and used in medicine, but clinical usefulness depends on answer accuracy and whether confidence ...

and confidence evidence was accuracy trials than benchmark diagnostic sensitivity
2026-08-18 1 阅读 约1分钟阅读 Ahmad Nazzal
分享:
字号:
arXiv:2608.14552v1 公告类型:新 摘要:大型语言模型 (LLM) 越来越多地在医学中得到评估和使用,但临床实用性取决于答案准确性以及置信度是否跟踪证据质量和不确定性。我们开发了一个受控的、受心理物理学启发的临床基准来测试医学法学硕士的诊断选择和信心行为。该基准重点关注可能的阿尔茨海默型神经认知障碍(AT-NCD)与抑郁相关认知障碍(DRCI)。我们生成了 45 个合成片段,其证据强度不同、证据相互矛盾以及信息缺失。每个小插图都在三种提示变体下呈现,产生 135 次试验。在 gpt-4.1-nano 的试运行中,所有试验都产生了有效的结构化输出。在强制选择试验中,诊断准确率为 93.5%,平均置信度为 78.4%,AUROC2 为 0.876。置信度随着证据与诊断边界的距离增加而增加,当信息缺失时置信度降低,并且在调整证据强度和提示格式后,正确的试验仍然高于不正确的试验。这些发现表明部分元认知敏感性,而不是整体无信息的信心。然而,错误集中在中等、相互冲突的 AT-NCD 案例中,其中模型转向 DRCI,并保留了比经验准确性合理的更多的信心。模型比较表明,置信质量应直接测量,而不是仅根据基准准确性或模型能力推断。本研究建立了一个可重复的框架,用于评估医学法学硕士的证据敏感性、元认知敏感性和局部校准失败。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱