首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

从因果合理性到因果可靠性:将法学硕士作为校准的直接因果边缘分类器进行评估

摘要

arXiv:2608.23660v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly used to provide prior causal knowledge for structural causal discovery, yet whether their direct-edge judg...

and causal are confidence models graphs cross agreement model edges
2026-08-26 1 阅读 约2分钟阅读 Amit Kumar, Elnur Adl Zarabi, Suranjana Trivedy, Zhiqian Chen, Lei Zhang, Kaiqun Fu, Taoran Ji
分享:
字号:
arXiv:2608.23660v1 公告类型:新 摘要:大型语言模型(LLM)越来越多地用于为结构因果发现提供先验因果知识,但其直接边缘判断和置信度是否可信仍不清楚。我们系统地评估了 12 个指令调整的开放权重模型,涉及六个基准因果图、五种提示策略和四种置信源:语言化、基于逻辑、交叉提示一致性和跨模型一致性。根据我们的仅语言成对协议,我们的评估得出了三个关键发现。 (i) 基于 LLM 的因果判断是召回主导的:模型预测具有许多假阳性边缘的过于密集的图,而提示主要改变精确率与召回率的权衡,而不是解决过度预测。模型规模的收益在最大的图表上会减少,并且不会消除错误校准。 (ii) 法学硕士经常捕捉因果关系,但无法可靠地识别直接性或方向。相对于已发布的参考图,模型将 40.0% 的间接非边缘和 36.0% 的反向非边缘错误分类为直接边缘,而将其他非边缘错误分类为 28.2%。此外,这些误报中 80.8% 和 84.6% 的口头置信度至少为 80%,这揭示了对结构性错误预测的严重过度自信。 (iii) 传统的置信度估计不可靠,而一致性则提供了更有希望的信号。无论正确性如何,基于 Logit 的置信度经常崩溃在 1.0 附近,而交叉提示和跨模型一致性实现了更好的均值校准和区分,尽管它们的优势在 Holm 校正后并不具有统计显着性。基准熟悉度审计进一步确定了五个模型数据集对的潜在熟悉度,所有这些都涉及 AsiaM。总体而言,我们的结果表明,法学硕士更适合被视为外部验证的软因果先验的来源,而不是因果结构的直接证据。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱