智能AI
morning
从因果合理性到因果可靠性:将法学硕士作为校准的直接因果边缘分类器进行评估
摘要
arXiv:2608.23660v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly used to provide prior causal knowledge for structural causal discovery, yet whether their direct-edge judg...
and
causal
are
confidence
models
graphs
cross
agreement
model
edges
2026-08-26
1 阅读
约2分钟阅读
Amit Kumar, Elnur Adl Zarabi, Suranjana Trivedy, Zhiqian Chen, Lei Zhang, Kaiqun Fu, Taoran Ji
字号:
arXiv:2608.23660v1 公告类型:新 摘要:大型语言模型(LLM)越来越多地用于为结构因果发现提供先验因果知识,但其直接边缘判断和置信度是否可信仍不清楚。我们系统地评估了 12 个指令调整的开放权重模型,涉及六个基准因果图、五种提示策略和四种置信源:语言化、基于逻辑、交叉提示一致性和跨模型一致性。根据我们的仅语言成对协议,我们的评估得出了三个关键发现。 (i) 基于 LLM 的因果判断是召回主导的:模型预测具有许多假阳性边缘的过于密集的图,而提示主要改变精确率与召回率的权衡,而不是解决过度预测。模型规模的收益在最大的图表上会减少,并且不会消除错误校准。 (ii) 法学硕士经常捕捉因果关系,但无法可靠地识别直接性或方向。相对于已发布的参考图,模型将 40.0% 的间接非边缘和 36.0% 的反向非边缘错误分类为直接边缘,而将其他非边缘错误分类为 28.2%。此外,这些误报中 80.8% 和 84.6% 的口头置信度至少为 80%,这揭示了对结构性错误预测的严重过度自信。 (iii) 传统的置信度估计不可靠,而一致性则提供了更有希望的信号。无论正确性如何,基于 Logit 的置信度经常崩溃在 1.0 附近,而交叉提示和跨模型一致性实现了更好的均值校准和区分,尽管它们的优势在 Holm 校正后并不具有统计显着性。基准熟悉度审计进一步确定了五个模型数据集对的潜在熟悉度,所有这些都涉及 AsiaM。总体而言,我们的结果表明,法学硕士更适合被视为外部验证的软因果先验的来源,而不是因果结构的直接证据。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱