首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

野外的思维链推理并不总是可靠的

摘要

[Submitted on 11 Mar 2025 ( v1 ), last revised 16 Jun 2026 (this version, v6)] Title: Chain-of-Thought Reasoning In The Wild Is Not Always Faithful View a PDF of the paper titled Chain-of-Thought Reas...

models that 2025 the and Mar this with biases UTC
2026-08-20 1 阅读 约3分钟阅读 florianherrengt
分享:
字号:
[提交于 2025 年 3 月 11 日 ( v1 ),最后修订于 2026 年 6 月 16 日(本版本,v6)] 标题:Chain-of-Thought Reasoning In The Wild Is Not Always Faithful 查看由 Iv\'an Arcuschin 和其他 5 位作者撰写的题为 Chain-of-Thought Reasoning In The Wild Is Not Always Faithful 的论文的 PDF 查看 PDF HTML(实验) 摘要:最近的研究表明,当面对明确的由于提示中存在偏见,模型经常在思维链 (CoT) 输出中忽略提及这些偏见,这表明语言推理可能会错误地描述模型如何得出结论(不忠实)。在这项工作中,我们表明,不忠实的 CoT 也会发生在自然措辞、非对抗性的提示上,而无需添加人为偏差或编辑模型输出。我们发现,当单独提出问题“X 比 Y 大吗?”时和“Y 比 X 大吗?”,模型有时会产生表面上连贯的论据,以证明系统地回答“是”或“否”,尽管存在矛盾。我们提供了初步证据,表明这是由于模型对“是”或“否”的隐含偏见,将这种隐含的事后合理化标记为隐含的事后合理化。我们的结果显示,生产模型的比率高达 13%,虽然前沿模型更忠实,但没有一个模型完全如此,包括像 DeepSeek R1 (0.37%) 和 Sonnet 3.7 with Thinking (0.04%) 这样的思考模型。我们还研究了不忠实的不合逻辑的捷径,其中模型使用微妙的不合逻辑的推理来使数学难题的推测答案看起来得到了严格的证明。我们的研究结果表明,虽然 CoT 对于评估输出很有用,但它并不能完整地说明产生模型答案的内部过程,因此在代理或安全关键环境中应谨慎使用。提交历史记录 来自:Iván Arcuschin [ 查看电子邮件 ] [v1] 2025 年 3 月 11 日星期二 17:56:30 UTC (4,311 KB) [v2] 2025 年 3 月 13 日星期四 17:49:58 UTC (4,348 KB) [v3] 2025 年 3 月 19 日星期三 19:20:42 UTC (4,349 KB) [v4] 2025 年 6 月 17 日星期二 17:59:57 UTC (2,337 KB) [v5] 2026 年 5 月 29 日星期五 17:38:22 UTC (2,378 KB) [v6] 2026 年 6 月 16 日星期二 17:36:22 UTC (2,378 KB)
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱