智能AI
morning
OpenDiscoveryTrace:用于评估 AI 科学家工作流程的流程跟踪
摘要
arXiv:2609.09203v1 Announce Type: new Abstract: Existing benchmarks for autonomous AI scientists evaluate only final outputs---generated code, hypotheses, or papers---yet discard the reasoning process...
and
models
scientific
trajectories
for
reasoning
process
dataset
agent
errors
2026-09-12
1 阅读
约2分钟阅读
Aayam Bansal, Keertan Balaji
字号:
arXiv:2609.09203v1 公告类型:新摘要:自主人工智能科学家的现有基准仅评估最终输出(生成的代码、假设或论文),但放弃获得这些输出的推理过程。这使得审核科学方法、诊断故障模式或区分系统推理和幸运猜测变得不可能。我们提出了 \textbf{OpenDiscoveryTrace},这是一个包含 558 个完整 AI 科学代理轨迹的公共数据集,它捕获模型如何推理,而不仅仅是它们产生的结果。当模型执行涵盖药物发现、材料科学、基因组学和科学文献分析的 124 项科学任务时,每个轨迹都会记录结构化的每步 9 个字段的跟踪,包括思想、工具调用、观察、错误、修订触发器和自我报告的置信度。该数据集涵盖七个模型:三个前沿模型(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro;每个 124 个轨迹,跨领域和难度级别完全平衡)和四个开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B;每个 30 个)以及 60 个模型实时检索变量轨迹。对 363 个 LLM 判断轨迹的试点分析表明,过程轨迹暴露了仅输出评估不可见的行为差异:所有三个前沿模型都达到了相当的成功率 (84--89%),但 Claude Opus 4.6 产生的错误比 GPT-5.4 多 30$\times$(每个轨迹 2.5 vs. 0.08,$p < 0.0001$,Cliff 的 $\delta = 0.613$),错误情况在性质上有所不同——Claude 的工具误用率为 66.7%,而 GPT-5.4 的推理错误率为 83.6%。我们使用逻辑回归、随机森林、LSTM 和 Transformer 模型的基线定义了五个基准任务。数据集、跟踪模式、代理工具和基准定义在 CC BY 4.0 下公开,以支持流程级评估、科学代理审计和人工智能治理的研究。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱