首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

预测代理何时应该推理?可靠性路由的行为压力测试

摘要

arXiv:2609.28475v1 Announce Type: new Abstract: Forecasting agents increasingly combine language-model reasoning, retrieval, ensembling, and calibration, but it remains unclear when each behavior shou...

and source behavior should forecasting market prior historical that evidence
2026-09-25 1 阅读 约1分钟阅读 Yufeng Wang
分享:
字号:
arXiv:2609.28475v1 公告类型:新 摘要:预测代理越来越多地结合语言模型推理、检索、集成和校准,但仍不清楚何时应信任每种行为。我们在 ForecastBench 风格的二元预测任务上研究这个问题,将检索、推理、遵循市场先验的选择或使用历史模拟作为可观察的代理行为而不是隐藏的实现细节。我们的中心发现是,机制选择取决于来源:结构化类似物在某些数据生成过程中占主导地位,而市场/人群风格和保守基线对于其他过程来说更好。我们引入了 ReliabilityRoute,这是一种结构性干预措施,可利用历史覆盖范围、市场先验可用性、源先验锐度、证据强度、证据分歧和视野等可靠性特征来引导预测代理的行为。固定的 2024 年拟合规则与没有硬编码源名称决策的手分类法紧密匹配,而前向自我调整规则则重新调整之前解决的年份的阈值,并在 16 个后来的 LLM 年份的确定性系统中获得最佳平均 Brier 分数。收益不大,历史/搜索基线仍然极具竞争力。因此,主要贡献是行为压力测试,表明更多的推理并不总是更好;预测代理应首先估计哪个证据源值得控制,路由策略本身应在可审计的约束下进行调整,并且可重复性工件可在 https://github.com/louiswang524/forcastagent 上找到
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱