智能AI
morning
法学硕士提议,行政人员处置:一种自我验证代理工具,可将长期代理中的承诺漂移与约束漂移分开
摘要
arXiv:2608.04066v1 Announce Type: new Abstract: How do you verify a long-horizon agent when its own state and self-reports are exactly what you cannot trust? We present an agent instrument built so th...
the
agent
when
its
and
every
per
are
instrument
only
2026-08-06
1 阅读
约1分钟阅读
Mohsen Arjmandi
字号:
arXiv:2608.04066v1 公告类型:新 摘要:当长期代理自身的状态和自我报告完全无法信任时,如何验证它?我们提出了一种代理工具,使验证是结构性的而不是事后的。一个确定性的执行者拥有所有的信念;语言模型只能提交键入的建议,并且只有在行动之前预先注册的预测与代码观察相匹配时,声明才会被承认。有两个属性使该仪器成为其自身科学的验证者,而不仅仅是代理的验证者:当每个器官的写入错误、渲染大小或咸金丝雀回声层被破坏时,每次运行都会使自身失效(前八个架构运行中的四个都被无效,每个都定位了一个真正的缺陷);渲染不可见的阴影参考编译整个系统将在每个消融单元中提交的计划,因此即使在测试中的机制已被删除的情况下,也可以定义漂移指标。使用这个工具,我们报告了每个长视野智能体所遭受的失败的干净、单变量结果:消除承诺机制将目标放弃从 0.00 翻转到 1.00,而绑定错误保持在 0.00(每个单元三个种子,每次运行最多 394 个参考节拍,每次运行门控有效)。相比之下,当绑定通道的修复被消除时,它不会以每节拍漂移的形式重新出现——因为绑定是代码拥有的,故障类在结构上被吸收,它唯一的残留物作为假设形成中的崩溃出现在上游的一层。我们在报告时充分披露了任务效能为零(ARC-AGI-3 上 52 次门控运行的零水平完成),并预先注册为结构性击败者。其贡献是代理开发的验证方法及其可测量的漂移分解。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱