首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

期权什么时候有用? Option-Critic 中的策略坏死和冗余覆盖

摘要

arXiv:2609.05508v1 Announce Type: new Abstract: Option-critic learns options: sub-policies together with a learned rule for when each one hands control back. Its headline result is that performance im...

the that and option options rule test policy critic termination
2026-09-09 1 阅读 约1分钟阅读 Bingyun Liu, Yuheng Jing
分享:
字号:
arXiv:2609.05508v1 公告类型:新摘要:选项批评家学习选项:子策略以及每个人何时交回控制权的学习规则。其总体结果是,随着选项的添加,性能得到提高。我们用理论和实验来解释这个结果。首先,终止规则选项批评家通过最大化回报来学习没有任何贡献。当终止测试和选择选项的策略读取相同的值时,测试会在每一步都会触发,因此学习到的规则与始终终止相同。当该策略进行探索而测试没有进行探索时,就像选项批评本身一样,该规则可以阻止探索;在某些情况下,它会遭受 $\Omega(T)$ 的遗憾,同时总是终止对 $O(\log T)$ 的持有。在每一步强制终止都会使选项计数曲线保持完整。其次,选项内的策略几乎不进行探索,因此状态会锁定看起来不错的第一个操作,并且不再更新。我们将这种政策命名为“坏死”,并对其进行了州级测试,发现在典型选项中五分之三的州都已“坏死”。恢复探索可以修复这些状态,然后一个选项可以解决任务。第三,额外的选项改善没有选项;下降的是所有这些都在同一状态下失败的可能性,从 $59\\%$ 到 $4\\%$,并且性能遵循该联合数量。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱