智能AI
morning
期权什么时候有用? Option-Critic 中的策略坏死和冗余覆盖
摘要
arXiv:2609.05508v1 Announce Type: new Abstract: Option-critic learns options: sub-policies together with a learned rule for when each one hands control back. Its headline result is that performance im...
the
that
and
option
options
rule
test
policy
critic
termination
2026-09-09
1 阅读
约1分钟阅读
Bingyun Liu, Yuheng Jing
字号:
arXiv:2609.05508v1 公告类型:新摘要:选项批评家学习选项:子策略以及每个人何时交回控制权的学习规则。其总体结果是,随着选项的添加,性能得到提高。我们用理论和实验来解释这个结果。首先,终止规则选项批评家通过最大化回报来学习没有任何贡献。当终止测试和选择选项的策略读取相同的值时,测试会在每一步都会触发,因此学习到的规则与始终终止相同。当该策略进行探索而测试没有进行探索时,就像选项批评本身一样,该规则可以阻止探索;在某些情况下,它会遭受 $\Omega(T)$ 的遗憾,同时总是终止对 $O(\log T)$ 的持有。在每一步强制终止都会使选项计数曲线保持完整。其次,选项内的策略几乎不进行探索,因此状态会锁定看起来不错的第一个操作,并且不再更新。我们将这种政策命名为“坏死”,并对其进行了州级测试,发现在典型选项中五分之三的州都已“坏死”。恢复探索可以修复这些状态,然后一个选项可以解决任务。第三,额外的选项改善没有选项;下降的是所有这些都在同一状态下失败的可能性,从 $59\\%$ 到 $4\\%$,并且性能遵循该联合数量。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱