智能AI
morning
边际覆盖信用减少了并行状态熵优化中的冗余探索
摘要
arXiv:2608.27507v1 Announce Type: new Abstract: Policy Gradient for Parallel State Entropy maximization (PGPSE) expands state-space coverage by training independently parameterized policies in replica...
PGPSE
and
state
coverage
the
MCC
policies
non
policy
credit
2026-08-31
1 阅读
约1分钟阅读
Junhao Cao, Hongyi Xia, Jianian Wu, Xiaopeng Yi, Lixia Huang, Ping Guo
字号:
arXiv:2608.27507v1 公告类型:新摘要:并行状态熵最大化的策略梯度(PGPSE)通过在同一环境的复制副本中训练独立参数化策略来扩展状态空间覆盖范围。然而,其汇总的团队熵得分仅衡量集体探索,无法识别有助于非冗余覆盖的政策。我们引入了 PGPSE 边际信用覆盖率 (MCC-PGPSE),它将留一保单覆盖率与国有专业化相结合,以估计政策特定信用。 MCC-PGPSE 保留了 PGPSE 的汇总目标,并根据这些积分重新分配非负辅助内在奖励,而不改变其总质量。这种重新分配旨在阻止重复访问并促进补充覆盖。我们在受控环境、七个公共离散状态基准以及原始 PGPSE 协议中的代表性房间和迷宫设置中评估了 MCC-PGPSE。在所有测试设置中,MCC-PGPSE 在标准化团队状态熵和熵基线上的状态支持方面产生了正的最终窗口增益。受控任务比较和固定套件公共总量很重要,而五种子原始协议比较在方向上是一致的。消融和信贷调整控制表明,大多数收益来自于留一政策的覆盖范围,而不是仅仅来自不均匀的权重、不匹配的信贷或神经新颖性。这些结果支持以贡献为条件的辅助奖励分配作为一种可解释的方法,以提高离散状态空间中并行政策之间的互补覆盖范围。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱