智能AI
morning
正则化强调时间差分学习:恒定步长下的稳定性
摘要
arXiv:2609.19170v1 Announce Type: new Abstract: Emphatic temporal-difference learning (ETD) stabilizes the expected off-policy TD update and changes its projection geometry, but neither property deter...
the
and
ETD
RETD
two
state
trace
point
changes
constant
2026-09-18
1 阅读
约1分钟阅读
Xingguo Chen, Zhaohui Wu, Jinguo Ye, Chao Li, Shangdong Yang, Guang Yang, Skylar Liang, Wenhao Wang
字号:
arXiv:2609.19170v1 公告类型:新 摘要:强调时间差分学习 (ETD) 稳定预期的离策略 TD 更新并改变其投影几何形状,但这两个属性都无法确定恒定步长采样动态。我们构建了一个遍历二态反例,其中 ETD 均值图收缩,而采样产品具有正的顶李雅普诺夫指数。再生循环分析将该符号与后续迹线的无限方差分开。我们引入正则化强调 TD (RETD),这是一种归一化一阶冲击后修复,保持迹线和重要性比率不变,将强调 TD 信号存储在泄漏标量状态,并释放延迟校正。 RETD 的原始平衡是 ETD 平衡的仿射平移;单正则化和双正则化读数可准确恢复 ETD 固定点。我们证明了谐波递减步长的几乎肯定的收敛性以及来自马尔可夫随机乘积界的条件恒定步长矩收缩结果。 RETD 已经证明了两国结构和一个贝尔德点的负指数,而正贝尔德 ETD 符号仍然是数字。配对 10,000 次运行实验验证了分离、定点恢复、非单调稳定性区域和任务依赖性。 RETD 改变了震后动态;它不会减少共享的跟踪方差。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱