智能AI
morning
CODS:用于可重用离线强化学习的迭代贝尔曼残差数据选择
2026-08-11
1 阅读
约1分钟阅读
Ibne Farabi Shihab, Sanjeda Akter, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb, Anuj Sharma
字号:
arXiv:2608.07719v1 公告类型:新摘要:离线强化学习反复训练来自固定转换池的策略,使得种子和超参数之间的冗余数据成本高昂,而朴素子采样可以消除长期信用分配所需的罕见转换。我们引入了 CODS,一种批评家引导的选择器,它在拟合算法匹配的批评家和冻结可重用子集之前获取高残差转换之间交替。与优先重放不同,CODS 会产生静态工件;与一次性残差选择不同,它会随着批评者的变化而刷新分数。在 10% 的预算下,CODS 在 20 个有效的 D4RL 任务算法单元中保留了 96.6% 的合格池性能。它超过了 19/20 细胞上的 ReDOR 和 OPER,以及 20/20 上的所有其他子集基线;在带有 Holm 校正的预先声明的分层推理下,所有六个子集的优势仍然很重要。保持总选择器更新固定,五轮采集将四个代表性单元在一轮中提高 11.23 点,然后饱和。等通过和等小时评估阐明了重用(而不是单次运行加速)创造了计算优势。机制和腐败干预暴露了有用的稀疏奖励丰富性和对异常值的敏感性。最后,全跟踪扩展保留了 95.4% 的 ALFWorld 成功率和 96.5% 的 GSM8K 精确匹配率。因此,CODS 是一个可重用的选择过程,而不是一个正式的核心集保证。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱