智能AI
morning
公平强化学习的推理时间策略调整
2026-08-04
1 阅读
约1分钟阅读
Umer Siddique, Peilang Li, Conor Wallace, Yongcan Cao
字号:
arXiv:2608.00175v1 公告类型:新 摘要:深度强化学习(RL)代理通过优化标量奖励函数实现了强大的性能。然而,一旦部署,这些 RL 代理的策略通常是僵化的,并且适应新的性能标准的成本很高。例如,经过训练以最大化预期累积奖励的代理可能无法适应以前未知的利益相关者的偏好。强化学习中实现公平(一种偏好)的现有方法通常假设此类偏好是先验已知的,并且需要在面向公平的指标下对策略进行完全的重新训练。受大型语言模型中推理时间对齐的启发,我们研究了在推理时将预训练的强化学习策略转向基于福利的公平目标而不更新基本策略参数的问题。我们将推理时间公平性对齐形式化为政策塑造问题,并提出了一个乘法政策塑造框架,该框架使用依赖于行动的福利分数来调整行动概率,因此不需要对基本政策进行修改。我们的框架是通用的,并且与任何深度强化学习代理兼容。通过跨多个领域的广泛实验,我们证明了推理时间策略塑造极大地改善了基于福利的公平目标,同时保持了核心任务性能。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱