首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

具有时态逻辑规范的高效贝叶斯自适应强化学习

摘要

arXiv:2609.20954v1 Announce Type: new Abstract: We present a novel end-to-end model-based Reinforcement Learning (RL) algorithm for efficient policy synthesis under given Linear Temporal Logic (LTL) s...

the for task novel algorithm LTL Bayes BAMCP end model
2026-09-21 1 阅读 约1分钟阅读 Jonathan Hau, Alessandro Abate
分享:
字号:
arXiv:2609.20954v1 公告类型:新 摘要:我们提出了一种新颖的基于端到端模型的强化学习(RL)算法,用于在未知环境中给定线性时序逻辑(LTL)规范(例如安全性或可达性)下进行有效的策略合成。为此,LTL 任务的极限确定性 B{\"u}chi 自动机 (LDBA) 表示与环境的贝叶斯自适应马尔可夫决策过程 (BAMDP) 表示同步,这使我们能够利用通过贝叶斯强化学习实现的增强探索-利用权衡,而不是传统的非贝叶斯方法。我们进一步提出了一种新颖的贝叶斯自适应蒙特卡罗规划 (BAMCP) 算法,以允许近似与传统的无模型方法相比,同步 BAMDP 构造中的贝叶斯最优策略综合证明了我们的方法在属性满意度和样本效率方面的有效性。最后,我们还展示了我们的方法在 \textit{cautious} RL 中的成功应用,即减少了策略期间发生的任务违规数量。培训。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱