首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

管理神经符号强化学习中的动作先决条件:实体代理的三种放置策略

摘要

arXiv:2609.16056v1 Announce Type: new Abstract: Humans carry behaviour knowledge of how to act in familiar situations into every new task rather than relearning it from scratch. There is no reason a R...

the and knowledge symbolic emph structural actions into The which
2026-09-16 1 阅读 约2分钟阅读 Norbert Oswald, Fabian Deuser, Thomas Br\"aunl
分享:
字号:
arXiv:2609.16056v1 公告类型:新 摘要:人类将如何在熟悉的情况下行动的行为知识带入每一个新任务中,而不是从头开始重新学习。强化学习 (RL) 代理没有理由不这样做:不需要学习已知的行为模式,只需应用即可。神经符号强化学习通过将符号知识与学习策略一起注入,将先验知识和强化学习联系起来。整合这些知识的点至关重要:例如,糟糕的选择可能会产生幻觉的先决条件,这些先决条件表现为在不断变化的环境中行动的智能体的安全性和可靠性问题。我们将这种行为知识形式化为代理的\emph{结构动作}的前提条件贝叶斯网络(BN)——其合法性取决于先决条件的动作,例如拿起钥匙、抓住方块、打开门或掉落物体。 BN 限制了这些动作何时可以触发,我们将其注入到 RL 循环的三个位置:(1)一个 \emph{符号验证器},仅在推理时参考,一旦其前提条件成立,就会触发结构动作; (2)一个 \emph{符号执行器},在训练和推理过程中都很活跃,控制整个学习过程中结构动作的使用; (3)一个\emph{符号学习器},它将知识折叠到网络中并学习结构动作本身的限制和使用。为了测试这三种变体,我们在两个具有相反机制的基准上进行了实验:一个建立在长而有序的计划链上,另一个建立在连续操作上。我们与解决方案质量、样品效率和可追溯性方面的强大基线进行比较。回报是巨大的。在 MiniGrid 上,所有三个布局都比 PPO+RND 基线提高了 \emph{解决方案质量},符号执行器以 $98.2\%$ 领先,而基线为 $88.8\%$。获取时,$\dots$
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱