首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

基于多AUV自组织网络的目标跟踪:一种价值梯度引导多智能体扩散强化学习方法

摘要

arXiv:2608.12436v1 Announce Type: new Abstract: Multi-AUV ad-hoc network-based target tracking requires networked autonomous underwater vehicles (AUVs) to cooperatively track maneuvering targets under...

and training tracking value layer the underwater multi action VGG
2026-08-14 1 阅读 约1分钟阅读 Jiaao Ma, Chuan Lin, Guangjie Han, Shengchao Zhu, Qian Zhu, Ying Liu, Zhenyu Wang
分享:
字号:
arXiv:2608.12436v1 公告类型:新 摘要:基于多 AUV 自组织网络的目标跟踪需要网络化自主水下航行器 (AUV) 在受约束的声学通信、动态拓扑和不确定的海洋扰动下协同跟踪机动目标。尽管多智能体强化学习(MARL)通过集中训练实现去中心化协调,但现有方法存在高维联合状态动作建模、噪声敏感策略生成等问题,导致训练不稳定和跟踪性能下降。为了解决这些问题,我们提出了 VGG-MADiffRL(一种值梯度引导的多智能体扩散 RL 算法)和 MDCA(一种基于扩散的分层控制架构)。利用水下任务特征,我们对声纳检测机制和洋流扰动进行建模,将多 AUV 自组织网络的协作跟踪制定为 MDP。所提出的MDCA构成了一个三层闭环控制框架:全局智能控制层、本地在线训练层和物理动作执行层。这种结构可以实现任务分配、本地决策过程和执行反馈之间的协同优化。 MDCA内部,本地在线培训层是政策学习框架; VGG-MADiffRL建立在扩散策略的基础上,并结合价值梯度来指导反向去噪过程中的动作生成,引导生成的动作朝向更高的预期回报。它采用具有联合优化和软目标更新的双值网络来减轻高估和训练振荡,促进更稳定的收敛。实验结果表明,VGG-MADiffRL在协作跟踪场景中始终能够实现更快的收敛、更高的跟踪精度和更平滑的训练动态,验证了其在动态水下环境中的有效性和实际工程价值。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱