智能AI
morning
LoRA 通过 SAS Vision Transformer 增强对比学习
2026-09-21
1 阅读
约2分钟阅读
Dan Zimmerman, Frank E. Bobe III, Amelia L. McCormack, Matthew Cook, Gregory D. Vetaw
字号:
arXiv:2609.21061v1 公告类型:新 摘要:采用合成孔径声纳 (SAS) 的自动目标识别 (ATR) 支持先进的海军能力,但深度学习受到目标图像稀缺、背景杂波和人机参与评估的限制。我们使用三阶段参数高效框架将 DINOv3 Vision Transformer (ViT) 模型适应水下 SAS ATR。第一阶段使用低秩适应(LoRA),同时冻结 ViT 主干,弥合自然图像预训练和水声传播之间的差距。第二阶段使用硬负挖掘来加强针对声学模拟的决策边界,包括类似于人造目标的岩石和沉积物地层。第 3 阶段使用监督对比学习 (SupCon) 来分离目标和杂波表示。我们使用任务级地理划分来评估海上 SAS 数据,以 85% 的测试召回率比较所有臂,并在三个随机种子上重复每次比较。 LoRA 发挥了主要作用,使用相同的冻结骨干网将精确召回曲线下面积 (AUPRC) 从 0.300 增加到 0.679 +/- 0.027。 Rank 4 仅训练 0.26% 的权重即可实现这一结果。两个细化阶段都超出了其匹配控制:与同等大小的随机课程相比,硬负挖掘将 AUPRC 改变了 -0.0045 +/- 0.0119,而 SupCon 与前一阶段相比将 AUPRC 改变了 +0.0002 +/- 0.0096。这些空结果表明挖掘发生在编码器已经适合的数据上,并且监督阶段已经施加了大多数目标杂波几何形状。一个有效的适应阶段就足够了;堆叠细化则不然。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱