智能AI
morning
几何形状并不稳健:PGD 评估的轨迹级研究
摘要
arXiv:2608.14594v1 Announce Type: new Abstract: Projected Gradient Descent (PGD) is widely used to evaluate adversarial robustness, typically via final adversarial accuracy, which does not capture mod...
robustness
and
adversarial
trajectory
across
PGD
level
diagnostics
for
trained
2026-08-18
1 阅读
约1分钟阅读
Dhairysheel Durgule
字号:
arXiv:2608.14594v1 公告类型:新 摘要:投影梯度下降(PGD)广泛用于评估对抗鲁棒性,通常通过最终对抗精度来评估,该精度不会捕获整个攻击过程中的模型行为。最近的工作提出了轨迹级诊断,例如损失演化、梯度对齐和失败步骤,以更深入地了解对抗性优化动态。然而,这些诊断是否可靠地表明稳健性强度仍不清楚。我们对在 Fashion-MNIST 上训练的卷积神经网络进行 PGD 攻击的轨迹级调查。我们使用严格的 20 步 PGD 评估,随机初始化和多次重启来进行稳健性测量,并使用单次初始化轨迹记录来进行诊断,从而比较了多个鲁棒性方案中的干净训练模型和对抗训练模型。我们记录每个模型 3000 个干净正确样本的完整 PGD 轨迹,并分析攻击迭代中的损失演化、梯度对齐和故障时间。我们的结果揭示了跨模型的清晰的稳健性层次结构;然而,轨迹指标对其识别的贡献并不相同。在经过对抗训练的模型中,平均损失轨迹和梯度对齐模式在数量上看起来相似,但鲁棒精度却大不相同。相比之下,失败步骤分布提供了鲁棒性机制的更清晰的分离,直接反映了对对抗性扰动的功能抵抗力。这些发现表明,轨迹级诊断描述了优化几何,但不能独立测量对抗鲁棒性。它们的可解释性取决于鲁棒性机制、攻击强度和多指标评估。轨迹级分析应该是一种补充诊断工具,在上下文中进行解释,而不是替代标准稳健性测量。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱