智能AI
morning
通过批量投机雅可比推出加速视觉上的策略蒸馏
摘要
arXiv:2608.18183v1 Announce Type: new Abstract: Visual on-policy distillation (OPD) improves the training of compact visual autoregressive models by learning from trajectories generated by the current...
the
SJD
rollout
and
training
student
policy
distillation
OPD
visual
2026-08-21
1 阅读
约1分钟阅读
Bingqi Shan, Zhehao Yu, Kenhong Lin, Baoquan Zhang
字号:
arXiv:2608.18183v1 公告类型:新 摘要:视觉同策略蒸馏(OPD)通过学习当前学生生成的轨迹来改进紧凑视觉自回归模型的训练。然而,这些在线部署仍然是通过自回归解码逐个令牌生成的,这给每个策略训练步骤增加了大量成本。推测性雅可比解码(SJD)提供了一种替代方案,因为它可以并行处理多个标记,而无需辅助草案模型,但原始方法是为单序列推理而设计的。我们引入 HB-SJD,这是一个用于视觉 OPD 的批量 SJD 推出后端。 HB-SJD允许每个图像根据自己的解码进度独立前进,而不同序列位置的图像仍然在批量模型前向中进行验证。镜像完成后,HB-SJD 在完整执行和紧凑执行之间切换,以降低后续部署的成本。 HB-SJD 仅替换了学生推出后端,而教师、蒸馏目标和优化程序保持不变。 LlamaGen 的实验表明,HB-SJD 大大减少了部署和端到端训练时间,同时保持了蒸馏学生的生成质量。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱