首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

600倍加速,720p视频实时生成!单卡也能带的动14B模型

摘要

新智元报道 生成一段5秒720p分辨率视频,为什么要等数十分钟? 对14B级视频生成模型来说,高分辨率、长时序和强运动一致性提升了画质,也同步拉长Token序列,放大注意力计算和显存峰值。消费级GPU必须同时面对速度与显存两道门槛。 LightX2V 团队面向 Wan2.2-A14B 推出 LightWan2.2-A14B ,以步数蒸馏、NVFP4量化感知训练和动态稀疏注意力压缩计算量,再用高效算...

A14B LightX2V Wan2 T2V I2V https LightWan2 787 480p 2668
2026-08-07 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 生成一段5秒720p分辨率视频,为什么要等数十分钟? 对14B级视频生成模型来说,高分辨率、长时序和强运动一致性提升了画质,也同步拉长Token序列,放大注意力计算和显存峰值。消费级GPU必须同时面对速度与显存两道门槛。 LightX2V 团队面向 Wan2.2-A14B 推出 LightWan2.2-A14B ,以步数蒸馏、NVFP4量化感知训练和动态稀疏注意力压缩计算量,再用高效算子、细粒度卸载和多卡通信优化打通整条推理链路。 最终,14B模型可以在单张RTX 5090上高效运行。 8卡生成5秒720p视频时, T2V(文生视频)仅需3.8秒、I2V(图生视频)仅需4.5秒 。相较原始40步模型,最高加速分别达到705.8倍和599.3倍。 5秒视频,最快3.8秒生成。T2V与I2V双双实现720p实时生成。 787 秒 →2.4 秒 I2V 8 卡 480p 2668 秒 →3.8 秒 T2V 8 卡 720p 705.8× 8 卡最高加速 787 秒 →10.7 秒 I2V 单卡 480p 2668 秒 →22.5 秒 T2V 单卡 720p 118.7× 单卡最高加速 项目地址: https://github.com/ModelTC/LightX2V 模型地址: https://huggingface.co/lightx2v/LightWan2.2-A14B 博客地址: https://light-ai.top/LightX2V-BLOG/posts/LightWan22-A14B/ 14B视频生成的两道硬门槛 速度与显存 随着视频生成模型的能力不断增强,画面质量、运动一致性和分辨率持续提升,用户的等待时间也越来越长。以14B级视频DiT为例,生成一段5秒720p视频可能需要数十分钟。对普通用户来说,这类模型也很难直接在消费级显卡上运行。问题集中在两点:一是生成慢,二是显存装不下。 1. 为什么生成慢? 去噪步数多。 Wan2.2通常需要40步去噪,相当于为一条视频重复执行40次完整DiT前向,等待时间也随之累积。 单步计算重。 每一步都要执行大规模矩阵乘法。随着分辨率和帧数增加,视频Token序列迅速变长,而自注意力开销随序列长度平方增长。序列长度约120K时,自注意力可占Wan2.2-A14B单次DiT延迟的80%以上。 2. 为什么跑不 了? 显存峰值高。 14B模型权重、长视频Token、注意力缓冲区和中间激活同时占用显存,峰值容易超过约30GB消费级GPU的容量,程序会直接出现OOM。 从40步到4步 最直接的提速方式,是减少必须执行的去噪步数。LightX2V采用 Phased DMD ,将完整信噪比区间拆分为多个阶段,让不同专家学习不同噪声区间内的去噪行为。 训练时,每个阶段只为一个采样步保留梯度,既避免完整多步反向带来的巨大显存开销,也缓解激进一阶蒸馏容易出现的多样性下降和运动弱化。 此外,LightX2V还引入了 SGMD 来加快训练速度,SGMD直接推动fake score向teacher score对齐,并用teacher stop-gradient Fisher构建稳定的分布匹配目标。随后通过NR/RC双势能分别进行外循环修正和内循环跟踪,让fake score跟上持续更新的生成器。 40步压到4步,意味着最重的DiT骨干少跑36次。 Wan2.2最终形成“两步高噪声专家 + 两步低噪声专家”的4步推理流程。分阶段训练同时保留视频生成所需的运动动态、视觉细节与输出多样性。 Phased DMD与直接多步蒸馏、随机梯度截断方案对比 单卡路径:把14B模型装进一张RTX 5090 4步只是第一步。 要让14B模型真正跑在单卡上,LightX2V还要继续压缩每一步的计算量、访存流量和显存峰值。 NVFP4量化感知训练。 NVFP4采用E2M1 4比特数值,并以每16个连续元素共享FP8 E4M3块级缩放、全张量再配合FP32全局缩放,在接近FP4的存储与带宽成本下保留更强动态范围。LightX2V将量化感知训练直接融入步数蒸馏,让学生模型在训练阶段就适应4比特误差,再通过CUTLASS内核映射到Blackwell Tensor Core执行,降低线性层的显存流量与GEMM延迟。 动态稀疏量化注意力。 LightX2V先用Query/Key块级均值快速估计注意力重要性,再在运行时选择关键块,仅计算被激活的注意力Tile。 典型稀疏率达到80%—90%,即只保留最重要的10%—20%块。被选中的块内部仍保持稠密计算,兼顾稀疏收益与GPU吞吐。稀疏注意力算子进一步接入SageAttention2,形成更快的FP8稀疏注意力路径。 高效推理算子。 一方面,LightX2V面向 Blackwell 架构协同优化视频DiT的两大计算热点:在线性层、MLP和MoE中,采用权重与激活双NVFP4的Block-Scaled Tensor Core GEMM,以FP32累加和BF16输出兼顾吞吐与数值稳定性,并在 CUTLASS Epilogue 中融合列偏置,显著降低显存占用和带宽开销,同时减少额外 Kernel 启动。 在长序列自注意力中,Dynamic Sparse SageAttention 根据当前 Q/K 动态评估块级相关性,仅保留约 10% 的关键注意力块,并结合Q/K INT8、V FP8低精度计算,从而同时削减密集矩阵乘和注意力计算开销,实现视频生成端到端加速。 另一方面,将3D RoPE、RMSNorm等操作替换为高效并行或融合内核,减少Python调度、临时张量和内存往返,让“主干变快之后的外围开销”不再拖慢整条链路。 异步折叠Offload。 除模型级卸载外,LightX2V进一步提供Block级卸载,按Transformer块细粒度搬运权重,并通过计算与权重搬运的异步折叠(overlap),将数据传输开销隐藏在计算过程中,以更低的峰值显存承载14B模型和长视频序列。 单卡结果:T2V 720p由2668.0秒降至22.5秒,提速118.7倍。I2V 720p由2685.0秒降至26.7秒,提速100.5倍。 相同单卡条件下,I2V 480p与720p分别约为TurboWan2.2的3.5倍和2.4倍速度。14B视频生成由此进入消费级GPU的单卡可运行范围。 多卡路径:让720p端到端实时生成 实时生成的标准很简单:生成一段5秒视频,端到端时间必须短于5秒。 LightX2V在单卡优化栈之上采用Ulysses风格序列并行,并围绕All-to-All通信、QKV布局和Head级流水继续做系统级优化,让T2V和I2V共同跨过这条线。 Light-Ulysses:面向视频生成的高效并行方案。 基础Ulysses先把长视频Token序列切分到8张GPU,再通过All-to-All在序列维和Head维之间完成数据重排,让每张卡只计算部分注意力。 LightX2V围绕这条主链路做了四层优化:通信数据直接采用FP8,同时压缩QKV交换和注意力输出回传的数据量。QKV张量融合将Q、K、V打包成一个All-to-All载荷,减少Collective调用和重复布局
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱