秒出提速大清华阿5倍北片视频生成出S里提
关键实验:Oracle 干预
研究者做了一项 Oracle 干预实验:在 97%稀疏率下,秒出用稠密教师的预测替换稀疏学生在不同采样区间的预测。在高稀疏度下激发消费级显卡视频生成的片视频生速度上限,清华大学、成提
解法
从诊断到分阶段治疗
核心洞察:
传统方法的速倍问题: 只监督"当前这一步预测是否准确",却不管后续累积误差会把结果带偏到哪里。当稀疏率从 90%推到 97%时(计算量从 10%降至 3%),清华训练损失持续下降,生成视频却开始破碎、失去时序连贯性。阿里CrossDistill 在噪声轨迹上设置交叉点。提出阿里巴巴、秒出哈尔滨工业大学
核心发现
""——当训练越久,片视频生质量越差
极致稀疏的反常现象
研究团队发现,
CrossDistill:3 步兼顾质量与多样性
SparkDiffusion 的成提少步蒸馏采用团队提出的 CrossDistill:Balancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation。却发现了一个反常现象:训练损失持续下降,速倍
视频链接:https://mp.weixin.qq.com/s/JJ3FYpfzEyCp65hvXg55ig
论文标题: SparkDiffusion: Mitigating the High-Sparsity Trap via Staged Sparse Warm-up,清华 Trajectory-Mixed Distillation, and FP8 Quantization
项目主页: https://sparkdiffusion.github.io/
代码地址: https://github.com/AlibabaResearch/SparkDiffusion
研究机构: 北京大学、
阿里
最终得到一个 3 步、提出它一方面用终端对齐信号跨过高稀疏陷阱,秒出并保留不同随机种子带来的多样性;
低噪声阶段使用 2 个 DMD 分布匹配步骤,让消费级显卡也能高质量生成视频。超长序列场景下的稀疏优化空间更大
AR 扩展、
实验结果
单卡 RTX 5090 实现 265 倍加速
主要性能数据
SparkDiffusion 在以下配置下均保持高质量快速生成:
在 90%稀疏率下: SparkDiffusion 在所有指标上全面超越 FastWan 和 TurboDiffusion
推到 97%稀疏: 质量略有下降但仍接近稠密基线,加速比从 201×提升到 265×
H100 上: 同样配置下加速 220×,绝对延迟降至 8 秒
为什么高分辨率加速更明显?
分辨率越高,稀疏收益越大:
720P 单帧 token 数是 480P 的 2.25 倍
注意力计算量是 O(L²),因此是 5 倍以上
RoLA 稀疏跳过的冗余计算也随之增加
这解释了为什么 720P-14B 的 265×加速比 480P-1.3B 的 140×更高。
发现:
只修正最高噪声的 5 步: 移除大部分终点误差
修正最低噪声的 5 步: 改善很有限
结论: 高噪声阶段的结构误差会被后续步骤放大,最终导致终端质量崩溃。时序混乱。清华大学、
立即体验
SparkDiffusion 已完整开源:
✅ 权重
✅ 稀疏微调+蒸馏训练代码
✅ RTX 5090/H100 推理脚本
✅ 统一加速框架 (稀疏+蒸馏+量化一体化)
✅ 跨模型支持 (Wan2.1/Wan2.2, T2V/I2V, 480P/720P)
论文标题: SparkDiffusion: Mitigating the High-Sparsity Trap — A Unified Framework for up to 265× Single-GPU Acceleration of Visual Generation
论文地址:
项目主页: https://sparkdiffusion.github.io/
GitHub: https://github.com/AlibabaResearch/SparkDiffusion
权重链接: https://huggingface.co/collections/alibabagroup/sparkdiffusion
RoLA 论文:
CrossDistill 论文:
总结与展望
SparkDiffusion 将 DiT 视频生成加速从"分散优化单个组件"推进到"端到端系统化加速":
核心贡献:
首次识别并命名"高稀疏陷阱"— 极致稀疏率下逐步训练失效的现象
诊断根因— 高噪声阶段的结构误差会沿轨迹累积
分阶段解法— 先稀疏预热建立粗略先验,再轨迹混合蒸馏修正终端分布
统一框架— 首个整合稀疏+蒸馏+量化的完整开源系统
实测成果:
RTX 5090 单卡: 265 倍加速(720P-14B, 18 秒生成 5 秒视频)
H100: 220 倍加速(同配置,8 秒生成)
质量保持: VBench-2.0 仅下降 0.5 点(从 60.2→59.77)
研究团队希望这项工作能够为视频生成落地提供新的思路,
再结合 FP8 量化策略以及团队开发的高性能融合算子,当研究者试图通过极致稀疏化(97%稀疏率)来突破性能瓶颈时,阿里巴巴等机构的研究者提出了 视频生成从「分散优化单个组件」转向「端到端系统化加速」的新范式。RoLA 一边通过块稀疏分支保留高能量 query-key 交互,
团队将这种现象命名为"高稀疏陷阱"(High-Sparsity Trap):
在极高稀疏率下,逐步监督架构的稀疏视频 DiT 会陷入一种失效模式——尽管单步验证损失持续优化,但终端生成质量却停滞不前甚至退化,而且延长逐步训练也无法实质性恢复终端质量。跟随教师的粗结构与运动轨迹,全模态生成的后续进展,敬请期待。另一方面通过高低噪声分工平衡生成质量与多样性。扩大补偿分支容量,都无法修复这个问题。北京大学、
SparkDiffusion 的解法: 终端对齐监督(Terminal-Aligned Supervision),在训练时就约束"这一步最终会生成什么",从根源上避免误差累积。将理论计算收益转化为实际延迟缩减。电子科技大学、背景扭曲、一边用带旋转位置信息的低秩线性分支补回被稀疏化舍弃的全局上下文。增强细节与真实感。无 CFG的学生模型。更诡异的是,延长训练、
下一步计划
团队正在将该框架扩展至:
AR 自回归视频生成— 跨帧误差累积正是终端对齐监督的下一个突破口
全模态生成 — 跨模态、PCM 一致性目标和 DMD 分布匹配目标都不是只拟合孤立时刻,增大数据集、生成视频质量却急剧恶化——人物破碎、直接修正终点可见误差,
理论验证:二维序列分布实验
在六种二维序列分布上:
仅逐步训练的 95%稀疏模型: 轨迹末端明显偏离数据分布
加入终端对齐蒸馏后: 少步学生的终点距离重新接近稠密教师
方法设计
+ FP8
分阶段策略:先适应,再修正
基于上述诊断,SparkDiffusion 提出三阶段流程:
RoLA:为极高稀疏率保留全局信息
SparkDiffusion 默认采用团队提出的 RoLA:Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers作为稀疏注意力模块。
随着
更令人困惑的是,
问题出在哪?误差累积在高噪声阶段
等逐步监督方法,只要求模型在某个噪声时刻预测正确的速度,却不直接约束"这一步与后续轨迹组合后,最终会生成什么"。而是利用后续轨迹或最终输出构造监督,扭曲、
针对这一问题,因此都属于终端对齐监督:
高噪声阶段使用 1 个 PCM 一致性步骤,




