← 返回信息流

雷锋网论文

ECCV 2026|4步去噪实现12.66 FPS,清华、港科大提出实时流式视频编辑框架LiveEdit

leiphone.com论文AI评分:70/100

清华大学与香港科技大学提出LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法采用因果、分块的方式处理持续输入的视频,在4步/视频块的推理条件下实现12.66 FPS的流式编辑,同时保持编辑区域准确性和未编辑区域一致性,解决了高质量视频扩散模型依赖双向时空注意力导致的高延迟问题。

全球「AI学术顶会」精华汇聚地
全球「AI学术顶会」精华汇聚地
本文作者: 袁毓婉2026-08-26 17:20专题: ECCV:欧洲计算机视觉会议

原文链接:https://mp.weixin.qq.com/s/HT6AMtSUoKPSpEKI2TLy5Q

文本指令驱动的视频编辑技术正在从离线内容生产走向直播特效、视频会议和增强现实等在线交互场景。

然而,高质量的视频扩散模型的通常依赖于对完整视频进行双向时空注意力处理,即模型需要等待未来帧到齐,再对整段视频进行联合处理。这种范式能够获得较好的编辑结果,却难以满足低延迟、持续输入与即时输出的要求。

近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。

  • 论文标题:LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
  • 论文链接:https://arxiv.org/abs/2606.26740
  • 开源代码:https://github.com/cp-cp/LiveEdit

目前,该工作已被计算机视觉顶级会议 ECCV 2026 接收,其训练、测试代码和模型均已开源。

流式视频编辑与常规视频生成任务存在差异:视频生成可以从高斯噪声中自由地合成新的内容,而编辑任务需要在改变目标区域的同时,尽可能保持原始视频中的人物结构、背景纹理、光照和运动轨迹。

因此,直接复用面向生成的流式框架,往往会带来背景闪烁、结构漂移或编辑范围失控。

  1. 从双向注意力到因果注意力,会发生分布偏移

双向视频扩散模型通常能够同时访问过去帧和未来帧,并利用邻近帧的双向信息维持结构稳定。进入流式场景后,未来帧尚未到来,模型只能查看当前与历史内容。论文观察到,如果直接截断未来帧,原本集中于邻近帧的注意力会被摊薄到更长的历史范围,破坏预训练阶段形成的局部时序先验。最终表现为模型对原始视频结构的「遗忘」,并在长时间编辑中出现闪烁或漂移。

  1. 未编辑区域的重复计算,成为实时推理的主要负担

在多数编辑任务中,真正发生语义变化的区域只占画面的一部分。背景、结构和大量静态纹理在相邻视频块之间高度相似,但标准视频扩散模型仍会让所有空间 Token 反复通过 Self-Attention、Cross-Attention 和 FFN。对这些未编辑区域进行密集重计算,不仅浪费算力,也可能让本应保持不变的内容被模型反复「重画」。

LiveEdit 设计了渐进式的三阶段蒸馏流程。其基础模型建立在 Wan2.1-T2V-1.3B 之上,训练数据由从现有的视频编辑数据集 Ditto-1M 筛选得到的两万组高质量数据对。

第一阶段保留完整的双向 DiT 结构,让模型充分学习从原始视频、编辑指令到编辑结果的复杂映射。为了避免序列长度进一步增长带来的计算开销,在输入端将原始视频潜变量与噪声潜变量沿通道维度注入,而不是在时空序列维度追加 Token。该阶段的目标不是追求流式推理,而是先获得稳定、准确的编辑能力。

第二阶段引入块状因果注意力(chunk-wise causal attention)。每个视频块只能访问当前块和历史块,时间块大小设置为 3 个潜空间帧。通过教师强制(Teacher Forcing),模型在明确的因果约束下学习复现第一阶段的编辑分布,使双向模型的局部结构先验逐步迁移到单向、分块的因果扩散模型中。

完成因果初始化后,LiveEdit 使用分布匹配蒸馏(Distribution Matching Distillation)继续压缩采样过程。不同于依赖高成本 ODE 初始化的常见自回归蒸馏路线,生成器直接由第二阶段的因果扩散模型权重初始化,并通过分布匹配进行训练。最终,推理步数从 100 次降至 4 次,同时移除需要额外前向计算的 Classifier-Free Guidance。

面向自回归的掩码缓存:让未编辑区域不再反复计算

仅减少扩散步数仍不足以实现稳定高效的实时视频编辑。LiveEdit 进一步提出面向自回归的掩码缓存(AR-oriented Mask Cache),比较前一个视频块中原始视频潜变量与编辑结果的差异,按照一定阈值预测当前视频块中可能发生编辑的空间区域掩码。掩码将 Token 划分为活跃编辑区域与未编辑区域:需要被编辑 Token 继续执行完整计算,未编辑 Token 则优先复用先前缓存的中间特征。

这里使用的阈值并非固定设置,而是根据当前 Token 的冗余程度动态调整。在论文采用的推理配置下,70% 的冗余空间 Token 被裁剪。

这一设计利用了视频编辑区域在相邻视频块之间通常不会发生突变的特点。由于当前块的掩码可以由前一块的编辑差异推断得到,模型无需再额外运行计算开销较大的分割模块。

缓存位置同样经过专门设计。消融实验发现,Self-Attention 特征在相邻时刻之间具有较强的重复性,因而更适合进行跨时间复用;相比之下,FFN 保留了更多纹理和局部结构等高频空间信息,直接复用容易造成画面模糊,甚至引起结构不稳定。因此,最终方案将缓存应用在 Self-Attention 层,而不是简单缓存整个 DiT 块。

12.66 FPS:流式速度与编辑质量如何兼顾?

在效率测试中,LiveEdit 处理 81 帧视频的总延迟为 7.89 秒,达到 12.66 FPS;LiveEdit 通过三阶段蒸馏和缓存机制共同将流式视频编辑系统推入实时化的速度区间。

为了评估通用流式编辑能力,研究团队建立了包含 120 组样本的测试集,并从文本对齐度、背景一致性、运动平滑度、动态程度、美学质量和视频质量等六个维度进行比较。

定性结果显示:LiveEdit 能够准确完成局部颜色、材质和属性替换,并减少向非编辑区域漂移的情况。并且,缓存机制在保持背景一致性的同时,没有削弱文本指令对齐和运动连续性。

同时,用户研究邀请 20 名志愿者对各个方法的结果在指令一致性、背景保留和整体质量三方面进行排序:LiveEdit 在三项指标上的 Top-3 偏好率分别达到 100.0%、87.5% 和 95.8%。

LiveEdit 的目标并不只是一个更高的 FPS 数字,而是针对「流式视频编辑」设计实时化路径。这一路线为直播特效、视频会议、实时内容创作与交互提供了更直接的技术基础。

不过,当前方法仍依赖相邻视频块编辑区域较稳定的假设;当目标快速移动、编辑区域剧烈变化或出现大范围全局修改时,掩码估计与缓存复用策略仍有进一步优化空间。

如何在更长视频、更高分辨率和复杂交互指令下保持稳定,也将是后续值得关注的问题。

  • RLinf v0.3来了!从模型生态到真机部署五大能力跃升 ...
  • DeepSeek工资待遇登上热搜,清华姚班晒实习工资日薪 ...
  • 阿里高管集体下田插秧,忙了一上午才种半亩?网友: ...
  • Nature 子刊收录!清华李勇团队用 AI 解码全球气候耦 ...

ECCV:欧洲计算机视觉会议

  • ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像轨迹打通驾驶场景与基模预训练
  • 入选ECCV2026!清华开源空间模型打败Gemini:真正的空间智能是在世界变化中持续学习|ECCV 2026
  • 手机拍10秒房间,秒变可推倒的物理世界!清华中科大ECCV 2026新作爆火,机器人训练直接封神
  • 实探“2026世界机器人大会”:小米新人形机器人亮相,车企跨界入局,从“讲故事”到“做生意”,机器人开始全员“干活”|WRC 2026
  • ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像轨迹打通驾驶场景与基模预训练
  • 手机拍10秒房间,秒变可推倒的物理世界!清华中科大ECCV 2026新作爆火,机器人训练直接封神
  • 机器人大舞台有料你就来!WRC前瞻首发:整机厂秀肌肉,零部件闷声发财|WRC 2026
  • 成都信息工程大学计算机学院符颖教授团队3D视觉重建成果被国际人工智能顶级会议IJCAI2026录用|IJCAI 2026
  • 科研速递|暨南大学广东智慧教育研究院师生论文被人工智能领域重要会议IJCAI 2026录用|IJCAI 2026
  • 大模型之家2026年7月热力榜:WAIC 2026的7月,中国大模型把主场搬到了世界舞台|WAIC 2026
  • 厦门大学数字媒体计算中心多篇论文被国际权威会议录用(含IJCAI-ECAI 2026)|IJCAI 2026
  • IJCAI 2026 专访:动作指挥计算,VLA 加速不降准 | GAIR Paper 125
  • BIMSA 王雅晴:Scaling Law 触及天花板,「数据高效学习」指向 AI 的下一站|IJCAI 2026
  • 突破具身智能物理死角:IJCAI 2026 具身智能泛化与控制突破
  • IJCAI 2026 四项论文奖、三项个人成就奖,回答 AI 的「来路」与「去路」
  • 王田苗三问具身大牛:大模型还在「拨号上网」,机器人靠什么拿下真实订单?| WRC 2026
  • 星动纪元陈建宇:VLA 非终局,具身大脑已进入世界模型时代 | WRC 2026

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文