2026年8月21日,arXiv 上发布了一篇论文
InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter。作者摒弃了“待编辑视频已作为完整片段存在”这一常见假设,转而将视频视为开放流:编辑操作应用于未来帧,随着它们不断生成而生效。为此,他们构建了一个独立数据集,并提出了一种轻量级适配器,由三个 attention 模块组成——history cross-attention 用于参考先前帧,temporal causal self-attention 用于仅将信号从早期帧传递到后期帧,以及 edit cross-attention 用于嵌入编辑请求。作者未公开代码。
这意味着什么
在我们的视频生成器指南中,目前还没有能够在无限流式编辑模式下运行的工具。任务上最接近的是
LTX-Video、
CogVideoX(智谱 CogVideoX) 和
Pyramid Flow(快手 Pyramid Flow)——它们都根据文本或图像提示生成视频,但都基于有限片段,而非持续输入的帧流。
LTX-Video 解决的是 image-to-video 任务,最大文件大小为 26.6 GB,据开发者描述,仅需 1 GB 显存。CogVideoX 是一款 text-to-video 生成器,模型大小为 9.2 GB,面向 CUDA 和 NVIDIA H100。Pyramid Flow 同样作为 text-to-video 工具运行,最大权重文件占用 7.8 GB,运行所需显存不足 8 GB。这些工具的参数表中均未提及流式模式或对已生成帧累积编辑的机制。
InfinityEdit 描述的正是指南中尚未覆盖的领域:实时流的编辑,其中请求按顺序到达,并应应用于尚未生成的帧。目前这只是一项没有代码的研究工作,无法评估其对现有生成器的适用性——作者既未发布权重,也未发布代码仓库。
方法的工作原理。示意图根据这篇简讯绘制。