2026 年 10 月 1 日,arXiv 上发表了 Generative Cinematographer(GenCine)的研究——这是一个将单张图像提升为可编辑 3D 场景,并允许联合设定相机与前景运动的系统。创作者绘制相机路径,并用局部 3D 手柄移动选定的前景区域,这些手柄可以独立移动物体的不同部分。控制信号被投影为 guidance maps:每个手柄获得固定颜色,其 3D 位置在背景的世界坐标系中编码,从而即使在相机运动时也能描述物体相对于场景的运动。作者在预训练的 Wan 模型上训练了一个轻量的 guidance 分支和 LoRA 适配器。作者未公开代码。详情见
arXiv 上的论文。
这意味着什么
GenCine 构建在
Wan(通义万相)之上——这是阿里巴巴的开源视频生成器,任务为 text-to-video。Wan 的代码以 Apache-2.0 许可证分发,模型权重同样是 Apache-2.0。仓库中最大的模型单个文件占 10.6 GB,全部权重文件共 64.3 GB。Wan 的作者指出,T2V-1.3B 模型需要 8.19 GB 显存,在 RTX 4090 上以 480P 生成五秒短片约需四分钟,且未使用量化等优化。
GenCine 的研究未说明训练 guidance 分支和 LoRA 适配器所需的显存要求,未给出微调后模型的规模,也未描述可以使用这些成果的条件。代码未公开,因此无法根据论文复现该系统。对指南的读者来说,这意味着目前还没有基于 GenCine 的实用工具,而与 Wan 当前能力的比较仍停留在方法描述层面。
关于视频生成器及其他可在自己的硬件上运行的工具,汇总在
AI Video 页面。
该方法的构造。示意图根据本简讯绘制。