CPU3D3D、视频与音频的 AI 工具

RefAlign:视频生成器 — 功能与运行要求

RefAlign 是一款开源视频生成器,可根据文本描述和参考图像生成视频。该工具解决的任务是 image-text-to-video:输入为图片和文本,输出为与两个来源都保持一致的视频。作者将该 项目描述为在 ECCV 2026 上展示的 RefAlign 参考视频生成方法的官方实现。

功能

据作者描述,RefAlign 解决的是 reference-to-video generation 任务——基于参考生成视频。其核心是 representation alignment 方法:在参考图像与生成的视频之间对齐表示。这能够在视频画面中保留原始对象或场景的视觉特征。

该仓库带有若干标签,指向所支持的场景:subject-to-video(将特定主体迁移到视频中)、controllable-generation(可控生成)、text-image-generation 和 video-generation。此外还提到了 diffusion-models——扩散模型作为基础架构。作者未说明关于视频时长、分辨率或所支持输入图像格式的具体限制。

运行要求

代码使用 Python 编写,发布在仓库 github.com/gudaochangsheng/RefAlign。代码最后一次修改日期为 2026 年 8 月 25 日,仓库创建于 2026 年 3 月 17 日。代码许可证为非标准许可证——作者未在参数表中给出其文本,因此使用前需手动核查条款。

模型权重发布在 huggingface.co/gudaochangsheng/RefAlign-1.3B。所有权重文件的总大小为 2,6 GB,最大的单个文件同样为 2,6 GB。权重许可证为 MIT。作者未说明对显存、内存容量或具体库版本的要求。

适用人群

该工具适合从事基于参考的视频生成的人:需要将特定角色、对象或风格从图像迁移到视频中。开源代码和可获取的权重使人们能够研究该方法的实现,并将其适配到自己的任务中。

该项目不太适合寻找带界面的现成应用的人:参数表中描述的是代码和模型权重,而非用户产品。此外还需注意代码的非标准许可证——如果条款具有限制性,在商业项目中使用可能需要另行协商。

RefAlign 是一种基于参考的视频生成方法的研究性实现,具有开源代码和已发布的权重。运行前应核查代码许可证,并准备好用于 Python 项目的环境。

RefAlign 流水线 图像与文本生成视频 输入 图像 与文本 描述 编码器 提取 特征 图像 RefAlign 扩散 模型 生成 对齐 协调 表示 与文本 视频 生成的 片段 输出帧
RefAlign 的处理流程。示意图依据工具参数表绘制。

参数表

任务image-text-to-video 来源
代码许可证非标准(需手动检查) 来源
权重许可证mit 来源
最大权重文件2.6 GB 来源
全部权重文件2.6 GB 来源
语言Python 来源
代码最近更新2026-08-25 来源
仓库创建时间2026-03-17 来源
经常变化 — 数据截至 2026-09-12
GitHub 星标475 来源
Fork 数30 来源
月下载量11 来源
模型更新2026-05-13 来源

数值由程序自动从官方来源采集,并于 2026-09-12 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读