RefAlign:视频生成器 — 功能与运行要求

RefAlign 是一款开源视频生成器,可根据文本描述和参考图像生成视频。该工具解决的任务是 image-text-to-video:输入为图片和文本,输出为与两个来源都保持一致的视频。作者将该 项目描述为在 ECCV 2026 上展示的 RefAlign 参考视频生成方法的官方实现。
功能
据作者描述,RefAlign 解决的是 reference-to-video generation 任务——基于参考生成视频。其核心是 representation alignment 方法:在参考图像与生成的视频之间对齐表示。这能够在视频画面中保留原始对象或场景的视觉特征。
该仓库带有若干标签,指向所支持的场景:subject-to-video(将特定主体迁移到视频中)、controllable-generation(可控生成)、text-image-generation 和 video-generation。此外还提到了 diffusion-models——扩散模型作为基础架构。作者未说明关于视频时长、分辨率或所支持输入图像格式的具体限制。
运行要求
代码使用 Python 编写,发布在仓库 github.com/gudaochangsheng/RefAlign。代码最后一次修改日期为 2026 年 8 月 25 日,仓库创建于 2026 年 3 月 17 日。代码许可证为非标准许可证——作者未在参数表中给出其文本,因此使用前需手动核查条款。
模型权重发布在 huggingface.co/gudaochangsheng/RefAlign-1.3B。所有权重文件的总大小为 2,6 GB,最大的单个文件同样为 2,6 GB。权重许可证为 MIT。作者未说明对显存、内存容量或具体库版本的要求。
适用人群
该工具适合从事基于参考的视频生成的人:需要将特定角色、对象或风格从图像迁移到视频中。开源代码和可获取的权重使人们能够研究该方法的实现,并将其适配到自己的任务中。
该项目不太适合寻找带界面的现成应用的人:参数表中描述的是代码和模型权重,而非用户产品。此外还需注意代码的非标准许可证——如果条款具有限制性,在商业项目中使用可能需要另行协商。
RefAlign 是一种基于参考的视频生成方法的研究性实现,具有开源代码和已发布的权重。运行前应核查代码许可证,并准备好用于 Python 项目的环境。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | image-text-to-video 来源 |
|---|---|
| 代码许可证 | 非标准(需手动检查) 来源 |
| 权重许可证 | mit 来源 |
| 最大权重文件 | 2.6 GB 来源 |
| 全部权重文件 | 2.6 GB 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-08-25 来源 |
| 仓库创建时间 | 2026-03-17 来源 |
数值由程序自动从官方来源采集,并于 2026-09-12 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



