RefAlign: генератор видео — что умеет и что нужно для запуска

RefAlign — открытый генератор видео, который создаёт ролики по текстовому описанию и опорному изображению. Задача, которую решает инструмент, — image-text-to-video: на вход подаются картинка и текст, на выходе получается видео, согласованное с обоими источниками. Авторы описывают проект как официальную реализацию метода RefAlign для генерации видео по референсу, представленную на ECCV 2026.
Что умеет
По описанию автора, RefAlign решает задачу reference-to-video generation — генерации видео с опорой на референс. В основе лежит подход representation alignment: выравнивание представлений между опорным изображением и генерируемым видео. Это позволяет сохранять визуальные характеристики исходного объекта или сцены в кадрах ролика.
Репозиторий помечен метками, которые указывают на поддерживаемые сценарии: subject-to-video (перенос конкретного субъекта в видео), controllable-generation (управляемая генерация), text-image-generation и video-generation. Также упоминаются diffusion-models — диффузионные модели как базовая архитектура. Конкретные ограничения по длительности роликов, разрешению или поддерживаемым форматам входных изображений авторы не указывают.
Что нужно для запуска
Код написан на Python и опубликован в репозитории github.com/gudaochangsheng/RefAlign. Последнее изменение кода датировано 25 августа 2026 года, репозиторий создан 17 марта 2026 года. Лицензия кода нестандартная — авторы не приводят её текст в паспорте, поэтому перед использованием нужно проверить условия вручную.
Веса модели выложены на huggingface.co/gudaochangsheng/RefAlign-1.3B. Общий объём всех файлов весов — 2,6 ГБ, самый большой отдельный файл также занимает 2,6 ГБ. Лицензия весов — MIT. Требования к видеопамяти, объёму оперативной памяти или конкретным версиям библиотек авторы не указывают.
Кому подойдёт
Инструмент будет полезен тем, кто работает с генерацией видео по референсу: нужно перенести конкретного персонажа, объект или стиль из изображения в видеоряд. Открытый код и доступные веса позволяют изучать реализацию метода и адаптировать её под собственные задачи.
Проект вряд ли подойдёт тем, кто ищет готовое приложение с интерфейсом: в паспорте описан код и веса модели, а не пользовательский продукт. Также стоит учитывать нестандартную лицензию кода — если условия окажутся ограничивающими, использование в коммерческом проекте может потребовать отдельного согласования.
RefAlign — это исследовательская реализация метода генерации видео по референсу с открытым кодом и опубликованными весами. Перед запуском стоит проверить лицензию кода и подготовить окружение для работы с Python-проектом.
Паспорт
Репозиторий · Модель на HuggingFace · Сайт разработчика
| Задача | image-text-to-video источник |
|---|---|
| Лицензия кода | нестандартная (проверить вручную) источник |
| Лицензия весов | mit источник |
| Самый большой файл весов | 2.6 ГБ источник |
| Все файлы весов | 2.6 ГБ источник |
| Язык | Python источник |
| Последнее изменение кода | 2026-08-25 источник |
| Репозиторий создан | 2026-03-17 источник |
| Звёзд на GitHub | 475 источник |
|---|---|
| Форков | 30 источник |
| Загрузок за месяц | 11 источник |
| Обновление модели | 2026-05-13 источник |
Значения собраны автоматически из официальных источников и проверены 12.09.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



