Обзор методов посттренировки и выравнивания видеогенераторов на arXiv
На arXiv опубликован обзор Video Generation Models: A Survey of Post-Training and Alignment. Авторы систематизируют подходы к посттренировке видеомоделей, которые не требуют переобучения с нуля: supervised fine-tuning, self-training и дистилляция, методы на основе предпочтений и наград, а также inference-time методы. Отдельно рассматриваются наборы данных, бенчмарки и практики оценки. Код выложен в открытый доступ.
Что это значит
Обзор касается всей темы генерации видео, которую мы собираем в разделе AI Video. Из инструментов нашего справочника напрямую затронуты три генератора с открытым кодом.
Maestro — локальная студия на базе пайплайна WanGP, веса MiniMax H3 занимают 464.1 ГБ, самый большой файл — 9.7 ГБ. Автор указывает потребность в видеопамяти 12—24 ГБ и платформу CUDA. Лицензия кода WanGP разрешает только некоммерческое использование самой программы, веса MiniMax H3 допускают коммерцию до 20 млн долларов годовой выручки, но не действуют в ЕС, Великобритании, Корее и США.
LTX-Video от Lightricks заявлен с потребностью всего 1 ГБ видеопамяти, поддерживает MPS на macOS. Веса занимают 236.4 ГБ, самый большой файл — 26.6 ГБ. Лицензия весов разрешает коммерческое использование, но компаниям с выручкой от $10 млн нужна отдельная платная лицензия.
CogVideoX от Zhipu AI решает задачу text-to-video, веса модели 5b занимают 20 ГБ, самый большой файл — 9.2 ГБ. Для коммерческого использования нужна регистрация, бесплатно до 1 млн посещений в месяц.
Обзор не привязан к конкретным реализациям и не сообщает, какие из перечисленных методов уже применяются в этих инструментах. Практическая ценность для пользователя локальных генераторов — в систематизации подходов, которые могут повлиять на следующие версии моделей и пайплайнов постобработки.Как устроен метод. Схема нарисована по этой заметке.