CPU3DИИ-инструменты для 3D, видео и звука

Обзор методов посттренировки и выравнивания видеогенераторов на arXiv

На arXiv опубликован обзор Video Generation Models: A Survey of Post-Training and Alignment. Авторы систематизируют подходы к посттренировке видеомоделей, которые не требуют переобучения с нуля: supervised fine-tuning, self-training и дистилляция, методы на основе предпочтений и наград, а также inference-time методы. Отдельно рассматриваются наборы данных, бенчмарки и практики оценки. Код выложен в открытый доступ.

Что это значит

Обзор касается всей темы генерации видео, которую мы собираем в разделе AI Video. Из инструментов нашего справочника напрямую затронуты три генератора с открытым кодом. Maestro — локальная студия на базе пайплайна WanGP, веса MiniMax H3 занимают 464.1 ГБ, самый большой файл — 9.7 ГБ. Автор указывает потребность в видеопамяти 12—24 ГБ и платформу CUDA. Лицензия кода WanGP разрешает только некоммерческое использование самой программы, веса MiniMax H3 допускают коммерцию до 20 млн долларов годовой выручки, но не действуют в ЕС, Великобритании, Корее и США. LTX-Video от Lightricks заявлен с потребностью всего 1 ГБ видеопамяти, поддерживает MPS на macOS. Веса занимают 236.4 ГБ, самый большой файл — 26.6 ГБ. Лицензия весов разрешает коммерческое использование, но компаниям с выручкой от $10 млн нужна отдельная платная лицензия. CogVideoX от Zhipu AI решает задачу text-to-video, веса модели 5b занимают 20 ГБ, самый большой файл — 9.2 ГБ. Для коммерческого использования нужна регистрация, бесплатно до 1 млн посещений в месяц. Обзор не привязан к конкретным реализациям и не сообщает, какие из перечисленных методов уже применяются в этих инструментах. Практическая ценность для пользователя локальных генераторов — в систематизации подходов, которые могут повлиять на следующие версии моделей и пайплайнов постобработки.
Посттренировка и выравнивание видеогенераторов Обзор методов без переобучения с нуля Базовая модель видеогенератор предобученный Методы посттренировки supervised fine-tuning, self-training, дистилляция, предпочтения, награды, inference-time методы Улучшенная модель выравнивание качество видео Данные и оценка Наборы данных видео, тексты, предпочтения Бенчмарки стандартные метрики Практики оценки качество, выравнивание Открытый код доступен публично Затронутые генераторы с открытым кодом Maestro WanGP, 12—24 ГБ VRAM LTX-Video Lightricks, 1 ГБ VRAM CogVideoX Zhipu AI, text-to-video
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также