LTX-Video и CogVideoX пока не решают задачу нескольких объектов в одном видео
На arXiv вышло сравнительное исследование трёх подходов к генерации видео с несколькими объектами без дообучения: прямой, параллельной и последовательной генерации. Авторы разбирают, как каждый метод справляется с сохранением внешности объектов, согласованностью движений и взаимодействием между ними, и описывают характерные сбои. Код авторы не выкладывали. Подробнее — в работе на arXiv.
Что это значит
В нашем справочнике по теме генераторов видео есть три инструмента с задачей image-to-video или text-to-video, но ни один из них не заявляет поддержку нескольких объектов в одном ролике.
LTX-Video решает задачу image-to-video и работает с одним опорным изображением. В описании авторов нет упоминаний о разбиении сцены на отдельные объекты или о композиции нескольких видео. Прямая генерация из исследования ближе всего к тому, что делает LTX-Video: модель получает полное изображение и промпт целиком.
CogVideoX заявлен как text-to-video, хотя в описании репозитория упомянут и image-to-video. Про работу с несколькими объектами и их раздельную генерацию в паспорте данных нет.
Pyramid Flow — тоже text-to-video, и в его описании нет ничего о мультисубъектной генерации или декомпозиции сцены.
Исследование описывает парадигмы, которые пока не реализованы в инструментах нашего справочника. Прямой подход частично пересекается с текущими возможностями LTX-Video, но параллельная и последовательная генерация — это отдельные техники, которых в паспортах нет. Если авторы позже опубликуют код, можно будет проверить, насколько эти методы применимы к открытым моделям из нашего каталога.Как устроен метод. Схема нарисована по этой заметке.