LTX-Video и CogVideoX получают новый метод zero-shot генерации субтитров через синтетическое
Исследователи опубликовали на arXiv работу Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning, в которой предлагают метод WSV для zero-shot видеокаптионинга. Подход использует предобученную text-to-video модель для генерации синтетических видео-латентов на этапе обучения, а затем обучает «полировщик» сближать распределения реального и синтетического видео. На этапе вывода входное видео кодируется 3D Causal VAE и напрямую подаётся в промптер, который управляет GPT-2 для генерации субтитров. Авторы сообщают о результатах 52 B@4 и 95.7 CIDEr на датасетах MSVD, MSR-VTT и VATEX. Кода авторы не выкладывали.
Что это значит
Работа касается задачи видеокаптионинга — автоматического описания содержания видео текстом. Это смежная область с генерацией видео, но не то же самое: здесь текст порождается из видео, а не наоборот.
В нашем разделе генераторов видео прямых аналогов этой задаче нет. Ближайшие по теме инструменты — LTX-Video и CogVideoX — решают обратную задачу: LTX-Video работает как image-to-video, CogVideoX — как text-to-video. Оба используют diffusion-подход и библиотеку diffusers, но ни один из них не предназначен для описания уже готового видео.
При этом метод WSV опирается на text-to-video модель как на промежуточный компонент: она генерирует синтетические видео-латенты, которые затем используются для обучения каптионера. Это означает, что качество text-to-video генерации напрямую влияет на качество итоговых субтитров. Однако авторы не уточняют, какую именно text-to-video модель они использовали, и не публикуют код, поэтому проверить совместимость с конкретными генераторами из справочника сейчас нельзя.
Для пользователей, которые ищут инструмент описания видео, эта работа пока остаётся на уровне научной публикации: без кода и весов воспроизвести метод или использовать его в своих проектах не получится.Как устроен метод. Схема нарисована по этой заметке.