CPU3DИИ-инструменты для 3D и видео

LTX-Video и CogVideoX получают новый метод zero-shot генерации субтитров через синтетическое

Исследователи опубликовали на arXiv работу Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning, в которой предлагают метод WSV для zero-shot видеокаптионинга. Подход использует предобученную text-to-video модель для генерации синтетических видео-латентов на этапе обучения, а затем обучает «полировщик» сближать распределения реального и синтетического видео. На этапе вывода входное видео кодируется 3D Causal VAE и напрямую подаётся в промптер, который управляет GPT-2 для генерации субтитров. Авторы сообщают о результатах 52 B@4 и 95.7 CIDEr на датасетах MSVD, MSR-VTT и VATEX. Кода авторы не выкладывали.

Что это значит

Работа касается задачи видеокаптионинга — автоматического описания содержания видео текстом. Это смежная область с генерацией видео, но не то же самое: здесь текст порождается из видео, а не наоборот. В нашем разделе генераторов видео прямых аналогов этой задаче нет. Ближайшие по теме инструменты — LTX-Video и CogVideoX — решают обратную задачу: LTX-Video работает как image-to-video, CogVideoX — как text-to-video. Оба используют diffusion-подход и библиотеку diffusers, но ни один из них не предназначен для описания уже готового видео. При этом метод WSV опирается на text-to-video модель как на промежуточный компонент: она генерирует синтетические видео-латенты, которые затем используются для обучения каптионера. Это означает, что качество text-to-video генерации напрямую влияет на качество итоговых субтитров. Однако авторы не уточняют, какую именно text-to-video модель они использовали, и не публикуют код, поэтому проверить совместимость с конкретными генераторами из справочника сейчас нельзя. Для пользователей, которые ищут инструмент описания видео, эта работа пока остаётся на уровне научной публикации: без кода и весов воспроизвести метод или использовать его в своих проектах не получится.
WSV: zero-shot видеокаптионинг через синтетическое видео Схема метода по статье Watching Synthetic Videos Text-to-Video Генерация видео-латенты предобученная модель Полировщик Сближение распределений реальное и синтетическое 3D Causal VAE Кодирование входного видео этап вывода Промптер + GPT-2 Управление GPT-2 для генерации субтитров промптер управляет генерацией текста Субтитры Текстовое описание видео 52 B@4, 95.7 CIDEr LTX-Video (image-to-video) и CogVideoX (text-to-video) — обратная задача, diffusion-подход WSV использует text-to-video как промежуточный компонент, но код и веса не опубликованы
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также