Vorch-Streamer превращает генерацию аватаров в потоковое видео реального времени
arXiv опубликовал работу Vorch-Streamer — метод посттренировки, позволяющий генерировать видео с аудио по тексту в реальном времени. Авторы решают две проблемы: накопление ошибок при автогрессивной генерации длинных роликов и синхронизацию речи с движением губ, когда модель не знает, какой фрагмент текста произносить в данный момент. Для этого causal-генератор обучают с Teacher Forcing и Diffusion Forcing, затем применяют Self Forcing с DMD-дистилляцией, а речевой прогресс контролирует внешняя языковая модель через дискретные токены с частотой 25 Гц. Итоговая система выдаёт аудио и видео из текста на скорости 27,12 FPS при четырёх шагах денойзинга, превышая порог воспроизведения 24 FPS.
Что это значит
Новость касается генерации аватаров с синхронизированной речью — это смежная, но не совпадающая задача с теми, что решают инструменты из раздела генераторов видео нашего справочника.
LTX-Video (карточка) — image-to-video генератор, не работает с аудио и не заточен под аватары. В паспорте нет данных о потоковой генерации или синхронизации губ.
CogVideoX (карточка) — text-to-video генератор без аудиодорожки. О потоковом режиме и речевой синхронизации в паспорте не упоминается.
Pyramid Flow (карточка) — также text-to-video без звука. Ни потоковая генерация, ни работа с аватарами в паспорте не заявлены.
Vorch-Streamer решает узкую задачу real-time генерации говорящих аватаров, которая пока не представлена в нашем справочнике отдельным инструментом. Существующие генераторы видео не затрагивают эту нишу напрямую.Как устроен метод. Схема нарисована по этой заметке.