Vorch-Streamer — потоковая генерация аватаров в реальном времени с синхронизацией речи и видео
Исследователи представили Vorch-Streamer — метод пост-тренировки, позволяющий генерировать видео аватаров с синхронизированным звуком в реальном времени по текстовому описанию. Работа опубликована на arXiv 6 августа 2026 года. Авторы решили две ключевые проблемы: накопление ошибок при автогрессивной генерации длинных роликов и отсутствие у генератора информации о том, какой фрагмент речи произносить в каждый момент. Для этого они обучили причинную модель на синтетическом корпусе из 80 тысяч клипов, применили дистилляцию с самопринуждением и добавили внешнюю языковую модель, которая предсказывает речевые токены с частотой 25 Гц. Итоговая система генерирует аудио и видео из текста на скорости 27,12 FPS, превышая порог воспроизведения в реальном времени.
Что это значит
Новость касается узкой задачи генерации анимированных аватаров с синхронной речью и не затрагивает напрямую инструменты из раздела генераторов видео нашего справочника.
В нашем справочнике представлены генераторы видео общего назначения: LTX-Video (image-to-video), CogVideoX (text-to-video) и Pyramid Flow (text-to-video). Все они работают в режиме офлайн-генерации коротких роликов, не поддерживают синхронную генерацию аудиодорожки и не предназначены для потокового режима реального времени. Ни один из этих инструментов не использует внешнюю языковую модель для управления речевой последовательностью и не обучался на корпусах аватаров.
Vorch-Streamer решает специфическую инженерную задачу, которая пока не имеет аналогов среди публично доступных генераторов видео в нашем справочнике.Как устроен метод. Схема нарисована по этой заметке.