VA-Judger: модель вознаграждения для совместной генерации видео и звука
Исследователи представили VA-Judger — reward-модель для посттренировки систем совместной генерации видео и аудио, а также датасет VAPref-10K из 10,3 тыс. парных сравнений и бенчмарк VA-Judger-Bench. Работа опубликована 19 августа 2026 года на arXiv. Авторы отмечают, что существующие метрики оценивают качество звука, визуальную точность и синхронизацию по отдельности и не улавливают общую семантическую и временную связность между текстовым промптом, видео и звуком. VA-Judger обучается поэтапно: сначала на парах с явным разрывом в качестве, затем на более сложных сравнениях через rejection sampling с проверкой по человеческим аннотациям, после чего выполняет dimension-wise reinforcement learning. Код выложен в открытый доступ.
Что это значит
Новость касается темы генерации видео в целом — в нашем разделе AI Video собраны инструменты text-to-video и image-to-video. VA-Judger — это не генератор, а reward-модель для оценки и посттренировки генеративных систем, поэтому напрямую с нашими карточками она не пересекается.
Среди инструментов справочника ближе всего по задаче text-to-video находятся CogVideoX и Pyramid Flow. Оба — открытые генераторы видео, но в их паспортах нет сведений о поддержке аудио или о применении reward-моделей для посттренировки. LTX-Video решает задачу image-to-video и также не упоминает работу со звуком.
Совместная генерация видео и аудио — отдельное направление, которого в наших паспортах пока нет. Если VA-Judger получит распространение как компонент посттренировки, это может повлиять на будущие версии генераторов, но на текущие карточки справочника новость не влияет.