VGI-Bench оценивает визуальное мышление видеогенераторов на 810 задачах
arXiv опубликовал работу VGI-Bench — бенчмарк из 27 задач и 810 примеров для проверки визуального мышления у моделей генерации видео. Авторы выстроили двухуровневую таксономию доменов и навыков, требуют от моделей не просто правдоподобного финального кадра, а корректного развития процесса, и калибруют сложность так, чтобы задачи оставались частично решаемыми. Сильнейшая из протестированных систем, Seedance 2.0, набирает 51,0% по критериям бенчмарка. Код авторы не выкладывали.
Что это значит
Бенчмарк напрямую касается инструментов из раздела генераторов видео нашего справочника, но среди протестированных моделей нет ни одной из тех, что мы описываем.
LTX-Video — генератор видео от Lightricks с задачей image-to-video, открытым кодом и весами. В паспорте инструмента нет сведений о визуальном мышлении или результатах на каких-либо бенчмарках: авторы описывают его как репозиторий для генерации видео и отмечают низкие требования к видеопамяти.
CogVideoX от Zhipu AI решает задачу text-to-video, код открыт. В паспорте также нет данных об оценке визуального мышления — только технические характеристики и описание задач генерации.
Pyramid Flow — text-to-video генератор с открытым кодом, в паспорте зафиксированы требования к видеопамяти и поддержка MPS, но никаких сведений о способности к визуальному рассуждению нет.
VGI-Bench задаёт новую планку для оценки видеогенераторов, но пока не пересекается с инструментами из нашего справочника: ни один из описанных у нас генераторов в работе не тестировался, и в их паспортах нет данных, которые можно было бы сопоставить с результатами бенчмарка.Как устроен метод. Схема нарисована по этой заметке.