HelloWorld — модель для социального взаимодействия с персонажами в видеомирах
Исследователи представили HelloWorld — модель видеомира, в которой пользователь может взаимодействовать с персонажами на экране. По нажатию кнопки персонаж реагирует на зрителя: поворачивается, машет рукой, кивает или произносит короткое приветствие. Модель обучается через самодистилляцию на синтезированных данных, а в момент вывода специальный модуль без дообучения определяет, когда именно должна произойти реакция, локализуя её в нужном временном окне. Код выложен в открытый доступ.
Что это значит
HelloWorld решает задачу, которой нет ни в одном инструменте из нашего справочника AI-видео: социальное взаимодействие с персонажем внутри генерируемого видео. Это не просто text-to-video или image-to-video, а управление поведением персонажа в реальном времени по отношению к камере.
Сравним с ближайшими по типу инструментами:
- LTX-Video — генератор image-to-video, о взаимодействии с персонажами в его паспорте ничего не сказано.
- CogVideoX — решает задачу text-to-video, социальные взаимодействия не упоминаются.
- Pyramid Flow — также text-to-video, без функций управления поведением персонажа.
HelloWorld — это исследовательский проект, а не готовый генератор видео общего назначения. Он показывает, как можно добавить интерактивность в видеомиры, но пока не интегрирован в существующие инструменты из справочника.



