Alaya-EVOKE представила метод генерации длинных интерактивных миров с линейным масштабированием
На arXiv опубликована работа Alaya-EVOKE, в которой авторы решают задачу генерации длинных интерактивных миров. Они выносят состояние сцены во внешний банк, индексируемый по камере, и перестраивают учителя под long-horizon supervision: разреженное внимание с группировкой по чанкам, выборкой дальних кадров и линейным глобальным состоянием. Это даёт линейный рост памяти и вычислений при увеличении длины сессии. Код авторы не выкладывали. Подробнее — на странице работы.
Что это значит
Работа относится к генерации интерактивных миров, а не к генерации 3D-моделей по изображению. Прямого пересечения с инструментами из нашего справочника нет: OpenLRM, Hunyuan3D 2.1 и TRELLIS решают задачу image-to-3d — создание статичной модели по одному изображению, без сессий, памяти мира и интерактивного продолжения сцены.
Тем не менее метод затрагивает общую для генеративных 3D-систем проблему: удержание контекста при росте горизонта генерации. В паспортах наших инструментов таких механизмов нет — ни один из них не описывает внешнее хранилище состояния сцены или long-horizon supervision. У OpenLRM и TRELLIS контекст ограничен одним входным изображением, у Hunyuan3D 2.1 — изображением и текстовым описанием.
Пока это исследовательская работа без кода, и для пользователей наших инструментов ничего не меняется. Если подход получит открытую реализацию, он может повлиять на будущие генераторы миров и видео, но не на текущие image-to-3d пайплайны.Как устроен метод. Схема нарисована по этой заметке.