GAE-GeometricAutoEncoder: генератор видео — что умеет и что нужно для запуска

GAE-GeometricAutoEncoder — это генератор видео с открытым кодом от ARC Lab, Tencent PCG. Он решает задачу image-to-video: по одному изображению создаёт видеоряд, а заодно выдаёт трёхмерное облако точек. Разработчики позиционируют инструмент как способ получить 3D-согласованную генерацию мира через геометрически-нативное скрытое пространство.
Что умеет
Инструмент принимает изображение и генерирует видео. По описанию автора, на выходе формируются три артефакта: MP4-видео, визуализация траектории и облако точек в формате ply. Это значит, что вместе с плоским видеорядом можно получить пространственное представление сцены.
В основе лежит модель GAE-D64-1B, доступная на Hugging Face. Авторы описывают подход как обучение геометрически-нативного скрытого пространства для 3D-согласованной генерации мира. В метках репозитория указаны 3D-реконструкция, depth-anything-v3, VAE, генерация видео, генерация мира и модель мира.
Что нужно для запуска
Код написан на Python, библиотека — PyTorch. По описанию автора, требуется Python версии 3.10—3.12 и torch 2.5.1. Бэкбон DA3-GIANT подтягивается с Hugging Face.
Самый большой файл весов занимает 3.5 ГБ, все файлы весов вместе — 5.2 ГБ. Это стоит учитывать при планировании дискового пространства и загрузки.
Лицензия кода — License Terms of Learning a Geometry-Native Latent Space. Она разрешает свободно использовать, копировать, изменять, публиковать, распространять, сублицензировать и продавать копии ПО, но только в академических целях. Любое неакадемическое, коммерческое или производственное использование запрещено при любых обстоятельствах. Во все копии или значимые части ПО необходимо включать уведомление об авторском праве и текст разрешения.
Репозиторий создан 16 сентября 2026 года, последнее изменение кода — 24 сентября 2026 года.
Кому подойдёт
Инструмент рассчитан на исследователей и студентов, которые работают с генерацией видео и 3D-реконструкцией в академической среде. Возможность получить облако точек вместе с видео делает его интересным для задач, где нужно анализировать пространственную структуру сцены, а не только плоскую картинку.
Для коммерческой разработки, продакшена и любых неакадемических проектов он не подойдёт: лицензия прямо запрещает такое использование. Также стоит учесть, что веса модели занимают больше пяти гигабайт — для слабых машин и быстрых экспериментов это может быть ощутимо.
GAE-GeometricAutoEncoder — это исследовательский инструмент с чётко очерченной областью применения. Он соединяет генерацию видео с получением трёхмерного облака точек и работает по модели image-to-video. Академическая лицензия и заметный объём весов определяют его аудиторию: это скорее лаборатория, чем продакшен.
Паспорт
Репозиторий · Модель на HuggingFace
| Задача | image-to-video источник |
|---|---|
| Лицензия кода | License Terms of Learning a Geometry-Native Latent Space: только академическое использование источник |
| Самый большой файл весов | 3.5 ГБ источник |
| Все файлы весов | 5.2 ГБ источник |
| Форматы экспорта | ply по описанию автора источник |
| Python | 3.10 по описанию автора источник |
| Библиотека | pytorch источник |
| Язык | Python источник |
| Последнее изменение кода | 2026-09-24 источник |
| Репозиторий создан | 2026-09-16 источник |
| Звёзд на GitHub | 328 источник |
|---|---|
| Форков | 10 источник |
| Загрузок за месяц | 0 источник |
| Обновление модели | 2026-09-24 источник |
Значения собраны автоматически из официальных источников и проверены 26.09.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



