CPU3DИИ-инструменты для 3D, видео и звука

nano-world-model: генератор видео — что умеет и что нужно для запуска

nano-world-model — это открытый генератор видео, который авторы позиционируют как минималистичный набор инструментов для исследований в области моделей мира. Репозиторий создан для задач, где нужно не просто сгенерировать видеоряд, а работать с моделью, предсказывающей развитие сцены, в том числе для планирования и управления роботами.

Что умеет

По описанию авторов, проект представляет собой «минималистичный репозиторий с батарейками в комплекте для продвижения науки о моделях мира». Среди меток репозитория указаны:

  • генерация видео и потоковое видео;
  • диффузионные модели и diffusion-forcing;
  • модельно-прогностическое управление;
  • планирование;
  • манипуляции роботами.

Авторы не приводят детального списка поддерживаемых сценариев генерации или ограничений по длительности и разрешению видео. Модель, на которую ссылается репозиторий, связана с задачей point-maze, что указывает на работу с траекториями и пространственными сценами, а не с произвольным текстовым описанием сюжета.

Что нужно для запуска

Код написан на Python с использованием библиотеки PyTorch. Лицензия кода — MIT. Для работы, по описанию автора, требуется платформа CUDA; в документации упоминаются «CUDA wheels и все зависимости», отсылка даётся к разделу настройки окружения.

Файлы весов занимают 0.6 ГБ — это суммарный объём всех файлов модели, самый большой отдельный файл также весит 0.6 ГБ. Модель размещена на Hugging Face. Авторы не указывают минимальные требования к объёму видеопамяти или конкретные версии CUDA и PyTorch.

Кому подойдёт

Проект рассчитан прежде всего на исследователей, которые занимаются моделями мира, диффузионными моделями и обучением с подкреплением. Он будет полезен тем, кому нужен компактный открытый код для экспериментов с генерацией видео в контексте планирования и робототехники, а не готовый пользовательский инструмент.

Тем, кто ищет генератор видео по текстовому описанию с развитым интерфейсом и предсказуемым качеством на произвольных сюжетах, этот репозиторий, скорее всего, не подойдёт: авторы не описывают его как прикладной сервис, а акцент сделан на исследовательской минималистичности и работе с конкретным классом задач.

nano-world-model — это исследовательский проект с открытым кодом, который даёт отправную точку для экспериментов с моделями мира и генерацией видео в задачах планирования. Его ценность определяется не широтой пользовательских сценариев, а доступностью кода и возможностью изучать и модифицировать подходы, заложенные авторами.

Конвейер nano-world-model Входные данные поток кадров состояние среды Кодировщик сжатие в латент признаки сцены Мировая модель прогноз динамики планирование Декодер восстановление видеокадры Результат видеопоток прогноз кадров потоковая генерация diffusion-forcing · model-predictive-control pytorch · CUDA · Python Модель: nanowm-b2-dino-wm-point-maze-30k веса: 0.6 ГБ · лицензия MIT · открытый код
Как устроен конвейер nano-world-model. Схема нарисована по паспорту инструмента.

Паспорт

Лицензия кодаMIT источник
ПлатформаCUDA по описанию автора источник
Самый большой файл весов0.6 ГБ источник
Все файлы весов0.6 ГБ источник
Библиотекаpytorch источник
ЯзыкPython источник
Последнее изменение кода2026-09-08 источник
Репозиторий создан2026-04-30 источник
Меняется часто — данные на 10.09.2026
Звёзд на GitHub733 источник
Форков49 источник
Загрузок за месяц50 источник
Обновление модели2026-04-22 источник

Значения собраны автоматически из официальных источников и проверены 10.09.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.

Смотрите также