CPU3DИИ-инструменты для 3D, видео и звука

ArtiMo: агентный фреймворк для анимации составных 3D-мешей по тексту

21 августа 2026 года на arXiv опубликована работа ArtiMo: Agent-Driven Articulated Mesh Animation. Авторы предлагают фреймворк, который анимирует составные 3D-меши по текстовому описанию без дообучения моделей. В основе — агентный пайплайн на базе LLM и VLM: языковая модель планирует движения частей объекта с учётом кинематических ограничений URDF, а визуальная модель итеративно проверяет результат по отрендеренным ключевым кадрам и исправляет ошибки. Код авторы не выкладывали.

Что это значит

Для нашего раздела генераторов видео и 3D-анимации это скорее смежная работа, чем прямой конкурент. ArtiMo не генерирует видео и не создаёт меши — он анимирует уже готовые составные 3D-модели, опираясь на их кинематическую схему. Среди инструментов справочника прямых аналогов нет. Ближайшие по теме генераторы видео работают иначе. LTX-Video — это image-to-video модель от Lightricks с открытым кодом (Apache-2.0), самый большой файл весов 26.6 ГБ, по описанию автора требует всего 1 ГБ видеопамяти и поддерживает MPS на macOS. CogVideoX от Zhipu AI решает задачу text-to-video, весит 9.2 ГБ в максимальном файле, работает на CUDA. Pyramid Flow — тоже text-to-video, MIT-лицензия на код, 7.8 ГБ самый большой файл, от 8 ГБ видеопамяти. ArtiMo отличается от всех трёх принципиально: это не генеративная модель, а оркестратор, который использует готовые LLM и VLM для планирования и проверки движений. Для пользователя, который ищет инструмент «текст в видео», ArtiMo бесполезен — он не рендерит финальный видеоряд, а лишь управляет анимацией составного меша. Для задач робототехники или анимации персонажей с жёстким скелетом такой подход может быть интересен, но без опубликованного кода проверить его на практике пока нельзя.
ArtiMo: агентный фреймворк для анимации составных 3D-мешей по тексту Текстовое описание «открой дверцу» «подними руку» Составной 3D-меш готовая модель с жёстким скелетом URDF кинематические ограничения LLM языковая модель планирует движения частей объекта Рендер ключевые кадры анимации меша VLM визуальная модель проверяет результат итеративно исправление ошибок Анимация меша управление движением
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также