ArtiMo: агентный фреймворк для анимации составных 3D-мешей по тексту
21 августа 2026 года на arXiv опубликована работа ArtiMo: Agent-Driven Articulated Mesh Animation. Авторы предлагают фреймворк, который анимирует составные 3D-меши по текстовому описанию без дообучения моделей. В основе — агентный пайплайн на базе LLM и VLM: языковая модель планирует движения частей объекта с учётом кинематических ограничений URDF, а визуальная модель итеративно проверяет результат по отрендеренным ключевым кадрам и исправляет ошибки. Код авторы не выкладывали.
Что это значит
Для нашего раздела генераторов видео и 3D-анимации это скорее смежная работа, чем прямой конкурент. ArtiMo не генерирует видео и не создаёт меши — он анимирует уже готовые составные 3D-модели, опираясь на их кинематическую схему. Среди инструментов справочника прямых аналогов нет.
Ближайшие по теме генераторы видео работают иначе. LTX-Video — это image-to-video модель от Lightricks с открытым кодом (Apache-2.0), самый большой файл весов 26.6 ГБ, по описанию автора требует всего 1 ГБ видеопамяти и поддерживает MPS на macOS. CogVideoX от Zhipu AI решает задачу text-to-video, весит 9.2 ГБ в максимальном файле, работает на CUDA. Pyramid Flow — тоже text-to-video, MIT-лицензия на код, 7.8 ГБ самый большой файл, от 8 ГБ видеопамяти.
ArtiMo отличается от всех трёх принципиально: это не генеративная модель, а оркестратор, который использует готовые LLM и VLM для планирования и проверки движений. Для пользователя, который ищет инструмент «текст в видео», ArtiMo бесполезен — он не рендерит финальный видеоряд, а лишь управляет анимацией составного меша. Для задач робототехники или анимации персонажей с жёстким скелетом такой подход может быть интересен, но без опубликованного кода проверить его на практике пока нельзя.Как устроен метод. Схема нарисована по этой заметке.