FlowHMR превращает захват движения из видео в задачу генерации с физическим контролем
На arXiv опубликована работа FlowHMR — метод восстановления глобального 3D-движения человека из монокулярного видео. Авторы формулируют задачу как генерацию движения, обусловленную видео, и сначала предобучают модель flow matching. Затем модель дообучают с помощью Group Relative Policy Optimization (GRPO) с двумя наградами: fidelity reward отвечает за согласованность с исходным видео, а tracking reward — за то, насколько успешно физический контроллер может отследить сгенерированное движение. Такой подход, по заявлению авторов, позволяет избежать усреднённых решений, характерных для прямой регрессии, и делает результат физически правдоподобным. Для оценки представлен датасет Wild-4K из примерно 4 тысяч интернет-видео. Подробнее — в статье на arXiv.
Что это значит
FlowHMR решает задачу motion capture, а не генерации видео, поэтому напрямую с инструментами из нашего раздела генераторов видео он не пересекается. Тем не менее стоит посмотреть, как он соотносится с тем, что уже есть в справочнике.
Maestro — это локальная студия для генерации видео, изображений и музыки на базе пайплайна WanGP. Его задача — image-text-to-video, а не восстановление движения человека из готового ролика. Код открыт, но лицензия WanGP Non-Commercial Evaluation License 1.1 разрешает только некоммерческое использование самой программы; веса MiniMax H3 доступны для коммерции до 20 млн долларов годовой выручки, но лицензия не действует в ЕС, Великобритании, Корее и США. Видеопамяти требуется 12—24 ГБ. Никакого физического контроллера или модуля motion capture в паспорте Maestro нет.
LTX-Video от Lightricks — генератор image-to-video с открытым кодом под Apache-2.0. Веса распространяются по LTXV Open Weights License 0.X: коммерческое использование разрешено, но компаниям с выручкой от 10 млн долларов нужна отдельная лицензия. Авторы заявляют, что модели достаточно 1 ГБ видеопамяти. Это тоже генеративная модель, а не инструмент захвата движения, и физическая правдоподобность результата в её паспорте не заявлена.
CogVideoX от Zhipu AI решает задачу text-to-video. Код открыт под Apache-2.0, веса — под The CogVideoX License: академическое использование свободно, для коммерции нужна регистрация, бесплатно до 1 млн посещений в месяц. Самый большой файл весов — 9.2 ГБ. Как и в предыдущих случаях, это генератор видео, а не система восстановления движения, и пересечений с FlowHMR по задаче нет.
FlowHMR интересен тем, что переносит акцент с точности регрессии на физическую отслеживаемость результата. Для пользователей, которые ищут инструменты для работы с движением человека, это скорее сигнал о направлении исследований, чем готовый инструмент: в нашем справочнике аналогов по задаче пока нет.Как устроен метод. Схема нарисована по этой заметке.