FracGen учит генерацию видео разрушению объектов по физическим сигналам
Авторы FracGen представили модель генерации видео, которая по одному изображению целого объекта создаёт правдоподобную динамику разрушения, управляемую физическими сигналами. Для обучения построен симулятор FracSim на основе material point method с моделью повреждений, который выдаёт парные видео разрушения и плотные физические поля. Модель обучается предсказывать эти поля вместе с RGB-видео и дополнительно контролируется physics-informed потерями. Код авторы не выкладывали. Подробнее — в статье на arXiv.
Что это значит
FracGen — исследовательская работа, а не готовый инструмент из нашего справочника. В разделе генераторов видео нет моделей, заточенных под физически достоверное разрушение: Maestro решает задачу image-text-to-video, LTX-Video — image-to-video, CogVideoX — text-to-video. Ни один из них не предсказывает физические поля и не обучается с physics-informed потерями.
По паспортам видно, что ближайший по задаче — LTX-Video: он тоже работает от одного изображения, код открыт под Apache-2.0, а веса требуют всего 1 ГБ видеопамяти. Но его лицензия весов ограничивает коммерческое использование порогом выручки, а о физической симуляции разрушения в его описании речи нет. Maestro требует 12—24 ГБ видеопамяти и работает только на CUDA, CogVideoX ориентирован на NVIDIA H100 и выше.
Пока FracGen остаётся статьёй без кода и весов, сравнивать его с локальными инструментами по требованиям к железу или лицензии не с чем: автор не выкладывает ни репозиторий, ни модель, ни данные о видеопамяти. Если код появится, станет понятно, можно ли запускать такую генерацию на своём GPU и под какой лицензией.Как устроен метод. Схема нарисована по этой заметке.