FracGen 的作者提出了一种视频生成模型,它能根据单个完整物体的图像,生成由物理信号驱动的、可信的破坏动态。为了训练,作者构建了基于 material point method 并带有损伤模型的模拟器 FracSim,它能输出成对的破坏视频和稠密物理场。该模型学习在预测 RGB 视频的同时预测这些物理场,并额外受到 physics-informed 损失的约束。作者没有公开代码。详见
arXiv 上的论文。
这意味着什么
FracGen 是一项研究工作,而不是我们指南中的现成工具。在
视频生成器栏目中,没有专门针对物理上可信破坏的模型:
Maestro 解决的是 image-text-to-video 任务,
LTX-Video 是 image-to-video,
CogVideoX(智谱 CogVideoX) 是 text-to-video。它们中没有一个能预测物理场,也没有一个用 physics-informed 损失进行训练。
从参数表可以看出,任务上最接近的是 LTX-Video:它同样从单张图像工作,代码以 Apache-2.0 开源,而模型权重只需要 1 GB 显存。但它的权重许可证以营收门槛限制商业使用,而且其描述中完全没有提到物理破坏模拟。Maestro 需要 12—24 GB 显存,且只能在 CUDA 上运行,CogVideoX 则面向 NVIDIA H100 及以上。
在 FracGen 仍是一篇没有代码和权重的论文的情况下,无法就硬件要求或许可证把它与本地工具进行比较:作者既没有公开仓库,也没有公开模型,也没有公开显存数据。如果代码出现,就能知道这种生成能否在自己的 GPU 上运行,以及依据什么许可证。
该方法的结构。示意图根据这篇简讯绘制。