CPU3D3D、视频与音频的 AI 工具

ManifoldSplat 用文本在 90 秒内编辑 3D 头部形状

研究人员提出了 ManifoldSplat —— 一种对从单目视频重建的可动画 3D 头部进行语言编辑形状的方法。它不直接优化高斯点云,而是在结构化的 FLAME 流形内部进行编辑,从而保持身份特征和动画。作者声称在消费级 GPU 上约 90 秒即可完成头像的重建和编辑,渲染速度约为 800 FPS。截至发布时,代码尚未公开。

这意味着什么

ManifoldSplat 解决的是我们AI 3D 板块中没有的任务:它不是根据图像生成模型,而是通过文本命令对已有头像进行语义编辑。主题上最接近的工具——Hunyuan3D 2.1、Stable Fast 3D 和 OpenLRM——都是作为 image-to-3d 生成器工作:它们从零创建静态模型,但无法根据文本描述改变其形状,也不与动画绑定。 根据我们工具的参数字表:Hunyuan3D 2.1 根据阶段不同需要 10 到 29 GB 显存,Stable Fast 3D 约需 6 GB,OpenLRM 未指明确切要求,但提到了 CUDA OOM。ManifoldSplat 的作者将其定位为可在消费级 GPU 上运行,但未说明具体显存容量。作者也未指明许可证和模型权重,代码目前也不可用。 目前既没有仓库也没有模型权重,无法在自己的硬件上验证所声称的 90 秒和 800 FPS。如果代码出现,这将是我们领域中第一个用于对可动画头部进行文本编辑形状、而非生成静态模型的工具。
单目视频 单相机帧 高斯3D头部 3D高斯点云 带动画绑定 FLAME流形 结构化 形状空间 文本指令 “把鼻子变宽” 编辑后的虚拟形象 形状已改,绑定完好 约 90 秒 重建 + 编辑 在消费级 GPU 上 约 800 FPS 渲染速度 交互式动画 代码与权重未公开 暂无法验证所宣称指标
方法的结构。示意图根据本简讯绘制。

相关阅读