NVIDIA 在 HuggingFace 上发布了模型
c-foundationstereo-s,任务为 depth-estimation。这就是 FoundationStereo——一款根据立体相机拍摄的一对 RGB 图像进行深度估计的模型,输出为视差图。开发者将其定位为面向工业、机器人技术和智能空间、具有强大 zero-shot 泛化能力的解决方案。
这意味着什么
最大的权重文件为 0.8 GB,格式为 ONNX,仓库总计 4.1 GB,此外还有 PTH 格式的权重。模型通过 TensorRT 运行。许可证为 NVIDIA Open Model License:允许商业使用,可以创建和分发衍生模型,但分发时必须附上许可证文本和注明署名的 Notice 文件。使用必须符合 NVIDIA 的 Trustworthy AI 条件,禁止绕过模型的技术限制和防护机制。
开发者未明确说明具体的显存要求,但主文件 0.8 GB 的体积以及面向 TensorRT 的定位表明,该模型面向在配备 NVIDIA GPU 的本地硬件上运行。可以在
CPU3D 动态中关注此类模型的出现。
该方法的原理。示意图根据这篇简讯绘制。