Hunyuan3D 2.1 无需 CUDA:更新新增 ROCm 和 PBR 纹理
非 CUDA 硬件的 Hunyuan3D 2.1 移植版于 2026 年 8 月 9 日更新,新增了此前完全没有的功能:通过 ROCm 支持 AMD 显卡(Linux 和 Windows)以及 PBR 纹理。旧版描述曾明确表示,没有 CUDA 就无法进行纹理处理;现在,该功能已在 AMD 和 Apple Silicon 上从头到尾验证通过。
该移植版本身是围绕腾讯原版 Hunyuan3D 2.1 的安装程序、兼容层和基于 Gradio 的 Web 界面。输入一张图片,输出为七种格式之一的网格(obj、glb、ply、stl、fbx、dae、3mf),现在还可输出纹理:带真实 PBR 材质的 GLB,或包含 OBJ、MTL 和贴图的压缩包。
利益披露。 该仓库由 Vladimir Talyzin 维护——他也是 cpu3d.com 的作者和所有者。我们撰写关于自己工作的内容,并明确说明这一点:以下所有数字均来自仓库描述,原始来源链接已在上方给出,任何人都可以核实。
更新内容
- 无 CUDA 的 PBR 纹理。生成 albedo 和 metallic-roughness 贴图,并烘焙 UV——已在 ROCm 和 Apple MPS 上验证。
- 无需编译器的光栅化器——基于纯 PyTorch 实现。正是这一点使得在 Windows 上进行纹理处理成为可能:那里的 ROCm 版 PyTorch 根本无法链接 C++ 扩展。
- 可放入内存的注意力机制。分块 SDPA 在没有 flash attention 的显卡上保持峰值内存占用,且结果与不分块时逐位一致。
- 启动前检查,拒绝而非崩溃。超出显卡承受能力的设置会被拒绝并附上说明:在 ROCm 上是因为否则会导致驱动重置,在 MPS 上是因为 Metal 根本无法分配这样的缓冲区。

耗时
两台机器上使用相同的输入和相同的设置。两者都是该模型的最坏情况:都没有 flash attention,因此都使用“Safe”预设计算,即 6 个视角,每个 256 点。
| 步骤 | Radeon 8060S(gfx1151,Windows,ROCm 7.2) | Apple M4 Pro,24 GB |
|---|---|---|
| 形状:30 步,八叉树 192 | 约 6.4 分钟 | 5.7 分钟 |
| PBR 纹理:6 个视角,256 点 | 约 2.5 分钟 | 8.5 分钟 |
| 光栅化:8 万面,2048x2048 | 约 80 毫秒 | 152 毫秒 |
请注意:Radeon 8060S 是集成显卡,其纹理处理速度比 Mac 更快。在 24 GB 的 M4 Pro 上,此阶段内存紧张,运行会占用约 8 GB 的交换空间。

为什么纹理以 256 点而非 768 点计算
问题不在于内存容量,而在于其增长方式。多视角注意力将所有视角拼接成一个序列,注意力矩阵呈二次方增长。这是实测而非估算:6 个视角,每个 256 点——4.2 GiB,可完整计算;6 个视角,每个 512 点——67.5 GiB,机器卡死;8 个视角,每个 768 点——607.5 GiB,毫无希望。因此,在没有 flash attention 的硬件上使用“Safe”预设,而启动前检查会拒绝所有超出限制的设置:在 ROCm 上限制为 5 GiB。
Windows 特有的坑
显示驱动有一个看门狗:如果显卡上的某个操作在 2 秒内未返回,Windows 会重置 GPU。进程不会崩溃——它会在一个现在返回错误数字的显卡上继续计算。此类重置后,1024x1024 的全 1 矩阵乘法结果为 947.3,而非 1024,尽管总和仍然准确。网格和纹理会在静默中损坏,看起来像是流水线本身的错误。解决方法是将 TdrDelay 提高到 60 秒,而 scripts/doctor.py 会单独检查显卡是否仍在正确计算。
安装要求
每个平台都有对应的安装程序:Apple Silicon 使用 install.sh,Linux 下的 AMD 使用 scripts/install_rocm.sh,Windows 下的 AMD 使用 scripts/install_rocm_windows.ps1。需要下载约 30 GB 的权重:形状约 15 GB,纹理 6.5 GB,facebook/dinov2-giant 4.5 GB。界面已翻译为英语、中文和俄语。
这里有两个许可证,这一点很重要。权重采用腾讯混元 3D 2.1 社区许可证:不适用于欧盟、英国和韩国,商业使用限制为每月 1 亿活跃用户。包装代码本身采用 MIT 许可证,单独文件提供。
这对指南意味着什么
在我们的指南中,此移植版以工具页面形式收录,名为 Hunyuan3D 2.1 无 CUDA(Mac 和 AMD)。参数表和工具页面文本已根据更新后的仓库重新整理:平台现在包括 Apple Silicon、MPS 和 ROCm,导出格式为七种,并在形状生成之外增加了纹理处理。作为这一切基础的原始模型在单独页面中介绍——Hunyuan3D 2.1。
此次更新的实际意义很简单:此前,在自己的硬件上将图片转换为纹理模型,要么用 NVIDIA,要么根本不行。现在,AMD 集成显卡和 Apple Silicon 笔记本也能走通同样的路径——速度较慢,但完全在本地完成,无需云服务,也不受他人配额限制。



