CPU3D3D、视频与音频的 AI 工具

H3-World:基于 MiniMax-H3 的交互式 image-to-video 模型

HuggingFace 上发布了一个模型 DANNY621/H3-World,其任务是 image-to-video。作者将其描述为基于 MiniMax-H3 的首个交互式世界模型:根据初始帧和键盘指令,它生成角色与相机运动一致的视频。该模型以 apache-2.0 许可证发布,最大的权重文件是 step-10000.safetensors,大小为 0.1 GB,权重格式为 safetensors。该检查点是一个 65.6M 参数的 LoRA 附加层,叠加在基础模型 MiniMax-H3 之上,需要其权重和定向注意力补丁才能运行。

这意味着什么

在我们的视频生成器指南中,有几个开源的 image-to-video 和 text-to-video 模型,可以与这款新模型进行比较。 LTX-Video 来自 Lightricks,是一款视频生成器,支持 image-to-video 任务,开源代码采用 Apache-2.0 许可证,最大的权重文件为 26.6 GB。作者声称仅需 1 GB 显存,并支持 macOS 上的 MPS。相比之下,H3-World 在权重上明显更轻:其 LoRA 文件仅占 0.1 GB,但运行仍需要基础模型 MiniMax-H3,而 H3-World 参数表中未注明其权重。 CogVideoX(智谱 CogVideoX)来自智谱 AI,解决 text-to-video 任务,开源代码采用 Apache-2.0 许可证,最大的权重文件为 9.2 GB。据作者描述,平台为 CUDA。H3-World 在任务(带控制的 image-to-video)和方法上均有所不同:不是完整模型,而是叠加在第三方基础模型之上的 LoRA 附加层。 Pyramid Flow(快手 Pyramid Flow)是一款 text-to-video 生成器,开源代码采用 MIT 许可证,最大的权重文件为 7.8 GB,并声称可在低于 8 GB 显存下运行。与 CogVideoX 一样,它是一个完整模型,而 H3-World 是一个参数高效的附加层。 H3-World 的亮点不在于规模,而在于方法:通过键盘指令交互式控制生成,并通过定向注意力将指令绑定到潜在区间。实际使用需要基础模型 MiniMax-H3 和带有补丁的官方仓库——没有它们,LoRA 检查点无法复现所声称的行为。
H3-World:交互式 image-to-video 模型 基于 MiniMax-H3 的 LoRA 附加层,通过键盘控制 输入 初始帧 指令 LoRA 附加层 LoRA 65.6M 参数 文件 0.1 GB 基础模型 H3 MiniMax-H3 权重未注明 补丁 定向 注意 视频生成 角色与镜头 协调运动 输出 按键盘指令 控制的视频 对比: LTX-Video — 26.6 GB CogVideoX(智谱 CogVideoX)— 9.2 GB Pyramid Flow(快手 Pyramid Flow)— 7.8 GB H3-World — 0.1 GB(LoRA)
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读