HuggingFace 上发布了一个模型
DANNY621/H3-World,其任务是 image-to-video。作者将其描述为基于 MiniMax-H3 的首个交互式世界模型:根据初始帧和键盘指令,它生成角色与相机运动一致的视频。该模型以 apache-2.0 许可证发布,最大的权重文件是 step-10000.safetensors,大小为 0.1 GB,权重格式为 safetensors。该检查点是一个 65.6M 参数的 LoRA 附加层,叠加在基础模型 MiniMax-H3 之上,需要其权重和定向注意力补丁才能运行。
这意味着什么
在我们的视频生成器指南中,有几个开源的 image-to-video 和 text-to-video 模型,可以与这款新模型进行比较。
LTX-Video 来自 Lightricks,是一款视频生成器,支持 image-to-video 任务,开源代码采用 Apache-2.0 许可证,最大的权重文件为 26.6 GB。作者声称仅需 1 GB 显存,并支持 macOS 上的 MPS。相比之下,H3-World 在权重上明显更轻:其 LoRA 文件仅占 0.1 GB,但运行仍需要基础模型 MiniMax-H3,而 H3-World 参数表中未注明其权重。
CogVideoX(智谱 CogVideoX)来自智谱 AI,解决 text-to-video 任务,开源代码采用 Apache-2.0 许可证,最大的权重文件为 9.2 GB。据作者描述,平台为 CUDA。H3-World 在任务(带控制的 image-to-video)和方法上均有所不同:不是完整模型,而是叠加在第三方基础模型之上的 LoRA 附加层。
Pyramid Flow(快手 Pyramid Flow)是一款 text-to-video 生成器,开源代码采用 MIT 许可证,最大的权重文件为 7.8 GB,并声称可在低于 8 GB 显存下运行。与 CogVideoX 一样,它是一个完整模型,而 H3-World 是一个参数高效的附加层。
H3-World 的亮点不在于规模,而在于方法:通过键盘指令交互式控制生成,并通过定向注意力将指令绑定到潜在区间。实际使用需要基础模型 MiniMax-H3 和带有补丁的官方仓库——没有它们,LoRA 检查点无法复现所声称的行为。
方法的工作原理。示意图根据这篇简讯绘制。