HuggingFace 新模型 h3-vbvr 解决 image-to-video 任务
在 HuggingFace 上,2026 年 8 月 18 日发布了模型 Patarapoom/h3-vbvr,其任务是 image-to-video。截至发布时,它有 2434 次下载,没有一条“喜欢”标记。代码已开源。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
SPADE 无需微调即可加速视频扩散 Transformer 中的注意力机制研究人员推出了 SPADE——一种稀疏注意力引擎,无需微调模型即可加速视频扩散 Transformer 的推理。该论文于 2026 年 8 月 4 日发布在 arXiv 上。作者提出了三个组件:规格
VGI-Bench 用 810 个任务评估视频生成器的视觉推理能力arXiv 发布了 VGI-Bench 论文——一个包含 27 个任务和 810 个示例的基准测试,用于检验视频生成模型的视觉推理能力。作者构建了领域和技能的两级分类体系,要求模型不仅输出看似合理的
Minimax-H3-fl2va-ref2va-hybrid-models:HuggingFace 上的新 text-to-video 模型2026年8月11日,HuggingFace 上发布了模型 smhfacct/Minimax-H3-fl2va-ref2va-hybrid-models,任务为 text-to-video。截至发布时,该模型下载量为零,有 27 个“喜欢”标记。开发者既未说明架构,也未说明
4DStreamCtrl 在流式模式下统一控制相机、物体与深度arXiv 上发布了 4DStreamCtrl 的研究成果——一种交互式视频生成方法,将相机运动、物体轨迹和深度统一为 3D 点轨迹表示。作者在预训练模型之上训练 Geometric Motion Head