HuggingFace 新模型 h3-vbvr 解决 image-to-video 任务
在 HuggingFace 上,2026 年 8 月 18 日发布了模型 Patarapoom/h3-vbvr,其任务是 image-to-video。截至发布时,它有 2434 次下载,没有一条“喜欢”标记。代码已开源。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
Sci-VBench:生成模型视频科学可信度基准Sci-VBench 作者提出了一个用于评估科学领域视频生成的基准。该基准包含 1 253 个由专家标注的示例,涵盖自然科学、医疗健康、人文与社会科学以及工程学等 60 个学科
基于扩散的视频去反射新方法简讯研究人员发布了论文 From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection,该论文于 2026 年 8 月 12 日发表。作者描述了一个由三个组件…
AnyTalk 为任意角色生成 3D 语音动画,无需动画数据研究人员推出了 AnyTalk——一种为任意角色生成 3D 语音动画的方法,既不需要动画数据,也不需要手动绑定。取而代之的是,作者在目标角色的渲染结果上对现成的 video diffusion model 进行微调。
Latent-to-4D 直接从视频潜变量生成4D场景,无需中间RGB步骤论文《Beyond Pixels: From Video Priors to 4D Worlds》的作者提出了 Latent-to-4D 方法,该方法跳过了 RGB 视频重建阶段,直接从视频模型的最终去噪潜变量预测动态 3D 场景。该方法基于