HuggingFace 新模型 h3-vbvr 解决 image-to-video 任务
在 HuggingFace 上,2026 年 8 月 18 日发布了模型 Patarapoom/h3-vbvr,其任务是 image-to-video。截至发布时,它有 2434 次下载,没有一条“喜欢”标记。代码已开源。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
NVIDIA 在 HuggingFace 上发布用于立体像对深度估计的模型 c-foundationstereo-sNVIDIA 在 HuggingFace 上发布了任务为 depth-estimation 的模型 c-foundationstereo-s。这是 FoundationStereo——一款根据立体相机的一对 RGB 图像进行深度估计的模型,输出视差图。开发者将其定位
流式说话头像:作者分离音频与渲染以加速生成arXiv 上发表了论文 Decoupled Self-Forcing Distillation for Streaming Talking Head Generation。作者提出,对于流式说话头像生成,不将音频直接与视频的每个像素绑定,而是在低维空间中进行条件融合。
LiquidAI 发布 d1-3B——无需生成文本、单次前向即可决策的模型2026 年 10 月 5 日,LiquidAI/d1-3B 模型在 HuggingFace 上发布,任务类型为 image-text-to-text。这是一个拥有 31 亿参数的决策模型,基于 LFM2.5-VL-3B 构建:输入为状态——文本、JSON、图像或其混
Spectral Transport Homeostasis 方法无需修正视频时间一致性研究团队在 arXiv 上发表了一篇关于视频生成中时间一致性诊断与修正的论文。作者引入了 Spectral Tension 这一有符号诊断指标,用于比较局部散度