HuggingFace 上新模型 Minimax_h3_hybrid 解决 image-to-video 任务
HuggingFace 上发布了模型 abakanai/Minimax_h3_hybrid,用于根据图像生成视频(image-to-video)。该模型于 2026 年 8 月 9 日上线,截至发布时已有 2111 次下载和 6 个“喜欢”标记。开发者未说明架构、硬件要求、许可证和输出格式。
方法原理示意图。此图根据该简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
SQuad 加速 Wan 2.2 视频生成,注意力机制缩减 67 倍SQuad 的作者提出了一种用于视频扩散 Transformer 的 sub-quadratic attention 蒸馏方法。他们不是从头训练模型,而是分两个阶段蒸馏现成的完整尺寸模型 Wan 2.2 5B:Flow-Matching 监督微调和
LTX-Video 和 CogVideoX 通过合成视频获得新的 zero-shot 字幕生成方法研究人员在 arXiv 上发表了论文《Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning》,其中提出了用于 zero…
UniMoCa 将人体运动与相机控制统一为单一视觉表示研究人员推出了 UniMoCa——一种将人体运动和相机轨迹都转换为统一视觉表示(称为 Motion-Camera Visual Proxy,MCVP)的方法。该方法不再向模型输入异构信号
MoRoute 提出用于多模态视频生成的动态层路由方案MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)相结合。该方法允许每个块