Minimax-H3-fl2va-ref2va-hybrid-models:HuggingFace 上的新 text-to-video 模型
2026年8月11日,HuggingFace 上发布了模型 smhfacct/Minimax-H3-fl2va-ref2va-hybrid-models,任务为 text-to-video。截至发布时,该模型下载量为零,有 27 个“点赞”。开发者既未说明架构,也未说明硬件要求,更未说明输出文件格式。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
VA-Judger:用于视频与音频联合生成的奖励模型研究人员推出了 VA-Judger —— 用于视频与音频联合生成系统后训练的奖励模型,以及包含 10.3 千对成对比较的数据集 VAPref-10K 和基准 VA-Judger-Bench。该工作于 2026 年 8 月 19 日发布。
KeyID 提出免微调的身份保持视频生成方法arXiv 上发布了 KeyID 的工作——一种 training-free 框架,用于 identity-preserving video generation,它将视频动态合成与身份嵌入分离。作者建议首先生成不绑定特定人物的草稿视频,然后……
AnyTalk 为任意角色生成 3D 语音动画,无需动画数据研究人员推出了 AnyTalk——一种为任意角色生成 3D 语音动画的方法,既不需要动画数据,也不需要手动绑定。取而代之的是,作者在目标角色的渲染结果上对现成的 video diffusion model 进行微调。
Token Radius Attention 无需微调即可加速扩散 Transformer 中的视频生成北京大学的研究人员提出了 Token Radius Attention (TRA)——一种在 Video Diffusion Transformers 中减少计算量的方法,无需重新训练模型。该论文于 2026 年 8 月 3 日发布在 arXiv 上。A