ViRDM 在 few-step 视频蒸馏中移除教师和评论器
ViRDM 的作者提出了一种无需判别器和评论器的视频生成器后训练方法,可降低显存占用。该工作于 2026 年 9 月 24 日发表在 arXiv 上。原本需要三个网络——教师、评论器和生成器——现在只剩下生成器,它被拟合到预先计算好的目标表示分布上。作者没有公开代码。
该方法的构成。示意图根据这条简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
Edge0 发布可在 3 GB 内存中运行的 35B MoE 模型HuggingFace 上发布了 Edge0-35B-A3B-preview——一款 35B 级别的文本模型,采用稀疏 MoE 架构。作者声称其解码速度达 15 token/s,而活跃内存占用低于 3 GB。这意味着什么 该模型
HelloWorld — 用于视频世界中与角色社交互动的模型研究人员推出了 HelloWorld——一种视频世界模型,用户可以与屏幕上的角色进行互动。按下按钮后,角色会对观众做出反应:转身、挥手、点头或说出一句简短的话。
流式说话头像:作者分离音频与渲染以加速生成arXiv 上发表了论文 Decoupled Self-Forcing Distillation for Streaming Talking Head Generation。作者提出,对于流式说话头像生成,不将音频直接与视频的每个像素绑定,而是在低维空间中进行条件融合。
VA-Judger:用于视频与音频联合生成的奖励模型研究人员推出了 VA-Judger —— 用于视频与音频联合生成系统后训练的奖励模型,以及包含 10.3 千对成对比较的数据集 VAPref-10K 和基准 VA-Judger-Bench。该工作于 2026 年 8 月 19 日发布。