HuggingFace 上线 LTX-2.5 模型,支持 text-to-video 任务
HuggingFace 上发布了一个模型 yuvraj108c/LTX-2.5,任务为 text-to-video。发布日期为 2026 年 8 月 12 日。截至本简讯发布时,该模型有 1445 次下载和零个“喜欢”标记。代码已开源。
方法的工作原理。示意图根据此简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
Latent-to-4D 直接从视频潜变量生成4D场景,无需中间RGB步骤论文《Beyond Pixels: From Video Priors to 4D Worlds》的作者提出了 Latent-to-4D 方法,该方法跳过了 RGB 视频重建阶段,直接从视频模型的最终去噪潜变量预测动态 3D 场景。该方法基于
Sand AI 发布 MAGI-2-preview:HuggingFace 上的新开源 image-to-video 模型HuggingFace 上发布了 sand-ai/MAGI-2-preview —— Sand AI 的图像转视频生成器的预览版。该模型解决 image-to-video 任务,代码已开源。截至 2026 年 8 月 3 日发布时,其
Vorch-Streamer 将头像生成转化为实时流式视频arXiv 发布了 Vorch-Streamer 的研究成果——一种后训练方法,能够根据文本实时生成带音频的视频。作者解决了两个问题:自回归生成长视频时的误差累积,以及同步
Token Radius Attention 无需微调即可加速扩散 Transformer 中的视频生成北京大学的研究人员提出了 Token Radius Attention (TRA)——一种在 Video Diffusion Transformers 中减少计算量的方法,无需重新训练模型。该论文于 2026 年 8 月 3 日发布在 arXiv 上。A