HuggingFace 上线 LTX-2.5 模型,支持 text-to-video 任务
HuggingFace 上发布了一个模型 yuvraj108c/LTX-2.5,任务为 text-to-video。发布日期为 2026 年 8 月 12 日。截至本简讯发布时,该模型有 1445 次下载和零个“喜欢”标记。代码已开源。
方法的工作原理。示意图根据此简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
Sci-VBench:生成模型视频科学可信度基准Sci-VBench 作者提出了一个用于评估科学领域视频生成的基准。该基准包含 1 253 个由专家标注的示例,涵盖自然科学、医疗健康、人文与社会科学以及工程学等 60 个学科
4DStreamCtrl 在流式模式下统一控制相机、物体与深度arXiv 上发布了 4DStreamCtrl 的研究成果——一种交互式视频生成方法,将相机运动、物体轨迹和深度统一为 3D 点轨迹表示。作者在预训练模型之上训练 Geometric Motion Head
DiffVC-ONE 推出基于 Video DiT 的单步视频扩散压缩arXiv 发布了 DiffVC-ONE 论文——基于单步 Video Diffusion Transformer 的生成式视频压缩框架。作者宣称包含三个组件:用于压缩潜在切片的 Unified Unidirectional Latent Compressor、One-Ste
LichtFeld-Studio 发布原生 lfw 格式的 MoGe-3 ViT-L 权重LichtFeld-Studio 发布了一个版本,包含原生 .lfw 格式的 MoGe-3 ViT-L base 权重。这是 SLAM 流水线和 preprocess CLI 的默认深度模型。该版本被标记为 pre-release,只是为了不进入 Latest 徽章:这是 p