LTX-Video 与 CogVideoX 目前尚无法解决单视频中多对象生成问题
arXiv 上发表了一项对比研究,探讨了三种无需微调即可生成包含多个对象的视频的方法:直接生成、并行生成和顺序生成。作者分析了每种方法在保持对象外观、动作一致性以及对象间交互方面的表现,并描述了典型的失败模式。作者未公开代码。更多详情见 arXiv 上的论文。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
LTX-Video、CogVideoX 和 Pyramid Flow 按八项标准尚未达到模拟器水平arXiv 上系统综述的作者分析了 2018 年至 2026 年 6 月间 200 篇关于生成式世界模型的研究,并按八项能力将其与传统模拟器进行比较:资产构建、物理引擎、交互
Latent-to-4D 直接从视频潜变量生成4D场景,无需中间RGB步骤论文《Beyond Pixels: From Video Priors to 4D Worlds》的作者提出了 Latent-to-4D 方法,该方法跳过了 RGB 视频重建阶段,直接从视频模型的最终去噪潜变量预测动态 3D 场景。该方法基于
VA-Judger:用于视频与音频联合生成的奖励模型研究人员推出了 VA-Judger —— 用于视频与音频联合生成系统后训练的奖励模型,以及包含 10.3 千对成对比较的数据集 VAPref-10K 和基准 VA-Judger-Bench。该工作于 2026 年 8 月 19 日发布。
VGI-Bench 用 810 个任务评估视频生成器的视觉推理能力arXiv 发布了 VGI-Bench 论文——一个包含 27 个任务和 810 个示例的基准测试,用于检验视频生成模型的视觉推理能力。作者构建了领域和技能的两级分类体系,要求模型不仅输出看似合理的