VGI-Bench 用 810 个任务评估视频生成器的视觉推理能力
arXiv 发布了 VGI-Bench 的研究论文——这是一个包含 27 个任务和 810 个示例的基准测试,用于检验视频生成模型的视觉推理能力。作者构建了领域和技能的两级分类体系,要求模型不仅生成合理的最终帧,还要正确展现过程的发展,并校准难度,使任务保持部分可解性。在测试的系统中,表现最强的 Seedance 2.0 在基准标准下得分 51.0%。作者未公开代码。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
LTX-Video 与 CogVideoX 目前尚无法解决单视频中多对象生成问题arXiv 上发表了一项对比研究,探讨三种无需微调即可生成包含多个对象的视频的方法:直接生成、并行生成和顺序生成。作者分析了每种方法在保持对象外观一致性方面的表现
LeFlow 通过生成式潜在先验将 world models 中的规划速度提升一个数量级研究人员推出了 LeFlow——一种将 latent world models 中的迭代轨迹优化替换为生成式规划的方法。LeFlow 不再为每一对“状态—目标”从头运行优化器,而是学习
MegaParts 将 3D 对象按部件生成扩展至 300 个零件研究人员推出了 MegaParts——一个用于生成分解为语义部件的 3D 对象的框架。该方法的核心是一个向量量化分词器,它将每个部件的几何形状压缩为具有自适应长度的离散令牌。
Sci-VBench:生成模型视频科学可信度基准Sci-VBench 作者提出了一个用于评估科学领域视频生成的基准。该基准包含 1 253 个由专家标注的示例,涵盖自然科学、医疗健康、人文与社会科学以及工程学等 60 个学科