作者在
Sci-VBench 中提出了一个用于评估科学领域视频生成的基准。它包含 1 253 个由专家标注的示例,涵盖自然科学、医疗健康、人文与社会科学以及工程学等 60 个学科。评估按评分标准进行,关键标准是 Prompt Grounding(提示词对齐)和 Scientific and Causal Correctness(科学与因果正确性)。作者测试了 16 个专有和开源模型,发现尽管视觉质量评分相近,但模型在科学和因果正确性上差异显著,且专有系统领先于开源系统。作者未公开代码。
这意味着什么
该基准直接涉及我们指南中的视频生成器,但文章中没有点名任何一款——作者只提到 16 个模型而未列出名单。因此,无法根据这项研究比较具体工具的结果。
不过,这一背景对
AI Video 板块的所有三个工具页面都很重要。
LTX-Video 是 Lightricks 推出的开源 image-to-video 模型,其参数表中没有关于它如何处理科学内容或因果关系的说明。
CogVideoX(智谱 CogVideoX)来自 Zhipu AI,解决的是 text-to-video 任务,其描述中也没有关于生成科学正确性的数据。
Pyramid Flow(快手 Pyramid Flow)是一款开源 text-to-video 模型,其参数表同样未反映科学推理能力。
作者关于专有与开源模型在科学正确性上存在差距的结论,在选择工具时应予以考虑,尤其是当任务不仅要求视觉逼真,还要求内容准确性时。不过,目前公开渠道中缺乏每个模型的具体数据。
方法的工作原理。示意图根据这篇简讯绘制。