CPU3D3D、视频与音频的 AI 工具

Sci-VBench:生成模型视频科学可信度基准

作者在 Sci-VBench 中提出了一个用于评估科学领域视频生成的基准。它包含 1 253 个由专家标注的示例,涵盖自然科学、医疗健康、人文与社会科学以及工程学等 60 个学科。评估按评分标准进行,关键标准是 Prompt Grounding(提示词对齐)和 Scientific and Causal Correctness(科学与因果正确性)。作者测试了 16 个专有和开源模型,发现尽管视觉质量评分相近,但模型在科学和因果正确性上差异显著,且专有系统领先于开源系统。作者未公开代码。

这意味着什么

该基准直接涉及我们指南中的视频生成器,但文章中没有点名任何一款——作者只提到 16 个模型而未列出名单。因此,无法根据这项研究比较具体工具的结果。 不过,这一背景对 AI Video 板块的所有三个工具页面都很重要。LTX-Video 是 Lightricks 推出的开源 image-to-video 模型,其参数表中没有关于它如何处理科学内容或因果关系的说明。CogVideoX(智谱 CogVideoX)来自 Zhipu AI,解决的是 text-to-video 任务,其描述中也没有关于生成科学正确性的数据。Pyramid Flow(快手 Pyramid Flow)是一款开源 text-to-video 模型,其参数表同样未反映科学推理能力。 作者关于专有与开源模型在科学正确性上存在差距的结论,在选择工具时应予以考虑,尤其是当任务不仅要求视觉逼真,还要求内容准确性时。不过,目前公开渠道中缺乏每个模型的具体数据。
Sci-VBench:评估视频科学可信度 输入数据 1 253 个示例 60 个学科 专家标注 按类别评估 Prompt Grounding Scientific and Causal Correctness 测试 16 个模型 专有与 开源 结果 视觉质量 各模型相近 科学正确性 差异显著 差距 专有模型 领先开源 在科学及 因果推理方面 局限 未公开模型名称 未发布代码 无各模型 具体数据 结论 选择工具时需考虑差距,尤其在内容准确性重要的任务中
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读