研究人员发布了 VideoArgus——一个用于评估生成和编辑视频质量的框架,相关论文见
arXiv。与现有绑定固定内容的基准不同,VideoArgus 为每个输入实例创建个性化的评分标准,包含具体准则、评估规则和证据收集计划。在此基础上,VLM 模型和视觉工具给出评分并生成诊断报告。作者还准备了 VideoArgus-Bench——一组由高质量图像和视频组成的输入数据集,并预先生成和固定了评分标准。在与人类评估对比的独立样本上,VideoArgus 在五项任务中均表现出比专用评估器更高的人类意见相关性。
这意味着什么
这条消息并不直接改变我们
视频生成器指南中工具的功能,但涉及评估其表现的话题。
VideoArgus 覆盖视频生成和编辑的五种场景。在我们的参数表中,
LTX-Video 标注的任务是 image-to-video,
CogVideoX(智谱 CogVideoX) 是 text-to-video,
Pyramid Flow(快手 Pyramid Flow) 是 text-to-video。这些工具均未内置结果评估功能,因此 VideoArgus 可视为一种外部比较其输出的方式。
作者指出,在更换用于生成评分标准和评估的 VLM 模型时,模型排名基本保持稳定。这表明该方法适用于比较不同生成器,包括我们指南中收录的那些。
该框架和基准已开源,任何人都可以用统一的方法测试自己的模型或比较第三方方案。