研究人员发布了 VA-Judger——一种用于视频与音频联合生成系统后训练的奖励模型,同时发布了包含 10.3 万对成对比较的 VAPref-10K 数据集和 VA-Judger-Bench 基准。该工作于 2026 年 8 月 19 日发表在
arXiv 上。作者指出,现有指标分别评估音质、视觉准确性和同步性,无法捕捉文本提示、视频和音频之间的整体语义与时间连贯性。VA-Judger 采用分阶段训练:首先在质量差异明显的样本对上进行训练,然后通过带人工标注校验的拒绝采样处理更复杂的比较,最后执行逐维度强化学习。代码已开源。
这意味着什么
这条新闻涉及视频生成的整体主题——在我们的
AI Video 板块中收录了 text-to-video 和 image-to-video 工具。VA-Judger 不是生成器,而是一种用于评估和后训练生成系统的奖励模型,因此它与我们的工具页面没有直接交集。
在指南的工具中,与 text-to-video 任务最接近的是
CogVideoX(智谱 CogVideoX)和
Pyramid Flow(快手 Pyramid Flow)。两者都是开源视频生成器,但它们的参数表中没有关于音频支持或使用奖励模型进行后训练的信息。
LTX-Video 解决的是 image-to-video 任务,同样未提及音频处理。
视频与音频的联合生成是一个独立方向,目前我们的参数表中尚未覆盖。如果 VA-Judger 作为后训练组件得到广泛应用,可能会影响未来版本的生成器,但这条新闻对当前指南中的工具页面没有影响。