CPU3D3D、视频与音频的 AI 工具

GVCCTurbo 为生成式视频和图像压缩提出码率规划方案

arXiv 研究人员发布了 GVCCTurbo——一种调度器,它将生成式先验分布的昂贵更新与通过码本传递的修正分开。该方法不再将采样器步数硬性绑定到修正槽的数量,而是允许将比特率作为调度的一个输入参数来设定。该调度器兼容 rectified-flow 视频(GVCC 风格)和 diffusion 图像压缩(DDCM 风格),无需微调,并可与未来的蒸馏先验配合使用。在 720p 分辨率下使用 Wan-GVCC 的测试中,先验评估次数从 20 次减少到 9 次,解码时间节省约 44%,而动态场景中的 LPIPS 仅有小幅上升。

这意味着什么

这则新闻涉及的是生成式视频压缩,而非根据文本描述生成视频。在我们的指南中,没有工具解决通过码本进行视频压缩的问题。名称上最接近的工具是 Wan(通义万相)——这是阿里巴巴的一款视频生成器,基于 text-to-video 模型运行,而非编解码器。GVCCTurbo 仅将 Wan 用作测量解码速度的测试平台,并未改变模型本身,也未为其添加压缩功能。 这项工作对 视频生成 部分中的工具没有直接影响。它处于一个相邻领域——在超低比特率下依赖生成模型进行视频传输——该领域目前在我们的指南中尚未以单独的工具页面形式呈现。
GVCCTurbo — 生成式压缩的码率调度器 码率 输入参数 调度表 GVCCTurbo 调度器 划分更新 与修正 Prior 更新 生成式 先验分布 修正 通过码 昂贵 vs 轻量 兼容性 rectified-flow 视频 (GVCC) · 扩散压缩图像 (DDCM) · 未来蒸馏 priors 720p 测试,使用 Wan-GVCC Prior 评估:20 — 9 解码时间节省约 44% 动态场景中 LPIPS 小幅上升 无需微调 可与现有模型配合使用
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读