CPU3D3D、视频与音频的 AI 工具

SUV:将未来场景理解视为视频生成,实现端到端驾驶

2026年8月4日,arXiv 上发布了 SUV 论文——一种端到端驾驶框架,将未来场景理解视为视频生成任务。作者没有使用专门的预测模块,而是利用预训练的视频模型直接生成四个视频流:外观、语义、相对深度和物体动态。轨迹通过联合注意力机制对这些流的所有隐藏表示进行构建。在 NAVSIM-v2 基准测试中,该方法仅使用单目前置摄像头且无需遍历候选轨迹,在 navtest 上达到 91.0 EPDMS,在 navhard 上达到 36.9,在 WOD-E2E 上 RFS 为 7.94。在 arXiv 上了解更多

这意味着什么

SUV 并不是传统意义上的视频生成器——它是一个用于自动驾驶的感知与规划系统,内部使用视频生成模型来预测未来。它与我们AI Video 板块中的视频生成器的共同点仅在于架构方法:视频模型作为多种模态的通用预测器。

指南中的任何工具——LTX-VideoCogVideoX(智谱 CogVideoX)Pyramid Flow(快手 Pyramid Flow)——都不解决端到端驾驶问题,也不预测场景语义或深度。它们是按文本或图像生成视频的工具,可在消费级硬件上运行。而 SUV 是一个用于自动驾驶的研究框架,开发者未说明硬件要求和代码可用性。

SUV:场景未来即视频生成 前置摄像头 单张图像 预训练 视频模型 通用预测器 4 路视频流 外观 语义 相对深度 物体动态 联合 注意力 运动轨迹 无需候选遍历 基准测试结果 NAVSIM-v2 navtest: 91.0 EPDMS navhard: 36.9 WOD-E2E RFS: 7.94 端到端驾驶:从单图到轨迹,经未来生成
方法原理图。示意图根据这篇简讯绘制。

这项工作表明,视频生成模型可以作为通用组件,用于远超娱乐范畴的任务,但目前与视频创作工具尚无实际交集。

相关阅读