SUV:将未来场景理解视为视频生成,实现端到端驾驶
2026年8月4日,arXiv 上发布了 SUV 论文——一种端到端驾驶框架,将未来场景理解视为视频生成任务。作者没有使用专门的预测模块,而是利用预训练的视频模型直接生成四个视频流:外观、语义、相对深度和物体动态。轨迹通过联合注意力机制对这些流的所有隐藏表示进行构建。在 NAVSIM-v2 基准测试中,该方法仅使用单目前置摄像头且无需遍历候选轨迹,在 navtest 上达到 91.0 EPDMS,在 navhard 上达到 36.9,在 WOD-E2E 上 RFS 为 7.94。在 arXiv 上了解更多
这意味着什么
SUV 并不是传统意义上的视频生成器——它是一个用于自动驾驶的感知与规划系统,内部使用视频生成模型来预测未来。它与我们AI Video 板块中的视频生成器的共同点仅在于架构方法:视频模型作为多种模态的通用预测器。
指南中的任何工具——LTX-Video、CogVideoX(智谱 CogVideoX)或 Pyramid Flow(快手 Pyramid Flow)——都不解决端到端驾驶问题,也不预测场景语义或深度。它们是按文本或图像生成视频的工具,可在消费级硬件上运行。而 SUV 是一个用于自动驾驶的研究框架,开发者未说明硬件要求和代码可用性。
这项工作表明,视频生成模型可以作为通用组件,用于远超娱乐范畴的任务,但目前与视频创作工具尚无实际交集。



