研究人员提出了 SparsePR —— 一种用于视频生成器和 world models 的 training-free block-sparse attention 方法。该论文于 2026 年 8 月 19 日发布在 arXiv 上,
项目页面包含补充材料。作者表明,分块几何结构既影响合并后的 support,也影响 softmax 之后残差误差的可预测性。SparsePR 将 Response-Coupled Partitioning 与 Probe-Fitted Residual Reconstruction 相结合:键对采样查询的响应形成成对的 K/V 组,而一小部分精确的查询行则用于校准仿射校正。在四个视频生成器和 world models 上,该方法降低了注意力重建误差,在 22–26% 的 executed-pair density 下保持生成质量,并将推理速度提升 1.48–2.61 倍。作者未公开代码。
这意味着什么
SparsePR 是一种加速方法,而不是独立的生成器。它适用于视频 transformer,因此在我们的指南中,应将其与
视频生成器板块中的工具结合来看。
在我们的工具页面中,该方法的直接目标可能是基于 diffusion transformer 的模型。
LTX-Video 使用 DiT 架构且为开源 —— 从技术上讲,SparsePR 可以集成到此类管线中,但该方法作者未发布实现,LTX-Video 的仓库中也没有相关内容。
CogVideoX(智谱 CogVideoX)同样基于 transformer 架构,但其仓库中未提及稀疏注意力。
Pyramid Flow(快手 Pyramid Flow) 使用金字塔 flow matching —— 这是另一种提升效率的方法,工具参数表中也没有关于与 block-sparse attention 兼容性的数据。
SparsePR 目前尚无实际应用:代码未公开,也未声明与上述工具的集成。适用性评估仍停留在架构兼容性层面,具体模型的开发者并未确认这一点。
方法的工作原理。示意图根据这篇简讯绘制。