Alaya-EVOKE 发布线性扩展的长交互世界生成方法
arXiv 上发布了 Alaya-EVOKE 的研究论文,作者在其中解决了生成长交互式世界的问题。他们将场景状态提取到外部存储库中,按相机进行索引,并针对 long-horizon supervision 重新构建教师模型:通过按块分组进行稀疏注意力、采样远距离帧以及线性全局状态。这使得随着会话长度的增加,内存和计算量呈线性增长。作者未公开代码。更多详情 — 见论文页面。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
VideoArgus 提出基于评分标准的视频生成与编辑统一评估系统研究人员在 arXiv 论文中介绍了 VideoArgus——一个用于评估生成及编辑视频质量的框架。与依赖固定内容的现有基准不同,VideoArgus 针对每个
音视频生成获得兼顾音画同步的加速方法论文《Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention》的作者提出了一种加速推理的方法,适用于同时生成视频和音频的模型。他们发现,双向 cross-attenti
Latent-to-4D 直接从视频潜变量生成4D场景,无需中间RGB步骤论文《Beyond Pixels: From Video Priors to 4D Worlds》的作者提出了 Latent-to-4D 方法,该方法跳过了 RGB 视频重建阶段,直接从视频模型的最终去噪潜变量预测动态 3D 场景。该方法基于
LTX-Video 和 CogVideoX 通过合成视频获得新的 zero-shot 字幕生成方法研究人员在 arXiv 上发表了论文《Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning》,其中提出了用于 zero…