CPU3D3D、视频与音频的 AI 工具

Alaya-EVOKE 发布线性扩展的长交互世界生成方法

arXiv 上发布了 Alaya-EVOKE 的研究论文,作者在其中解决了生成长交互式世界的问题。他们将场景状态提取到外部存储库中,按相机进行索引,并针对 long-horizon supervision 重新构建教师模型:通过按块分组进行稀疏注意力、采样远距离帧以及线性全局状态。这使得随着会话长度的增加,内存和计算量呈线性增长。作者未公开代码。更多详情 — 见论文页面

这意味着什么

该研究属于交互式世界生成领域,而非根据图像生成 3D 模型。它与我们指南中的工具没有直接交集:OpenLRMHunyuan3D(混元3D)2.1TRELLIS 解决的是 image-to-3d 任务——根据单张图像创建静态模型,不涉及会话、世界记忆或场景的交互式延续。 然而,该方法触及了生成式 3D 系统的一个共性问题:在生成范围扩大时保持上下文。我们工具的参数表中没有此类机制——它们都没有描述场景状态的外部存储或 long-horizon supervision。OpenLRM 和 TRELLIS 的上下文仅限于单个输入图像,Hunyuan3D(混元3D)2.1 则限于图像和文本描述。 目前这只是一项没有代码的研究工作,对我们工具的用户来说没有任何变化。如果该方法获得开源实现,它可能会影响未来的世界和视频生成器,但不会影响当前的 image-to-3d 流程。
Alaya-EVOKE:生成长期交互世界 输入 世界会话 相机帧 外部存储库 场景状态 按相机索引 教师模型 long-horizon supervision 世界 长期监督机制 稀疏注意力 按块分组 远帧采样 远帧 线性全局状态 线性内存增长 内存与计算线性增长
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读