Alaya-EVOKE 发布线性扩展的长交互世界生成方法
arXiv 上发布了 Alaya-EVOKE 的研究论文,作者在其中解决了生成长交互式世界的问题。他们将场景状态提取到外部存储库中,按相机进行索引,并针对 long-horizon supervision 重新构建教师模型:通过按块分组进行稀疏注意力、采样远距离帧以及线性全局状态。这使得随着会话长度的增加,内存和计算量呈线性增长。作者未公开代码。更多详情 — 见论文页面。
方法的工作原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
HuggingFace 上的新模型 Minimax_h3_hybrid 解决 image-to-video 任务HuggingFace 上发布了模型 abakanai/Minimax_h3_hybrid,用于根据图像生成视频(image-to-video)。该模型于 2026 年 8 月 9 日出现,发布时已有 2111 次下载和 6 个“喜欢”标记。开发
Qwen(通义千问)发布用于改写提示词的模型 Qwen-Image-2.1-PE-T2I2026 年 9 月 20 日,模型 Qwen/Qwen-Image-2.1-PE-T2I 在 HuggingFace 上发布。它不是图像生成器,而是用于准备请求的辅助模型:它接收任意语言的简短描述,并将其转换为详细的
Qwen-Video-Edit 将图像编辑模型转变为视频编辑器阿里巴巴发布了 Qwen-Video-Edit——一种将基于指令的图像编辑模型 Qwen-Image-Edit 应用于视频、而无需从头训练视频生成基础模型的方法。Wan 2.1 视频编码器的潜在帧被分解为
FreqForcing 将自回归视频生成延长至两分钟,无需微调2026 年 7 月 29 日,arXiv 上发布了论文 FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring。作者研究了自回归视频扩散模型的问题:在逐帧生成时,误差会累积,