神经网络新闻:3D、视频及可在自己硬件上运行的语言模型
关于工具变化的简讯:发布了新版本、许可证变更、新增对其他平台的支持。不转述新闻稿:如果某个说法无法关联到代码仓库、模型页面或官方网站,就不会发布简讯。
文章
132 篇文章
SPADE 无需微调即可加速视频扩散 Transformer 中的注意力机制研究人员推出了 SPADE——一种稀疏注意力引擎,无需微调模型即可加速视频扩散 Transformer 的推理。该论文于 2026 年 8 月 4 日发布在 arXiv 上。作者提出了三个组件:规格
SUV:将未来场景理解视为视频生成,实现端到端驾驶2026年8月4日,arXiv上发布了SUV——一个端到端驾驶框架,将未来场景理解视为视频生成任务。作者没有使用专门的预测模块,而是采用预训练视觉
Token Radius Attention 无需微调即可加速扩散 Transformer 中的视频生成北京大学的研究人员提出了 Token Radius Attention (TRA)——一种在 Video Diffusion Transformers 中减少计算量的方法,无需重新训练模型。该论文于 2026 年 8 月 3 日发布在 arXiv 上。A
EchoCache 利用音频信号能量加速声音驱动视频生成arXiv 报道了 EchoCache 的工作——一种用于 audio-driven video generation(A2V)的缓存方法。作者发现了现有方法中两类不一致:时间-语义不一致和计算-存储不一致。所提出的解决方案利用
Sand AI 发布 MAGI-2-preview:HuggingFace 上的新开源 image-to-video 模型HuggingFace 上发布了 sand-ai/MAGI-2-preview —— Sand AI 的图像转视频生成器的预览版。该模型解决 image-to-video 任务,代码已开源。截至 2026 年 8 月 3 日发布时,其
UniMoCa 将人体运动与相机控制统一为单一视觉表示研究人员推出了 UniMoCa——一种将人体运动和相机轨迹都转换为统一视觉表示(称为 Motion-Camera Visual Proxy,MCVP)的方法。该方法不再向模型输入异构信号
MoRoute 提出用于多模态视频生成的动态层路由方案MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)相结合。该方法允许每个块
ROAD 通过迁移判别模型知识降低 3D 生成训练成本ROAD(Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation)论文作者提出一种方法,仅在训练阶段使用判别式 3D 模型,以降低生成的计算成本。关键
Wan2.2 借助 DAR 方法学会根据动画网格渲染视频研究人员提出了 DAR 方法,可将预训练视频模型 Wan2.2 转变为由动画网格、相机轨迹和参考图像控制的渲染器。该方法不使用深度图(其中相机和物体的运动混合在一起)
FreqForcing 将自回归视频生成延长至两分钟,无需微调2026 年 7 月 29 日,arXiv 上发布了论文 FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring。作者研究了自回归视频扩散模型的问题:在逐帧生成时,误差会累积,
VoxelModel-v1:HuggingFace 上新的开源 text-to-3d 模型HuggingFace 上发布了 bench-labs/VoxelModel-v1 模型,用于解决 text-to-3d 任务。该模型于 2026 年 7 月 26 日出现,代码已开源。开发者未说明显存要求、导出格式、许可证及其他信息
Lightricks 发布带 image-to-video 任务的 LTX-2.5Lightricks 在 HuggingFace 上发布了带 image-to-video 任务的 LTX-2.5 模型。发布时间为 23.07.2026,该模型有 39 次下载和 124 个「喜欢」标记。代码已开源,详情见模型页面。这意味着什么