ManifoldSplat 用文本在 90 秒内编辑 3D 头部形状
研究人员提出了 ManifoldSplat —— 一种对从单目视频重建的可动画 3D 头部进行语言编辑形状的方法。它不直接优化高斯点云,而是在结构化的 FLAME 流形内部进行编辑,从而保持身份特征和动画。作者声称在消费级 GPU 上约 90 秒即可完成头像的重建和编辑,渲染速度约为 800 FPS。截至发布时,代码尚未公开。
方法的结构。示意图根据本简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
Generative Cinematographer 教视频模型在 3D 中控制相机与物体2026 年 10 月 1 日,Generative Cinematographer(GenCine)在 arXiv 上发表——该系统可将单张图像提升为可编辑的 3D 场景,并允许联合设定相机与前景的运动。艺术家铺设
微软发布 VibeVoice-ASR-Streaming-7B 用于流式语音识别2026年9月2日,HuggingFace 上发布了模型 microsoft/VibeVoice-ASR-Streaming-7B,任务为 automatic-speech-recognition。该模型可转录流式语音,识别每位说话者所说的内容,支持自定义
FreqForcing 将自回归视频生成延长至两分钟,无需微调2026 年 7 月 29 日,arXiv 上发布了论文 FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring。作者研究了自回归视频扩散模型的问题:在逐帧生成时,误差会累积,
OpenBot:自带浏览器且完全掌控操作的智能体环境OpenBot 是一个用于创建 AI 智能体的新平台,其代码仓库于 2026 年 8 月 17 日开放,32 天内在 GitHub 上获得 5 112 颗星。作者将其描述为 open-source AI coworkers,其中每个智能体都获得自己的计算