VoxelModel-v1:HuggingFace 上新的开源 text-to-3d 模型
HuggingFace 上发布了模型 bench-labs/VoxelModel-v1,用于解决 text-to-3d 任务。该模型于 2026 年 7 月 26 日出现,代码已开源。开发者未说明显存要求、导出格式及其他技术细节。
该方法的原理。示意图根据这篇简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
SUV:将未来场景理解视为视频生成,实现端到端驾驶2026年8月4日,arXiv上发布了SUV——一个端到端驾驶框架,将未来场景理解视为视频生成任务。作者没有使用专门的预测模块,而是采用预训练视觉
OOOSplat 0.5.0:自动优化、桥接补帧与补拍OOOSplat 0.5.0 发布——一款将视频和照片转换为 3D Gaussian Splatting 的本地工具。此版本新增参数自动优化、覆盖不足时的桥接补帧、考虑可用视频的训
流式说话头像:作者分离音频与渲染以加速生成arXiv 上发表了论文 Decoupled Self-Forcing Distillation for Streaming Talking Head Generation。作者提出,对于流式说话头像生成,不将音频直接与视频的每个像素绑定,而是在低维空间中进行条件融合。