微软发布 VibeVoice-ASR-Streaming-7B 用于流式语音识别
2026年9月2日,HuggingFace 上发布了模型 microsoft/VibeVoice-ASR-Streaming-7B,任务为自动语音识别(automatic-speech-recognition)。该模型可转录流式语音,识别说话人身份及其所说内容,支持用户自定义热词以提升人名和技术术语的识别效果,并支持包括俄语在内的十种语言。代码已开源。
方法原理示意图。此图根据该简讯绘制。
Switch to the English version? It is the same page at the same address, with a language prefix.
Other languages: Русский
ABot-Recon 登陆 HuggingFace:从视频进行流式 3D 重建2026 年 8 月 26 日,模型 acvlab/ABot-Recon 在 HuggingFace 上发布。据作者描述,它是一种流式 3D 重建模型,能够根据长视频在线估计相机运动和场景几何,仅需在内存中保留局部信息。
ArtiMo:用于按文本动画化复合 3D 网格的智能体框架2026年8月21日,arXiv 上发布了论文 ArtiMo: Agent-Driven Articulated Mesh Animation。作者提出了一种框架,无需微调模型即可按文本描述动画化复合 3D 网格。其核心是智能体流水线
LTX-2.5 已发布至 HuggingFace,支持 text-to-video 任务HuggingFace 上发布了模型 comfyicu/LTX-2.5,支持 text-to-video 任务。发布日期为 2026 年 8 月 13 日,该模型已有 3630 次下载。详情请见模型页面。这意味着什么 在我们关于 3D 和视频的 AI 工具指南中,目前不
LTX-Video 和 CogVideoX 通过合成视频获得新的 zero-shot 字幕生成方法研究人员在 arXiv 上发表了论文《Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning》,其中提出了用于 zero…