最多阅读
被打开次数最多的五十篇文章。
YuE:音频生成器 — 功能与运行要求YuE 是 M-A-P 团队推出的开源音频生成器,据作者描述,该模型用于创作完整歌曲。据开发者称,该项目旨在成为 Suno.ai 等系统的开源替代品。代码已在 GitHub 上发布,模型权重已
XTTS:音频生成器 — 功能与运行要求XTTS 是 Coqui 推出的开源语音生成器。它解决 text-to-speech 任务:将文本转换为可听的语音。该项目在 GitHub 仓库中持续开发,并以 Python 库的形式分发。功能 据作者描述,
SparsePR 通过稀疏注意力加速视频生成器,无需训练研究人员推出了 SparsePR——一种用于视频生成器和世界模型的 training-free block-sparse attention 方法。该论文于 2026 年 8 月 19 日发布在 arXiv 上,项目页面包含补充材料。作者展示了,
HunyuanVideo(混元视频)获得近无损质量的 5—7 倍加速生成方法研究人员推出了 LinCa——一种通过可学习特征缓存与分量分解来加速扩散模型的方法。LinCa 不再对所有特征采用统一的预测策略,而是将可缓存特征分解为子
HuggingFace 新模型 h3-vbvr 解决 image-to-video 任务2026年8月18日,HuggingFace 上发布了模型 Patarapoom/h3-vbvr,任务为 image-to-video。发布时已有 2434 次下载,0 个「喜欢」标记。代码已开源。这意味着什么 该模型属于 te
SQuad 加速 Wan 2.2 视频生成,注意力机制缩减 67 倍SQuad 的作者提出了一种用于视频扩散 Transformer 的 sub-quadratic attention 蒸馏方法。他们不是从头训练模型,而是分两个阶段蒸馏现成的完整尺寸模型 Wan 2.2 5B:Flow-Matching 监督微调和
Qwen-Video-Edit 将图像编辑模型转变为视频编辑器阿里巴巴发布了 Qwen-Video-Edit——一种将基于指令的图像编辑模型 Qwen-Image-Edit 应用于视频、而无需从头训练视频生成基础模型的方法。Wan 2.1 视频编码器的潜在帧被分解为
Stable Audio Open:音频生成器 — 功能与运行要求Stable Audio Open 是 Stability AI 推出的开源音频生成器。它解决 text-to-audio 任务:将文本描述转换为音频文件。该工具适合需要根据文本生成音频、并愿意处理相关工作的用户。
OpenVoice:音频生成器 — 功能与运行要求OpenVoice 是 MyShell 团队开发的开源语音生成器。它解决 text-to-speech 任务,据作者描述,属于音频基础模型类别。主要应用场景是语音合成,支持音色迁移至
MusicGen:音频生成器 — 功能与运行要求MusicGen 是 Meta 推出的音频生成器,能将文本描述转换为音频。它属于 Audiocraft 库,解决 text-to-audio 任务:用户描述想听到的内容,模型据此生成音频片段。
MegaParts 将 3D 对象按部件生成扩展至 300 个零件研究人员推出了 MegaParts——一个用于生成分解为语义部件的 3D 对象的框架。该方法的核心是一个向量量化分词器,它将每个部件的几何形状压缩为具有自适应长度的离散令牌。
MOSS-SoundEffect(复旦 MOSS-SoundEffect)无 CUDA(Mac 和 AMD):音频生成器 — 功能与运行要求MOSS-SoundEffect(复旦 MOSS-SoundEffect)无 CUDA 版是一款桌面应用,可根据文本描述生成音效。该版本面向搭载 Apple Silicon 芯片的 Mac 电脑,以及 Windows 下使用 AMD 显卡、不支持 CUDA 的机器。
MOSS-SoundEffect:音频生成器 — 功能与运行要求MOSS-SoundEffect 是一款开源的音频生成器,能将文本描述转化为音频。该模型的任务是 text-to-audio:用户用文字描述所需的声音,系统则生成相应的音频文件。此工具适合那些,
MMAudio:音频生成器 — 功能与运行要求MMAudio 是一款开源的音频生成器,可根据视频或文本描述合成音轨。据作者描述,开发者将其定位为通过多类型数据联合训练实现高质量音频合成的工具。
Fish Speech:音频生成器 — 功能与运行要求Fish Speech 是 Fish Audio 推出的开源语音生成器,解决 text-to-speech 任务:将文本转换为配音。该项目同时发布代码和现成的模型权重,因此你可以自行运行,或研究其内部结构。
F5-TTS:音频生成器 — 功能与运行要求F5-TTS 是一款开源的语音生成器,可将文本转换为声音。该项目由开发者 SWivid 创建,以代码和现成模型权重形式发布。其主要功能是 text-to-speech,即根据书面文本合成语音。阅
基于扩散的视频去反射新方法简讯研究人员发布了论文 From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection,该论文于 2026 年 8 月 12 日发表。作者描述了一个由三个组件…
LTX-Video 和 CogVideoX 通过合成视频获得新的 zero-shot 字幕生成方法研究人员在 arXiv 上发表了论文《Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning》,其中提出了用于 zero…
Latent-to-4D 直接从视频潜变量生成4D场景,无需中间RGB步骤论文《Beyond Pixels: From Video Priors to 4D Worlds》的作者提出了 Latent-to-4D 方法,该方法跳过了 RGB 视频重建阶段,直接从视频模型的最终去噪潜变量预测动态 3D 场景。该方法基于
Sci-VBench:生成模型视频科学可信度基准Sci-VBench 作者提出了一个用于评估科学领域视频生成的基准。该基准包含 1 253 个由专家标注的示例,涵盖自然科学、医疗健康、人文与社会科学以及工程学等 60 个学科
Robust-WAM 为基于视频生成器的 World-Action 模型添加语义稳定性来自 arXiv 的研究人员提出了 Robust-WAM——一种针对基于视频生成模型的 World-Action 模型的后训练方法。该工作解决的核心问题是:标准视频生成器在 VAE 空间中运行
DiffRhythm:音频生成器 — 功能与运行要求DiffRhythm 是一款音频生成器,据作者描述,它旨在通过潜在扩散技术,从文本到完整音频,生成完整的歌曲。开发者是 ASLP Lab,项目已开源。功能
CosyVoice:音频生成器 — 功能与运行要求CosyVoice 是阿里巴巴推出的开源语音生成器。它解决 text-to-speech 任务:将文本转化为可听的语音。据作者描述,它是一个多语言语音生成模型,为推理、训练和
ChatTTS:音频生成器 — 功能与运行要求ChatTTS 是 2noise 团队开发的开源音频生成器。它解决 text-to-audio 任务:将文本转换为面向日常对话的语音。据作者描述,该模型是一款用于日常交流的生成式语音模型。
HelloWorld — 用于视频世界中与角色社交互动的模型研究人员推出了 HelloWorld——一种视频世界模型,用户可以与屏幕上的角色进行互动。按下按钮后,角色会对观众做出反应:转身、挥手、点头或说出一句简短的话。
GVCCTurbo 为生成式视频和图像压缩提出码率规划方案arXiv 研究人员推出了 GVCCTurbo——一种规划器,它将生成式先验分布的昂贵更新与通过码本传输修正分离。它不再将采样器步数硬性绑定到
SPADE 无需微调即可加速视频扩散 Transformer 中的注意力机制研究人员推出了 SPADE——一种稀疏注意力引擎,无需微调模型即可加速视频扩散 Transformer 的推理。该论文于 2026 年 8 月 4 日发布在 arXiv 上。作者提出了三个组件:规格
Bark:音频生成器 — 功能与运行要求Bark 是 Suno 推出的开源音频生成器,解决 text-to-speech 任务:根据文本描述将文本转换为语音及其他声音。模型和代码已开源,因此可以自行运行,也
ACE-Step:音频生成器 — 功能与运行要求ACE-Step 是一款开源音频生成器,可将文本描述转换为音频。开发者将其定位为迈向音乐生成基础模型的一步,因此该工具值得从事音频合成相关工作的人关注。
SUV:将未来场景理解视为视频生成,实现端到端驾驶2026年8月4日,arXiv上发布了SUV——一个端到端驾驶框架,将未来场景理解视为视频生成任务。作者没有使用专门的预测模块,而是采用预训练视觉
EchoCache 利用音频信号能量加速声音驱动视频生成arXiv 报道了 EchoCache 的工作——一种用于 audio-driven video generation(A2V)的缓存方法。作者发现了现有方法中两类不一致:时间-语义不一致和计算-存储不一致。所提出的解决方案利用
UniMoCa 将人体运动与相机控制统一为单一视觉表示研究人员推出了 UniMoCa——一种将人体运动和相机轨迹都转换为统一视觉表示(称为 Motion-Camera Visual Proxy,MCVP)的方法。该方法不再向模型输入异构信号
FreqForcing 将自回归视频生成延长至两分钟,无需微调2026 年 7 月 29 日,arXiv 上发布了论文 FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring。作者研究了自回归视频扩散模型的问题:在逐帧生成时,误差会累积,
Lightricks 发布 LTX-2.5,支持 image-to-video 任务Lightricks 在 HuggingFace 上发布了支持 image-to-video 任务的 LTX-2.5 模型。发布日期为 2026 年 7 月 23 日,该模型有 39 次下载和 124 个“喜欢”标记。代码已开源,详情见模型页面。这意味着什么
VA-Judger:用于视频与音频联合生成的奖励模型研究人员推出了 VA-Judger —— 用于视频与音频联合生成系统后训练的奖励模型,以及包含 10.3 千对成对比较的数据集 VAPref-10K 和基准 VA-Judger-Bench。该工作于 2026 年 8 月 19 日发布。
Hunyuan3D 2.1 无 CUDA(Mac 和 AMD):3D 生成器 — 功能与运行要求Hunyuan3D 2.1 无 CUDA 是一个构建版本,允许在没有 NVIDIA 显卡的计算机上运行腾讯 Hunyuan 3D 2.1 三维对象生成模型。作者将代码适配为通过 Metal Performance Shad 在 Apple Silicon 上运行
AnyTalk 为任意角色生成 3D 语音动画,无需动画数据研究人员推出了 AnyTalk——一种为任意角色生成 3D 语音动画的方法,既不需要动画数据,也不需要手动绑定。取而代之的是,作者在目标角色的渲染结果上对现成的 video diffusion model 进行微调。
Token Radius Attention 无需微调即可加速扩散 Transformer 中的视频生成北京大学的研究人员提出了 Token Radius Attention (TRA)——一种在 Video Diffusion Transformers 中减少计算量的方法,无需重新训练模型。该论文于 2026 年 8 月 3 日发布在 arXiv 上。A
MoRoute 提出用于多模态视频生成的动态层路由方案MoRoute 的研究人员发表了一篇论文,提出通过动态层路由将冻结的视觉-语言模型(VLM)与预训练的视频扩散 Transformer(DiT)相结合。该方法允许每个块
ROAD 通过迁移判别模型知识降低 3D 生成训练成本ROAD(Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation)论文作者提出一种方法,仅在训练阶段使用判别式 3D 模型,以降低生成的计算成本。关键
KeyID 提出免微调的身份保持视频生成方法arXiv 上发布了 KeyID 的工作——一种 training-free 框架,用于 identity-preserving video generation,它将视频动态合成与身份嵌入分离。作者建议首先生成不绑定特定人物的草稿视频,然后……
音视频生成获得兼顾音画同步的加速方法论文《Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention》的作者提出了一种加速推理的方法,适用于同时生成视频和音频的模型。他们发现,双向 cross-attenti
VideoArgus 提出基于评分标准的视频生成与编辑统一评估系统研究人员在 arXiv 论文中介绍了 VideoArgus——一个用于评估生成及编辑视频质量的框架。与依赖固定内容的现有基准不同,VideoArgus 针对每个
Wan(通义万相):视频生成器 — 功能与运行要求Wan(通义万相)是阿里巴巴推出的开源视频生成器,解决 text-to-video 任务。该模型将文本描述转换为视频序列,据开发者称,能够在消费级显卡上运行。功能 作者描述
SkyReels:视频生成器——功能与运行要求SkyReels 是 Skywork AI 推出的开源视频生成器。据作者描述,它是首个专注于生成人物视频的开源模型。该工具既支持根据文本描述生成,也支持根据图像生成。功能
V-RAE 提出视频生成潜空间的新方法arXiv 上发布了 V-RAE 的研究论文,作者重新审视了视频自编码器潜空间的结构。他们不再仅针对逐像素重建来优化潜空间,而是构建紧凑的生成式潜空间。
Vidu(生数 Vidu):视频生成器 — 功能、格式与成果权利Vidu(生数 Vidu)是生数科技推出的云视频生成器,支持 text-to-video 和 image-to-video 模式。该服务允许用户根据文本描述、静态图像或多个视角创建短动画片段。
Rodin:3D 生成器 — 功能、格式与结果权利Rodin(影眸 Rodin)是 Deemos 公司推出的云 3D 生成器,基于 Gen-2 模型运行。该服务可将文本描述或图像转换为三维资源,无需用户具备 3D 建模技能。代码不公开,据作者描述
Alaya-EVOKE 发布线性扩展的长交互世界生成方法arXiv 上发布了 Alaya-EVOKE 的研究成果,作者在该工作中解决了长交互世界生成的问题。他们将场景状态提取到按相机索引的外部存储库中,并针对 long-horizon supervision 重新构建教师模型:分
LTX-2.5 已发布至 HuggingFace,支持 text-to-video 任务HuggingFace 上发布了模型 comfyicu/LTX-2.5,支持 text-to-video 任务。发布日期为 2026 年 8 月 13 日,该模型已有 3630 次下载。详情请见模型页面。这意味着什么 在我们关于 3D 和视频的 AI 工具指南中,目前不