神经网络视频生成器:开源与订阅制
视频生成器——从可安装到自己机器上的开源模型,到按订阅使用的云服务。每个工具的参数表中都包含:是否开源、本地运行需要什么配置、以及可以在什么条件下使用生成结果。
价格和套餐限额几乎每月都在变化,因此文中没有具体金额:只有“免费 / 有条件免费 / 付费”的等级划分,以及指向官方价格页面的链接。
文章
22 篇文章
Wan(通义万相):视频生成器 — 功能与运行要求Wan(通义万相)是阿里巴巴推出的开源视频生成器,解决 text-to-video 任务。该模型将文本描述转换为视频序列,据开发者称,能够在消费级显卡上运行。功能 作者描述
SkyReels:视频生成器——功能与运行要求SkyReels 是 Skywork AI 推出的开源视频生成器。据作者描述,它是首个专注于生成人物视频的开源模型。该工具既支持根据文本描述生成,也支持根据图像生成。功能
Vidu(生数 Vidu):视频生成器 — 功能、格式与成果权利Vidu(生数 Vidu)是生数科技推出的云视频生成器,支持 text-to-video 和 image-to-video 模式。该服务允许用户根据文本描述、静态图像或多个视角创建短动画片段。
Veo:视频生成器 — 功能、格式与结果权利Veo 是 Google DeepMind 推出的云视频生成器,可将文本或图像转换为带声音的短视频。该服务面向内容创作者,帮助他们快速获得符合需求的视觉素材。
Sora:视频生成器 — 功能、格式与结果权利Sora 是 OpenAI 推出的云视频生成器,能将文本、图像和现有视频片段转化为新场景。该服务面向制作写实及风格化动画素材(含特效)的需求。
Runway:视频生成器 — 功能、格式与结果权利Runway — 云服务,用于根据文本生成图像、视频和音频。开发者将其定位为借助人工智能创建内容的工具。该服务代码不公开,无法在本地运行。功能 在
Pika:视频生成器 — 功能、格式与成果权利Pika — 来自 Pika Labs 的云视频生成器,可将文本、图像和现成视频片段转化为新视频。该服务仅通过浏览器运行,不提供源代码或模型权重。功能 输入可提供文本、图像或视频片段。
Kling(可灵):视频生成器 — 功能、格式与成果权利Kling(可灵)是快手公司推出的云端视频和图像生成器。该服务定位为新一代工具,可根据文本描述或上传的图片生成视频,并支持运动控制。
Hailuo:视频生成器 — 功能、格式与成果权利Hailuo(海螺AI)是MiniMax公司的云视频生成器,可将文本或图像转换为短视频。该服务仅通过浏览器运行,不提供源代码或本地应用形式。功能 该服务支
Dream Machine:视频生成器 — 功能、格式与结果权利Dream Machine 是 Luma AI 推出的云服务,据开发者描述,它定位为创意工作空间的 AI 代理。该服务的任务是在统一平台上创建和编辑图像、视频、音频和文本。本工具页面将介绍其功能、运行要求、输出格式以及生成内容的使用权利。
VideoCrafter:视频生成器——功能与运行要求VideoCrafter 是一套开源模型,用于根据文本描述或起始图像生成视频。该工具由腾讯 AI Lab 实验室开发,面向希望进行实验的研究人员和开发者。
Stable Video Diffusion:视频生成器 — 功能与运行要求Stable Video Diffusion 是 Stability AI 推出的开源生成模型,用于将静态图像转换为短视频(image-to-video)。该工具面向研究人员和开发者,他们准备
Pyramid Flow:视频生成器——功能与运行要求Pyramid Flow 是一款开源的视频生成器,解决 text-to-video 任务。该模型采用金字塔式流匹配(flow matching)方法,据开发者称,可在显存不大的显卡上生成视频。
Open-Sora-Plan:视频生成器——功能与运行要求Open-Sora-Plan 是一款开源的文本描述视频生成器,由 PKU-YuanGroup 团队开发。该项目旨在通过社区力量复现 OpenAI 的 Sora 模型,为研究人员和开发者提供易用的工具。
Open-Sora:视频生成器 — 功能与运行要求Open-Sora 是 HPC-AI Tech 团队开发的开源视频生成器。该工具用于根据文本描述合成视频序列,其主要目标是让高效视频制作对所有人开放。
Mochi 1:视频生成器——功能与运行要求Mochi 1 是一款基于文本描述生成视频(text-to-video)的开源视频生成器,由 Genmo 公司开发。该工具用于根据提示合成视频片段,并支持本地运行和微调。
Latte:视频生成器 — 功能与运行要求Latte 是一款基于 Latent Diffusion Transformer 架构的开源视频生成器。开发者将其定位为用于根据文本描述合成视频的研究工具,已在会议框架内发布。
HunyuanVideo:视频生成器——功能与运行要求HunyuanVideo(混元视频)是腾讯公司推出的开源视频生成器,解决 text-to-video 任务。该工具基于 diffusion-transformer 构建,用于根据文本描述生成视频。功能 据作者描述
AnimateDiff:视频生成器 — 功能与运行要求AnimateDiff 是一款开源工具,用于从文本描述生成短视频片段。它的目标是为 Stable Diffusion 等流行模型生成的静态图片添加可控的动态效果。
Allegro:视频生成器 — 功能与运行要求Allegro 是 Rhymes AI 推出的开源视频生成器,解决 text-to-video 任务。该模型将文本描述转化为短视频,并自由分发:代码和权重均采用 Apache-2.0 许可证。功能 据作者
CogVideoX(智谱 CogVideoX):视频生成器 — 功能与运行要求眼前是 CogVideoX(智谱 CogVideoX)——一款根据文本描述生成视频的开源视频生成器。开发者智谱 AI 公司将其定位为将文本提示转化为视频片段的工具。该模型也常与
LTX-Video:视频生成器 — 功能与运行要求LTX-Video 是 Lightricks 公司推出的开源视频生成器,解决 image-to-video 任务。该工具可将静态图像转换为视频片段,支持在自己的硬件上本地运行。功能 A