CPU3D3D、视频与音频的 AI 工具

KeyID 提出免微调的身份保持视频生成方法

arXiv 上发布了 KeyID 论文——一个 training-free 的 identity-preserving video generation 框架,它将视频动态的合成与身份特征的注入分离开来。作者提出先在不绑定具体人脸的情况下生成草稿视频,然后修正稀疏的关键帧,并在关键帧之间插值运动。该方法在 ACM Multimedia 2026 IPVG Grand Challenge 的 Track 2(Sequential Action)中获得了第二名。 arXiv

这意味着什么

KeyID 是一个研究框架,而不是可以直接使用的现成视频生成器。在我们的AI 视频指南中,没有以 identity-preserving video generation 为主要任务的工具。 类型上最接近的工具是开源的视频生成器:
  • LTX-Video——Lightricks 推出的开源 image-to-video 生成器。支持输入图像,但参数表中没有关于在长动作序列中保持角色身份的信息。
  • CogVideoX(智谱 CogVideoX)——智谱 AI 推出的 text-to-video 生成器。也支持 image-to-video,但参数表中没有反映在复杂场景中保持同一人脸的任务。
  • Pyramid Flow(快手 Pyramid Flow)——开源的 text-to-video 生成器。描述中没有提到参考图处理和身份保持。
KeyID 的有趣之处在于其方法:作者不是对每一帧进行密集控制,而是只修正关键帧,并在关键帧之间插值运动。这降低了遵循文本提示与精确还原人脸之间的冲突。开发者没有说明显存要求以及运行该方法的平台。 目前 KeyID 仍是一个研究项目:代码已开源,但论文描述中没有提到与 diffusers 等流行库的集成。要将其与现有视频生成器结合使用,需要自行适配。
KeyID — 免训练框架 分离动态合成与身份嵌入 T 文本提示 场景描述 与动作 人脸参考 目标人物 图像 草稿视频 不绑定人脸 帧校正 稀疏关键帧 插值 帧间运动 最终视频 保留身份 核心理念 仅校正稀疏关键帧, 帧间运动通过插值生成
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读