CPU3D3D、视频与音频的 AI 工具

HelloWorld — 用于视频世界中与角色社交互动的模型

研究人员发布了 HelloWorld——一种视频世界模型,用户可以在其中与屏幕上的角色互动。按下按钮,角色会对观众做出反应:转身、挥手、点头或说一句简短的问候。该模型通过自蒸馏在合成数据上训练,推理时一个专用模块无需微调即可判断反应应发生的具体时刻,并将其定位在相应的时间窗口内。代码已开源。

这意味着什么

HelloWorld 解决了一个在 我们的 AI 视频指南中任何工具都不具备的任务:在生成的视频中与角色进行社交互动。这不仅仅是 text-to-video 或 image-to-video,而是实时控制角色相对于摄像机的行为。

与最相近类型的工具比较:

HelloWorld — 与视频世界中角色的社交互动 用户 按下按钮 本地化模块 确定时机 无需微调的反应 HelloWorld 模型 实时控制 角色行为 反应 手势、点头 训练过程 合成数据 带角色的视频 自蒸馏 模型训练 成品模型 开源 与同类对比 LTX-Video image-to-video,无互动 CogVideoX text-to-video,无互动 Pyramid Flow text-to-video,无控制 HelloWorld 社交互动有
方法的工作原理。示意图根据这篇简讯绘制。

HelloWorld 是一个研究项目,而非现成的通用视频生成器。它展示了如何为视频世界添加交互性,但尚未集成到指南中的现有工具中。

相关阅读