HelloWorld — 用于视频世界中与角色社交互动的模型
研究人员发布了 HelloWorld——一种视频世界模型,用户可以在其中与屏幕上的角色互动。按下按钮,角色会对观众做出反应:转身、挥手、点头或说一句简短的问候。该模型通过自蒸馏在合成数据上训练,推理时一个专用模块无需微调即可判断反应应发生的具体时刻,并将其定位在相应的时间窗口内。代码已开源。
这意味着什么
HelloWorld 解决了一个在 我们的 AI 视频指南中任何工具都不具备的任务:在生成的视频中与角色进行社交互动。这不仅仅是 text-to-video 或 image-to-video,而是实时控制角色相对于摄像机的行为。
与最相近类型的工具比较:
- LTX-Video — 一款 image-to-video 生成器,其参数表中未提及与角色的互动。
- CogVideoX(智谱 CogVideoX) — 解决 text-to-video 任务,未提及社交互动。
- Pyramid Flow(快手 Pyramid Flow) — 同样是 text-to-video,没有角色行为控制功能。
HelloWorld 是一个研究项目,而非现成的通用视频生成器。它展示了如何为视频世界添加交互性,但尚未集成到指南中的现有工具中。



