研究人员提出了 MoE-JEPA——一种基于 V-JEPA 2、加入 Residual Mixture-of-Experts 和独立噪声分析分支的架构,用于识别生成和伪造的图像。该工作于 2026 年 9 月 15 日发表在
arXiv 上。作者称,JEPA 内建的视觉世界理解可作为深度伪造检测器的强先验知识,而 Gated Attention Multiple Instance Learning 模块则细化了空间理解。该模型在包含 30 万张图像的 SID-Set 基准上进行了评估。
这意味着什么
这项工作与
3D 与视频生成 板块中的工具没有直接关系:MoE-JEPA 解决的是伪造检测任务,而非内容生成。但它涉及生成模型所处的整体语境。
在我们的工具中,image-to-3d 方向上最贴近这一主题的是
Hunyuan3D 2.1 和
Stable Fast 3D——两者都接收图像作为输入并生成 3D 模型。如果向这类生成器输入合成图像,结果可能会继承其伪影。MoE-JEPA 级别的检测器是用于检查源素材的工具,但在我们生成器的参数表中并没有这样的检查:无论是 Hunyuan3D 2.1 还是 Stable Fast 3D,都没有描述对输入图像是否具有合成来源进行过滤。
OpenLRM 同样处理图像,但其参数表中不包含关于输入数据真实性检查的信息。对于这三款工具而言,输入生成图像时会发生什么,仍是未解的问题。
MoE-JEPA 的作者公开了代码,但在表述中未说明许可证。该工作的描述中未给出显存要求和模型参数。
该方法的结构。示意图根据本简讯绘制。