CPU3D3D、视频与音频的 AI 工具

MoE-JEPA 以专家混合增强 V-JEPA,用于合成图像检测

研究人员提出了 MoE-JEPA——一种基于 V-JEPA 2、加入 Residual Mixture-of-Experts 和独立噪声分析分支的架构,用于识别生成和伪造的图像。该工作于 2026 年 9 月 15 日发表在 arXiv 上。作者称,JEPA 内建的视觉世界理解可作为深度伪造检测器的强先验知识,而 Gated Attention Multiple Instance Learning 模块则细化了空间理解。该模型在包含 30 万张图像的 SID-Set 基准上进行了评估。

这意味着什么

这项工作与 3D 与视频生成 板块中的工具没有直接关系:MoE-JEPA 解决的是伪造检测任务,而非内容生成。但它涉及生成模型所处的整体语境。 在我们的工具中,image-to-3d 方向上最贴近这一主题的是 Hunyuan3D 2.1Stable Fast 3D——两者都接收图像作为输入并生成 3D 模型。如果向这类生成器输入合成图像,结果可能会继承其伪影。MoE-JEPA 级别的检测器是用于检查源素材的工具,但在我们生成器的参数表中并没有这样的检查:无论是 Hunyuan3D 2.1 还是 Stable Fast 3D,都没有描述对输入图像是否具有合成来源进行过滤。 OpenLRM 同样处理图像,但其参数表中不包含关于输入数据真实性检查的信息。对于这三款工具而言,输入生成图像时会发生什么,仍是未解的问题。 MoE-JEPA 的作者公开了代码,但在表述中未说明许可证。该工作的描述中未给出显存要求和模型参数。
MoE-JEPA:合成图像检测 基于 V-JEPA 2 的混合专家架构 图像 输入帧 用于检查 V-JEPA 2 基础理解 视觉世界 作为先验知识 Residual Mixture-of-Experts 混合专家 用于细化 噪声分析分支 独立路径 寻找伪影 判定 伪造 与否 Gated Attention MIL 空间 理解 SID-Set 基准测试 图像 Hunyuan3D 2.1 Stable Fast 3D
该方法的结构。示意图根据本简讯绘制。

相关阅读