CPU3DИИ-инструменты для 3D, видео и звука

MoE-JEPA усиливает V-JEPA смесью экспертов для детекции синтетических изображений

Исследователи представили MoE-JEPA — архитектуру для выявления сгенерированных и подделанных изображений на основе V-JEPA 2 с добавлением Residual Mixture-of-Experts и отдельной ветви для анализа шума. Работа опубликована 15 сентября 2026 года на arXiv. Авторы утверждают, что встроенное в JEPA понимание визуального мира служит сильным априорным знанием для детектора дипфейков, а модуль Gated Attention Multiple Instance Learning уточняет пространственное понимание. Модель оценивалась на бенчмарке SID-Set из 300 тысяч изображений.

Что это значит

Напрямую с инструментами из раздела генерации 3D и видео эта работа не связана: MoE-JEPA решает задачу детекции подделок, а не создания контента. Однако она затрагивает общий контекст, в котором существуют генеративные модели. Среди наших инструментов image-to-3d ближе всего по духу к теме оказываются Hunyuan3D 2.1 и Stable Fast 3D — оба принимают на вход изображения и порождают 3D-модели. Если на вход такого генератора подать синтетическое изображение, результат может унаследовать его артефакты. Детекторы уровня MoE-JEPA — это инструмент для проверки исходников, но в паспортах наших генераторов такой проверки нет: ни Hunyuan3D 2.1, ни Stable Fast 3D не описывают фильтрацию входных изображений на предмет синтетического происхождения. OpenLRM также работает с изображениями, но его паспорт не содержит сведений о проверке подлинности входных данных. Для всех трёх инструментов вопрос о том, что происходит при подаче сгенерированного изображения, остаётся открытым. Авторы MoE-JEPA выложили код в открытый доступ, но лицензию в изложении не указали. Требования к видеопамяти и параметры модели в описании работы не приводятся.
MoE-JEPA: детекция синтетических изображений Архитектура на основе V-JEPA 2 со смесью экспертов Изображение входной кадр для проверки V-JEPA 2 базовое понимание визуального мира как априорное знание Residual Mixture-of-Experts смесь экспертов для уточнения Ветвь анализа шума отдельный путь поиск артефактов Вердикт подделка или нет Gated Attention MIL пространственное понимание SID-Set бенчмарк изображений Hunyuan3D 2.1 Stable Fast 3D
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также