MoE-JEPA усиливает V-JEPA смесью экспертов для детекции синтетических изображений
Исследователи представили MoE-JEPA — архитектуру для выявления сгенерированных и подделанных изображений на основе V-JEPA 2 с добавлением Residual Mixture-of-Experts и отдельной ветви для анализа шума. Работа опубликована 15 сентября 2026 года на arXiv. Авторы утверждают, что встроенное в JEPA понимание визуального мира служит сильным априорным знанием для детектора дипфейков, а модуль Gated Attention Multiple Instance Learning уточняет пространственное понимание. Модель оценивалась на бенчмарке SID-Set из 300 тысяч изображений.
Что это значит
Напрямую с инструментами из раздела генерации 3D и видео эта работа не связана: MoE-JEPA решает задачу детекции подделок, а не создания контента. Однако она затрагивает общий контекст, в котором существуют генеративные модели.
Среди наших инструментов image-to-3d ближе всего по духу к теме оказываются Hunyuan3D 2.1 и Stable Fast 3D — оба принимают на вход изображения и порождают 3D-модели. Если на вход такого генератора подать синтетическое изображение, результат может унаследовать его артефакты. Детекторы уровня MoE-JEPA — это инструмент для проверки исходников, но в паспортах наших генераторов такой проверки нет: ни Hunyuan3D 2.1, ни Stable Fast 3D не описывают фильтрацию входных изображений на предмет синтетического происхождения.
OpenLRM также работает с изображениями, но его паспорт не содержит сведений о проверке подлинности входных данных. Для всех трёх инструментов вопрос о том, что происходит при подаче сгенерированного изображения, остаётся открытым.
Авторы MoE-JEPA выложили код в открытый доступ, но лицензию в изложении не указали. Требования к видеопамяти и параметры модели в описании работы не приводятся.Как устроен метод. Схема нарисована по этой заметке.