Новости нейросетей для 3D и видео
Короткие заметки о том, что изменилось у инструментов: вышла новая версия, сменилась лицензия, появилась поддержка другой платформы. Без пересказа пресс-релизов: если утверждение нельзя привязать к репозиторию, карточке модели или официальной странице, заметки не будет.
Материалы
26 материалов
V-RAE предлагает новый подход к латентным пространствам для генерации видеоНа arXiv опубликована работа V-RAE, в которой авторы пересматривают устройство латентных пространств видеоавтоэнкодеров. Вместо оптимизации латентного…
LTX-2.5 вышла на HuggingFace с задачей text-to-videoНа HuggingFace опубликована модель comfyicu/LTX-2.5 с задачей text-to-video. Дата публикации — 13.08.2026, у модели 3630 загрузок. Подробности — на ст…
На HuggingFace появилась модель LTX-2.5 с задачей text-to-videoНа HuggingFace опубликована модель yuvraj108c/LTX-2.5 с задачей text-to-video. Дата публикации — 12 августа 2026 года. На момент заметки у модели 1445…
Заметка о новом методе удаления отражений из видео на основе диффузииИсследователи представили работу From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection, опубликован…
LTX-Video и CogVideoX получают новый метод zero-shot генерации субтитров через синтетическоеИсследователи опубликовали на arXiv работу Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video C…
Latent-to-4D генерирует 4D-сцены напрямую из латентов видео без промежуточного RGBАвторы работы Beyond Pixels: From Video Priors to 4D Worlds предлагают метод Latent-to-4D, который минует этап восстановления RGB-видео и предсказывае…
Sci-VBench: бенчмарк научной достоверности видео от генеративных моделейАвторы Sci-VBench представили бенчмарк для оценки генерации видео в научных областях. Он включает 1 253 экспертно размеченных примера по 60 дисциплина…
Hunyuan3D 2.1 без CUDA: обновление добавило ROCm и PBR-текстурированиеПорт Hunyuan3D 2.1 на железо без CUDA обновился 9 августа 2026 года, и в нём появилось то, чего раньше не было совсем: поддержка видеокарт AMD через R…
Новая модель Minimax_h3_hybrid на HuggingFace решает задачу image-to-videoНа HuggingFace опубликована модель abakanai/Minimax_h3_hybrid, предназначенная для генерации видео по изображению (image-to-video). Модель появилась 9…
Robust-WAM добавляет семантическую устойчивость в World-Action Models на базе видеогенераторовИсследователи из arXiv представили Robust-WAM — метод пост-тренировки для World-Action Models, построенных на основе видеогенеративных моделей. Основн…
Vorch-Streamer превращает генерацию аватаров в потоковое видео реального времениarXiv опубликовал работу Vorch-Streamer — метод посттренировки, позволяющий генерировать видео с аудио по тексту в реальном времени. Авторы решают две…
VideoArgus предлагает единую систему оценки генерации и редактирования видео на основе рубрикИсследователи представили VideoArgus — фреймворк для оценки качества сгенерированных и отредактированных видео, описанный в работе на arXiv. В отличие…
HelloWorld — модель для социального взаимодействия с персонажами в видеомирахИсследователи представили HelloWorld — модель видеомира, в которой пользователь может взаимодействовать с персонажами на экране. По нажатию кнопки пер…
GVCCTurbo предлагает планировать битрейт для генеративного сжатия видео и изображений безarXiv Исследователи представили GVCCTurbo — планировщик, который отделяет дорогостоящие обновления генеративного априорного распределения от передачи…
SPADE ускоряет внимание в видео-диффузионных трансформерах без переобученияИсследователи представили SPADE — движок разреженного внимания, который ускоряет инференс видео-диффузионных трансформеров без дообучения модели. Рабо…
SUV: будущее сцены как генерация видео для сквозного вождения4 августа 2026 года на arXiv появилась работа SUV — фреймворк сквозного вождения, который представляет понимание будущей сцены как задачу генерации ви…
Token Radius Attention ускоряет генерацию видео в диффузионных трансформерах без дообученияИсследователи из Пекинского университета представили Token Radius Attention (TRA) — метод, который сокращает объём вычислений в Video Diffusion Transf…
EchoCache ускоряет генерацию видео по звуку за счёт энергии аудиосигналаarXiv сообщает о работе EchoCache — методе кэширования для audio-driven video generation (A2V). Авторы выявили два типа рассогласования в существующих…
MAGI-2-preview от Sand AI: новая открытая модель image-to-video на HuggingFaceНа HuggingFace опубликована модель sand-ai/MAGI-2-preview — предварительная версия генератора видео по изображению от Sand AI. Модель решает задачу im…
UniMoCa объединяет управление движением человека и камеры в едином визуальном представленииИсследователи представили UniMoCa — метод, который переводит и движение человека, и траекторию камеры в общее визуальное представление под названием M…
MoRoute предложила динамическую маршрутизацию слоёв для мультимодальной видеогенерацииИсследователи из MoRoute опубликовали работу, в которой предлагают объединять замороженную визуально-языковую модель (VLM) и предобученный видео diffu…
ROAD снижает стоимость обучения генерации 3D переносом знаний из дискриминативных моделейАвторы работы ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation предлагают метод, использующий дискриминативные…
Wan2.2 научили рендерить видео по анимированному мешу с помощью метода DARИсследователи представили метод DAR, который превращает предобученную видеомодель Wan2.2 в рендерер, управляемый анимированным мешем, траекторией каме…
FreqForcing продлевает авторегрессионную видеогенерацию до двух минут без дообучения29 июля 2026 года на arXiv появилась работа FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring. Авторы исследуют проблему а…
VoxelModel-v1: новая открытая модель text-to-3d на HuggingFaceНа HuggingFace опубликована модель bench-labs/VoxelModel-v1, решающая задачу text-to-3d. Модель появилась 26 июля 2026 года, код выложен в открытый до…
Lightricks выпускает LTX-2.5 с задачей image-to-videoLightricks опубликовала на HuggingFace модель LTX-2.5 с задачей image-to-video. Публикация датирована 23.07.2026, у модели 39 загрузок и 124 отметки «…