Новости нейросетей: 3D, видео и языковые модели для своего железа
Короткие заметки о том, что изменилось у инструментов: вышла новая версия, сменилась лицензия, появилась поддержка другой платформы. Без пересказа пресс-релизов: если утверждение нельзя привязать к репозиторию, карточке модели или официальной странице, заметки не будет.
Материалы
68 материалов
DSAQuant предложил квантование видеодиффузии с учётом стадий денойзингаАвторы статьи на arXiv показали, что обычный quantization-aware training портит у видеомоделей именно детали и резкость, хотя общую композицию и движе…
OctWorld представили как генератор длинных согласованных видео с 3D-памятью на октодеревеНа arXiv 3 сентября 2026 года вышла работа OctWorld — фреймворк для генерации видео на основе диффузии с постоянной 3D-памятью. По одному изображению…
Ling-3.0-flash-Fin: финансовая модель Ant Group на 127,5 млрд параметров вышла на HuggingFaceНа HuggingFace 3 сентября 2026 года опубликована модель inclusionAI/Ling-3.0-flash-Fin с задачей text-generation. Это первая модель семейства Ant Ling…
Microsoft выпустила VibeVoice-ASR-Streaming-7B для потокового распознавания речиНа HuggingFace 2 сентября 2026 года опубликована модель microsoft/VibeVoice-ASR-Streaming-7B с задачей automatic-speech-recognition. Модель транскриби…
CC-4DGS сокращает хранение динамического Gaussian Splatting до 20—30 МБ на сценуНа arXiv опубликована работа CC-4DGS, в которой предложен способ уменьшить объём хранения динамических 4D Gaussian Splatting-сцен с десятков—сотен мег…
VCAR: сегментация 3DGS без обучения через полноту обзора и уточнение границ по осямАвторы работы VCAR: Training-Free 3DGS Segmentation via View Completeness and Axis-Aware Boundary Refinement предлагают метод семантической сегментаци…
H3-World: интерактивная image-to-video модель на базе MiniMax-H3На HuggingFace опубликована модель DANNY621/H3-World с задачей image-to-video. Автор описывает её как первую интерактивную модель мира на основе MiniM…
CapFrame превращает текстовое описание кадра в позицию камеры для 3D Gaussian SplattingИсследователи представили CapFrame — метод, который по текстовой инструкции находит 6-DoF позу камеры в сцене 3D Gaussian Splatting так, чтобы отренде…
SpatialCrafter превращает одно изображение в исследуемую 3D-сцену через генеративный проксиИсследователи представили SpatialCrafter — двухэтапный фреймворк для генерации исследуемых 3D-сцен из одного изображения. Работа опубликована на arXiv…
VibeVoice-1.5B-hf: новая открытая модель text-to-audio от Microsoft на HuggingFaceНа HuggingFace опубликована модель vibevoice/VibeVoice-1.5B-hf с задачей text-to-audio. Она предназначена для генерации длинных разговорных аудио с не…
4DStreamCtrl объединяет управление камерой, объектами и глубиной в потоковом режимеНа arXiv опубликована работа 4DStreamCtrl — метод интерактивной генерации видео, который сводит движение камеры, траектории объектов и глубину к едино…
ABot-Recon вышла на HuggingFace: потоковая 3D-реконструкция из видеоНа HuggingFace 26 августа 2026 года опубликована модель acvlab/ABot-Recon. Авторы описывают её как потоковую модель 3D-реконструкции, которая оценивае…
LeFlow ускоряет планирование в world models на порядок за счёт генеративного латентного приораИсследователи представили LeFlow — метод, который заменяет итеративную оптимизацию траекторий в latent world models на генеративное планирование. Вмес…
Luce представила генерацию 3D-ассетов с PBR-материалами и переосвещением по одному изображениюИсследователи опубликовали на arXiv работу Luce: Relightable Gaussians for 3D Asset Generation, в которой представлен метод генерации 3D-моделей из од…
SceneReGen собирает 3D-сцены из одного изображения, генерируя объекты в общей системе координатНа arXiv 25 августа 2026 года опубликована работа SceneReGen: Generative Reconstruction of 3D Scenes from a Single Image. Авторы предлагают метод гене…
GlanceWAM разделяет воображение и управление в одном видео DiT для роботовИсследователи представили GlanceWAM — подход к world-action models, который выносит генерацию видео с критического пути управления. Асинхронный propos…
FixAnything улучшает рендеры 3D-сцен через видеогенеративные моделиИсследователи представили FixAnything — единую модель для исправления артефактов рендеринга в разных 3D-представлениях, включая Gaussian Splatting, Ne…
MiniMax-H3-slim выложена на HuggingFace для генерации видео по текстуНа HuggingFace 24 августа 2026 года опубликована модель fkyyy/MiniMax-H3-slim с задачей text-to-video. На момент публикации у неё 508 загрузок и ни од…
Новая модель H3_HD_2K_Detailer для image-to-video на HuggingFaceНа HuggingFace 24 августа 2026 года опубликована модель zuanfilm/H3_HD_2K_Detailer с задачей image-to-video. На момент публикации у модели 26 отметок…
Loopy превращает временную ось DiT в круг для бесшовных зацикленных видеоАвторы Loopy опубликовали на arXiv работу о генерации бесшовных зацикленных видео. Они показывают, что слои позиционного эмбеддинга в DiT по-разному у…
H3 Cinematic Multishot Coverage вышла на HuggingFace для image-to-videoНа HuggingFace 24 августа 2026 года опубликована модель ethanfel/H3_Cinematic_Multishot_Coverage с задачей image-to-video. Код выложен в открытый дост…
LTX-Video, CogVideoX и Pyramid Flow пока не дотягивают до симуляторов по восьми критериямАвторы систематического обзора на arXiv проанализировали 200 работ о генеративных мировых моделях с 2018 по июнь 2026 года и сравнили их с традиционны…
LTX-Video и CogVideoX пока не решают задачу нескольких объектов в одном видеоНа arXiv вышло сравнительное исследование трёх подходов к генерации видео с несколькими объектами без дообучения: прямой, параллельной и последователь…
InfinityEdit представили адаптер для бесконечного потокового видеоредактирования21 августа 2026 года на arXiv вышла работа InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter. Авторы отказываются от привы…
ArtiMo: агентный фреймворк для анимации составных 3D-мешей по тексту21 августа 2026 года на arXiv опубликована работа ArtiMo: Agent-Driven Articulated Mesh Animation. Авторы предлагают фреймворк, который анимирует сост…
DiffVC-ONE представили одношаговое сжатие видео диффузией на Video DiTarXiv опубликовал работу DiffVC-ONE — фреймворк генеративного сжатия видео на основе одношагового Video Diffusion Transformer. Авторы заявляют о трёх…
MultiCube представил генерацию 3D-объектов с контролем каждой части по отдельностиИсследователи опубликовали на arXiv работу MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control, в которой описан метод…
VGI-Bench оценивает визуальное мышление видеогенераторов на 810 задачахarXiv опубликовал работу VGI-Bench — бенчмарк из 27 задач и 810 примеров для проверки визуального мышления у моделей генерации видео. Авторы выстроили…
Stream4D добавляет 4D-согласованность в потоковые авторегрессионные видеомоделиАвторы работы Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models (arXiv, 20.08.2026) предлагают метод обучения потоковых авт…
VA-Judger: модель вознаграждения для совместной генерации видео и звукаИсследователи представили VA-Judger — reward-модель для посттренировки систем совместной генерации видео и аудио, а также датасет VAPref-10K из 10,3 т…