Новости нейросетей: 3D, видео и языковые модели для своего железа
Короткие заметки о том, что изменилось у инструментов: вышла новая версия, сменилась лицензия, появилась поддержка другой платформы. Без пересказа пресс-релизов: если утверждение нельзя привязать к репозиторию, карточке модели или официальной странице, заметки не будет.
Материалы
93 материала
LocalAI v4.10.0: дашборд кластера, файл учётных данных и бенчмаркУ инструмента запуска LocalAI вышел выпуск v4.10.0. Авторы описывают три направления работы: управление кластером, загрузка моделей из приватных источ…
LichtFeld-Studio выпустил веса RoMa v1 для сопоставления изображенийУ инструмента LichtFeld-Studio вышел новый выпуск — RoMa v1 dense matcher weights. Это постоянный модельный актив в нативном формате .lfw, который исп…
Xing4.0-29B-A4B: новая MoE-модель China Telecom на 31 млрд параметровНа HuggingFace 16 сентября опубликована модель XingChen-AGI/Xing4.0-29B-A4B — text-generation модель из серии Xing (ранее TeleChat), разработанная Chi…
MoE-JEPA усиливает V-JEPA смесью экспертов для детекции синтетических изображенийИсследователи представили MoE-JEPA — архитектуру для выявления сгенерированных и подделанных изображений на основе V-JEPA 2 с добавлением Residual Mix…
llama.cpp v0.4.1: поддержка Maple 20B-A1B, Tencent Hy 4 и Spark2.5Выпуск llama.cpp v0.4.1 вышел 14 сентября 2026 года. В обновлении добавлена поддержка трёх новых архитектур: Maple 20B-A1B — ternary MoE для CPU, Tenc…
VC-Attention ускоряет low-bit attention для видеогенераторов на GPUАвторы работы VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention предлагают training-free метод low-bit attention для Diffusion T…
Дешёвые китайские модели для программирования: что выбрать в сентябре 2026Разработчик одного веб-проекта задал простой вопрос: какую недорогую модель подключить для программирования с оплатой по токенам, чтобы она при этом х…
BubbleID: модель сегментации изображений для анализа кипения вышла на HuggingFace14 сентября 2026 года на HuggingFace опубликована модель UARK-NED3/BubbleID с задачей image-segmentation. Это исследовательский пакет для анализа гран…
OOOSplat v0.4.1 улучшает обработку ошибок и стабильность предпросмотраВышел OOOSplat v0.4.1 — обновление локального генератора 3D Gaussian Splatting, сосредоточенное на стабильности и обработке сбоев. Релиз на GitHub опи…
Agnes-AI выпустила открытую preview-модель Agnes-3.0-Flash на 33 млрд параметровНа HuggingFace опубликована модель Agnes-AI/Agnes-3.0-Flash с задачей text-generation. Это открытый preview-чекпойнт Agnes 3.0 Flash, который автор от…
whisper.cpp v1.9.4: поддержка Windows on ARM и обновление ggml до 0.23.0Вышел выпуск v1.9.4 инструмента запуска whisper.cpp. В репозитории на GitHub опубликованы изменения: добавлена поддержка Windows on ARM в сборочный ко…
Tri-DehazeGS разделяет сцену и дымку при реконструкции 3D из фотоГруппа исследователей представила Tri-DehazeGS — метод восстановления чистых 3D-сцен из задымлённых или туманных изображений. Работа опубликована 10 с…
ComfyUI v0.35.0: поддержка WAN3-Prime, Omni 1.1 и новые 3D-узлы09.09.2026 вышел ComfyUI v0.35.0. В выпуске — поддержка новых партнёрских моделей, 3D-узлы для работы с mesh и несколько исправлений, связанных с памя…
YuE2 вышел с открытым кодом и весами под CC BY-NC 4.0У инструмента YuE вышел новый выпуск YuE2 · frontier music generation with symbolic planning. Дата выпуска — 09.09.2026. Релиз на GitHub описывает три…
YuE2-3B: открытая модель для генерации музыки с редактируемой партитуройНа HuggingFace опубликована модель m-a-p/YuE2-3B с задачей text-to-audio. Автор — m-a-p, чьи инструменты уже описаны в нашем справочнике. Модель весит…
Programmable World Model — новый фреймворк для управляемых видеомиров с постоянным состояниемНа arXiv опубликована работа Programmable World Model, в которой авторы предлагают фреймворк для создания интерактивных видеомиров с явным, сохраняемы…
Test-time guidance улучшает геометрию image-to-3D моделей по частичным наблюдениямИсследователи представили training-free метод, который позволяет учитывать частичные геометрические наблюдения объекта на этапе генерации без дообучен…
Streaming talking head: авторы разделили аудио и рендер, чтобы ускорить генерациюНа arXiv вышла работа Decoupled Self-Forcing Distillation for Streaming Talking Head Generation. Авторы предлагают для потоковой генерации говорящей г…
Edge0 выпустила 35B MoE-модель, работающую в 3 ГБ памятиНа HuggingFace опубликована Edge0-35B-A3B-preview — текстовая модель класса 35B с разреженной MoE-архитектурой. Авторы заявляют, что она декодирует со…
Метод Spectral Transport Homeostasis корректирует временную согласованность видео безГруппа исследователей опубликовала на arXiv работу о диагностике и коррекции временной согласованности в генерации видео. Авторы вводят понятие Spectr…
Nex-AGI выпустила Nex-N2.5-mini, агентную модель на 35 млрд параметровНа HuggingFace опубликована модель nex-agi/Nex-N2.5-mini с задачей text-generation. Это младшая модель нового семейства Nex-N2.5, ориентированного на…
MiniCPM5-2B: новая 2B-модель для локального запуска вышла на HuggingFaceНа HuggingFace 6 сентября 2026 года опубликована модель openbmb/MiniCPM5-2B с задачей text-generation. Это вторая модель серии MiniCPM5 после MiniCPM5…
SGLang v0.5.19: поддержка Qwen3.8, beam search и DeepEP v25 сентября 2026 года вышел SGLang v0.5.19. В выпуск вошли 786 пул-реквестов от 214 участников. Среди новых моделей — Qwen3.8 (2.4T-A95B), Qwen3.8-27B…
DSAQuant предложил квантование видеодиффузии с учётом стадий денойзингаАвторы статьи на arXiv показали, что обычный quantization-aware training портит у видеомоделей именно детали и резкость, хотя общую композицию и движе…
OctWorld представили как генератор длинных согласованных видео с 3D-памятью на октодеревеНа arXiv 3 сентября 2026 года вышла работа OctWorld — фреймворк для генерации видео на основе диффузии с постоянной 3D-памятью. По одному изображению…
Ling-3.0-flash-Fin: финансовая модель Ant Group на 127,5 млрд параметров вышла на HuggingFaceНа HuggingFace 3 сентября 2026 года опубликована модель inclusionAI/Ling-3.0-flash-Fin с задачей text-generation. Это первая модель семейства Ant Ling…
LichtFeld-Studio выпустил веса LPIPS v0.1 на базе VGG16У инструмента LichtFeld-Studio вышел выпуск LPIPS v0.1 VGG16 weights. Это постоянный модельный ассет в нативном формате .lfw, который используется оце…
Microsoft выпустила VibeVoice-ASR-Streaming-7B для потокового распознавания речиНа HuggingFace 2 сентября 2026 года опубликована модель microsoft/VibeVoice-ASR-Streaming-7B с задачей automatic-speech-recognition. Модель транскриби…
CC-4DGS сокращает хранение динамического Gaussian Splatting до 20—30 МБ на сценуНа arXiv опубликована работа CC-4DGS, в которой предложен способ уменьшить объём хранения динамических 4D Gaussian Splatting-сцен с десятков—сотен мег…
K2-Horizon-MoVA-36B-A4B: открытая MoE-модель на 36B параметров с 4B активныхНа HuggingFace опубликована модель IFM/K2-Horizon-MoVA-36B-A4B с задачей text-generation. Это разреженная модель семейства K2-Horizon: архитектура Mix…