Новости нейросетей: 3D, видео и языковые модели для своего железа
Короткие заметки о том, что изменилось у инструментов: вышла новая версия, сменилась лицензия, появилась поддержка другой платформы. Без пересказа пресс-релизов: если утверждение нельзя привязать к репозиторию, карточке модели или официальной странице, заметки не будет.
Материалы
134 материала
Audio8-ASR-Infinite: потоковое распознавание речи с постоянным потреблением памятиНа HuggingFace 21 сентября 2026 года опубликована модель Edge0/Audio8-ASR-Infinite с задачей text-generation. Автор описывает её как нативное потоково…
WorldCrafter-Base от TencentARC: модель image-to-video на 14,3 млрд параметровНа HuggingFace 21 сентября 2026 года опубликована модель TencentARC/WorldCrafter-Base с задачей image-to-video. Это базовая часть проекта WorldCrafter…
SupraLabs выпустила компактную text-to-image модель Supra2-IMGНа HuggingFace опубликована модель SupraLabs/Supra2-IMG — diffusion transformer для генерации изображений по текстовому описанию. Автор называет её кр…
Qwen выпустила модель для переписывания промптов Qwen-Image-2.1-PE-T2IНа HuggingFace 20 сентября 2026 года опубликована модель Qwen/Qwen-Image-2.1-PE-T2I. Это не генератор изображений, а вспомогательная модель для подгот…
FrontierAgent: новая агентная среда с TUI, режимом Agent Team и оценкой качестваFrontierAgent — открытая агентная среда для длительных исследовательских и файловых задач, репозиторий открыт 22 августа 2026 года и за 28 дней набрал…
OpenBot: агентная среда с собственным браузером и полным контролем действийOpenBot — это новая платформа для создания ИИ-агентов, репозиторий которой открыт 17 августа 2026 года и за 32 дня набрал 5 112 звёзд на GitHub. Автор…
Moondream выпустила Parakeet Redux — 1.58-битную модель распознавания речи на 149 млнНа HuggingFace 18 сентября 2026 года опубликована модель moondream/parakeet-redux для automatic-speech-recognition. Это 1.58-битная версия parakeet-td…
Cube-Splat представила панорамный Gaussian Splatting SLAM с открытым кодомНа arXiv опубликована работа Cube-Splat — метод одновременной локализации и построения карты (SLAM) на основе 3D Gaussian Splatting для панорамных 360…- Pipecat 1.11.0: ресемплер с ручным сбросом и оценка вызовов функций в сценариях18 сентября 2026 года вышел Pipecat 1.11.0 — открытый Python-фреймворк для real-time голосовых и мультимодальных агентов. С прошлого разбора вышли два…
LocalAI v4.10.0: дашборд кластера, файл учётных данных и бенчмаркУ инструмента запуска LocalAI вышел выпуск v4.10.0. Авторы описывают три направления работы: управление кластером, загрузка моделей из приватных источ…
LichtFeld-Studio выпустил веса RoMa v1 для сопоставления изображенийУ инструмента LichtFeld-Studio вышел новый выпуск — RoMa v1 dense matcher weights. Это постоянный модельный актив в нативном формате .lfw, который исп…
Xing4.0-29B-A4B: новая MoE-модель China Telecom на 31 млрд параметровНа HuggingFace 16 сентября опубликована модель XingChen-AGI/Xing4.0-29B-A4B — text-generation модель из серии Xing (ранее TeleChat), разработанная Chi…- PhysStream представил потоковую генерацию видео с физическим управлением движениемГруппа исследователей опубликовала на arXiv работу PhysStream — авторегрессионную модель для генерации видео из изображения, которая позволяет управля…
MoE-JEPA усиливает V-JEPA смесью экспертов для детекции синтетических изображенийИсследователи представили MoE-JEPA — архитектуру для выявления сгенерированных и подделанных изображений на основе V-JEPA 2 с добавлением Residual Mix…
NVIDIA выложила на HuggingFace модель c-foundationstereo-s для оценки глубины по стереопареNVIDIA опубликовала на HuggingFace модель c-foundationstereo-s с задачей depth-estimation. Это FoundationStereo — модель для оценки глубины по паре RG…
llama.cpp v0.4.1: поддержка Maple 20B-A1B, Tencent Hy 4 и Spark2.5Выпуск llama.cpp v0.4.1 вышел 14 сентября 2026 года. В обновлении добавлена поддержка трёх новых архитектур: Maple 20B-A1B — ternary MoE для CPU, Tenc…
VC-Attention ускоряет low-bit attention для видеогенераторов на GPUАвторы работы VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention предлагают training-free метод low-bit attention для Diffusion T…
Дешёвые китайские модели для программирования: что выбрать в сентябре 2026Разработчик одного веб-проекта задал простой вопрос: какую недорогую модель подключить для программирования с оплатой по токенам, чтобы она при этом х…
BubbleID: модель сегментации изображений для анализа кипения вышла на HuggingFace14 сентября 2026 года на HuggingFace опубликована модель UARK-NED3/BubbleID с задачей image-segmentation. Это исследовательский пакет для анализа гран…
OOOSplat v0.4.1 улучшает обработку ошибок и стабильность предпросмотраВышел OOOSplat v0.4.1 — обновление локального генератора 3D Gaussian Splatting, сосредоточенное на стабильности и обработке сбоев. Релиз на GitHub опи…
Agnes-AI выпустила открытую preview-модель Agnes-3.0-Flash на 33 млрд параметровНа HuggingFace опубликована модель Agnes-AI/Agnes-3.0-Flash с задачей text-generation. Это открытый preview-чекпойнт Agnes 3.0 Flash, который автор от…
whisper.cpp v1.9.4: поддержка Windows on ARM и обновление ggml до 0.23.0Вышел выпуск v1.9.4 инструмента запуска whisper.cpp. В репозитории на GitHub опубликованы изменения: добавлена поддержка Windows on ARM в сборочный ко…
Tri-DehazeGS разделяет сцену и дымку при реконструкции 3D из фотоГруппа исследователей представила Tri-DehazeGS — метод восстановления чистых 3D-сцен из задымлённых или туманных изображений. Работа опубликована 10 с…
ComfyUI v0.35.0: поддержка WAN3-Prime, Omni 1.1 и новые 3D-узлы09.09.2026 вышел ComfyUI v0.35.0. В выпуске — поддержка новых партнёрских моделей, 3D-узлы для работы с mesh и несколько исправлений, связанных с памя…
YuE2 вышел с открытым кодом и весами под CC BY-NC 4.0У инструмента YuE вышел новый выпуск YuE2 · frontier music generation with symbolic planning. Дата выпуска — 09.09.2026. Релиз на GitHub описывает три…
YuE2-3B: открытая модель для генерации музыки с редактируемой партитуройНа HuggingFace опубликована модель m-a-p/YuE2-3B с задачей text-to-audio. Автор — m-a-p, чьи инструменты уже описаны в нашем справочнике. Модель весит…
Programmable World Model — новый фреймворк для управляемых видеомиров с постоянным состояниемНа arXiv опубликована работа Programmable World Model, в которой авторы предлагают фреймворк для создания интерактивных видеомиров с явным, сохраняемы…
Test-time guidance улучшает геометрию image-to-3D моделей по частичным наблюдениямИсследователи представили training-free метод, который позволяет учитывать частичные геометрические наблюдения объекта на этапе генерации без дообучен…
Streaming talking head: авторы разделили аудио и рендер, чтобы ускорить генерациюНа arXiv вышла работа Decoupled Self-Forcing Distillation for Streaming Talking Head Generation. Авторы предлагают для потоковой генерации говорящей г…
Edge0 выпустила 35B MoE-модель, работающую в 3 ГБ памятиНа HuggingFace опубликована Edge0-35B-A3B-preview — текстовая модель класса 35B с разреженной MoE-архитектурой. Авторы заявляют, что она декодирует со…