Новости нейросетей: 3D, видео и языковые модели для своего железа
Короткие заметки о том, что изменилось у инструментов: вышла новая версия, сменилась лицензия, появилась поддержка другой платформы. Без пересказа пресс-релизов: если утверждение нельзя привязать к репозиторию, карточке модели или официальной странице, заметки не будет.
Материалы
134 материала
llama.cpp v0.6.0: расширенный batch API, новые модели и ускорение на Metal и VulkanВышел llama.cpp v0.6.0. Релиз добавляет расширенный batch API llama_batch_ext с функцией llama_process() для смешанных токен/эмбеддинг-батчей и per-to…
LiquidAI выпустила d1-3B — модель для принятия решений за один проход без генерации текстаНа HuggingFace 5 октября 2026 года опубликована модель LiquidAI/d1-3B с задачей image-text-to-text. Это decision model на 3,1 млрд параметров, построе…
n8n 2.42.3: платформа для агентов с фокусом на стабильность self-hostedВышел выпуск 2.42.3 платформы n8n — визуального конструктора ИИ-агентов и рабочих процессов. С прошлого разбора накопилось шесть выпусков: 2.41.3, 2.4…
Blockway выпустила превью модели Agens-Volundr-32B для рассуждений, кода и агентной работыНа HuggingFace опубликована модель Blockway/Agens-Volundr-32B-Preview с задачей text-generation. Это превью-релиз от Blockway: архитектура, формат и п…
FlowHMR превращает захват движения из видео в задачу генерации с физическим контролемНа arXiv опубликована работа FlowHMR — метод восстановления глобального 3D-движения человека из монокулярного видео. Авторы формулируют задачу как ген…
ManifoldSplat редактирует форму 3D-головы текстом за 90 секундИсследователи представили ManifoldSplat — метод языкового редактирования формы анимируемых 3D-голов, восстановленных из монокулярного видео. Вместо пр…
Aleph Alpha выпустила открытую MoE-модель Kolibri-1-BF16 на 78 млрд параметровНа HuggingFace 2 октября 2026 года опубликована модель Aleph-Alpha/Kolibri-1-BF16 с задачей text-generation. Это mixture-of-experts модель для рассужд…
Apeireth: агентная ОС на Rust с топологической памятью и своим ядромВ конце сентября 2026 года на GitHub появился репозиторий Apeireth — агентная среда, которую авторы описывают как «AGI Operating System & Cognitive Mi…
SGLang v0.5.21: новые модели, ускорение DeepSeek-V4.1 и Decisions APIВышел выпуск инструмента запуска SGLang v0.5.21. В релиз вошло 779 пул-реквестов от 227 участников. Среди новых моделей — DeepSeek-V4.1, GigaChat 3.5…
Generative Cinematographer учит видеомодель управлять камерой и объектами в 3DНа arXiv 1 октября 2026 года опубликована работа Generative Cinematographer (GenCine) — система, которая поднимает одно изображение в редактируемую 3D…
vLLM v0.31.0rc3 добавляет случайные тестовые входы в Model Runner V2Вышел предварительный выпуск vLLM v0.31.0rc3. В него вошло изменение Model Runner V2: Support randomized dummy inputs, которое добавляет поддержку слу…
Обзор методов посттренировки и выравнивания видеогенераторов на arXivНа arXiv опубликован обзор Video Generation Models: A Survey of Post-Training and Alignment. Авторы систематизируют подходы к посттренировке видеомоде…
Cloudflare выложила модель clef для принятия решений по схемам вопросовНа HuggingFace 30 сентября 2026 года появилась модель Cloudflare/clef с задачей image-text-to-text. Модель принимает состояние в виде текста, JSON, из…
Whistle: модель распознавания речи для CPU вышла на HuggingFace30 сентября 2026 года на HuggingFace опубликована модель Cactus-Compute/whistle с задачей automatic-speech-recognition. Автор описывает её как speech…- Платформа для агентов Rig: выпуск 0.43.0 с локальной оценкой позы YOLOv830 сентября 2026 года вышел выпуск 0.43.0 платформы Rig — Rust-библиотеки для сборки модульных и масштабируемых приложений на базе LLM. Что нового Лок…
Wind Comic v12.460.0 — первый релиз после 700 обновлений в mainУ инструмента wind-comic вышел выпуск v12.460.0 — первый GitHub Release с апреля 2026 года. С тех пор все изменения уходили напрямую в main, и за это…
FracGen учит генерацию видео разрушению объектов по физическим сигналамАвторы FracGen представили модель генерации видео, которая по одному изображению целого объекта создаёт правдоподобную динамику разрушения, управляему…
EndoPrior-GS улучшает динамическую 3D-реконструкцию для эндоскопииИсследователи представили EndoPrior-GS — метод динамической эндоскопической реконструкции на основе 3D Gaussian Splatting. Работа опубликована на arXi…
MLX v0.32.3: исправления для запуска моделей на Apple SiliconВышел выпуск v0.32.3 инструмента запуска MLX. В обновлении — исправления операций scan и sort для оси нулевого размера, добавлен параметр correction в…
OOOSplat 0.5.0: автооптимизация, мостовое дополнение кадров и-досъёмкаВышел OOOSplat 0.5.0 — локальный инструмент для превращения видео и фото в 3D Gaussian Splatting. В выпуске появились автоматическая оптимизация парам…
Pydantic AI 2.51.0: поддержка GPT-Live и шесть выпусков за две недели25 сентября 2026 года вышел выпуск 2.51.0 платформы Pydantic AI — Python-фреймворка для создания ИИ-агентов с типизированным агентом циклом. С прошлог…
Ollama v0.40.0 переводит модели на MLX на Apple Silicon по умолчаниюВышел выпуск Ollama v0.40.0. Главное изменение: на устройствах Apple Silicon модели, архитектуры которых поддерживает среда выполнения MLX, теперь авт…
YuE2 Music skill 1.2.0: инструментальная генерация и каверы по описанию, ABC или записиУ инструмента YuE вышел выпуск YuE2 Music skill 1.2.0, который добавляет генерацию инструментальной музыки и инструментальных каверов по текстовому оп…
Reliability-Regulated Trajectory Optimization для COLMAP-free 3DGS выложен на arXivНа arXiv опубликована работа о методе оптимизации траектории камеры для progressive COLMAP-free 3D Gaussian Splatting. Авторы предлагают единый механи…
ViRDM убирает учителя и критика из дистилляции few-step видеоАвторы ViRDM предлагают метод пост-обучения генератора видео без учителя и критика, снижающий использование видеопамяти. Работа опубликована на arXiv…
DeltaWAM ускоряет генерацию действий для бимануальных роботов и выкладывает кодИсследователи из AIGeeksGroup представили DeltaWAM — модель world-action для управления двумя руками робота. Вместо предсказания плотных будущих кадро…
Qwen-Image-2.1 вышла на HuggingFace: генерация и редактирование изображений на 7B-моделиНа HuggingFace опубликована модель unsloth/Qwen-Image-2.1 — unified-модель для генерации изображений по тексту и редактирования. Дата публикации — 23…
LeWAM отказывается от видеодиффузии в пользу JEPA-эмбеддингов для world action modelsНа arXiv опубликована работа Latent evolving World Action Model, в которой авторы исследуют, как визуальные представления влияют на генерацию действий…
LichtFeld-Studio выпустил веса MoGe-3 ViT-L в нативном формате lfwУ LichtFeld-Studio вышел выпуск с весами MoGe-3 ViT-L base в нативном формате .lfw. Это модель глубины по умолчанию для SLAM-пайплайна и preprocess CL…
Xiaomi выпустила MiMo-V2.6-Flash-RL на HuggingFaceНа HuggingFace 21 сентября 2026 года опубликована модель XiaomiMiMo/MiMo-V2.6-Flash-RL с задачей text-generation. Автор описывает её как efficiency-ba…