神经网络新闻:3D、视频及可在自己硬件上运行的语言模型
关于工具变化的简讯:发布了新版本、许可证变更、新增对其他平台的支持。不转述新闻稿:如果某个说法无法关联到代码仓库、模型页面或官方网站,就不会发布简讯。
文章
132 篇文章
LiquidAI 发布 d1-3B——无需生成文本、单次前向即可决策的模型2026 年 10 月 5 日,LiquidAI/d1-3B 模型在 HuggingFace 上发布,任务类型为 image-text-to-text。这是一个拥有 31 亿参数的决策模型,基于 LFM2.5-VL-3B 构建:输入为状态——文本、JSON、图像或其混
n8n 2.42.3:专注自托管稳定性的智能体平台n8n 平台发布 2.42.3 版本——这是一个可视化构建 AI 智能体和工作流的平台。自上次解析以来共积累了六个版本:2.41.3、2.41.4、2.41.5、2.41.6、2.41.7 以及当前的 2.42.3。这些版本的重点是内核修复
Blockway 发布 Agens-Volundr-32B 模型预览版,面向推理、代码与智能体任务HuggingFace 上发布了模型 Blockway/Agens-Volundr-32B-Preview,任务为 text-generation。这是 Blockway 的预览版发布:架构、格式与后训练流程已定稿,但继续预训练仍在进行,完整版
FlowHMR 将视频动作捕捉转化为带物理控制的生成任务arXiv 上发布了 FlowHMR 的研究——一种从单目视频中恢复人体全局 3D 运动的方法。作者将任务表述为以视频为条件的运动生成,并先预训练 flow matching 模型。随后 mo
ManifoldSplat 用文本在 90 秒内编辑 3D 头部形状研究人员提出了 ManifoldSplat——一种对从单目视频重建的可动画 3D 头部进行语言编辑形状的方法。它不直接优化高斯点云,而是在结构化流形 FL 内部执行编辑
Aleph Alpha 发布 780 亿参数的开放 MoE 模型 Kolibri-1-BF162026 年 10 月 2 日,模型 Aleph-Alpha/Kolibri-1-BF16 在 HuggingFace 上发布,任务为 text-generation。这是一个用于推理的 mixture-of-experts 模型,侧重德语和英语,具有显式的 reasoning 模式和工具调用
Apeireth:基于 Rust 的智能体操作系统,具备拓扑记忆与自研内核2026 年 9 月底,GitHub 上出现了 Apeireth 仓库——作者将其描述为用纯安全 Rust 编写的「AGI Operating System & Cognitive Microkernel」智能体环境。28 天内该项目获得 303 颗星和三名贡献者。
SGLang v0.5.21:新模型、DeepSeek-V4.1 加速与 Decisions APISGLang 运行工具发布 v0.5.21 版本。本次发布包含来自 227 位贡献者的 779 个拉取请求。新模型包括 DeepSeek-V4.1、GigaChat 3.5、IQuest-Q1、MiMo-V2.6 和 MiMo-V2.6-Pro、Ling-3.0-flash-VL,以及扩散模型 Di…
Generative Cinematographer 教视频模型在 3D 中控制相机与物体2026 年 10 月 1 日,Generative Cinematographer(GenCine)在 arXiv 上发表——该系统可将单张图像提升为可编辑的 3D 场景,并允许联合设定相机与前景的运动。艺术家铺设
vLLM v0.31.0rc3 为 Model Runner V2 添加随机测试输入vLLM v0.31.0rc3 预发布版已发布。其中包含 Model Runner V2 的改动:Support randomized dummy inputs,即为新版模型运行器添加随机测试输入支持。这意味着什么 对于运行
arXiv 上视频生成器后训练与对齐方法综述arXiv 上发布了综述 Video Generation Models: A Survey of Post-Training and Alignment。作者系统梳理了无需从头重训练的视频模型后训练方法:supervised fine-tuning、self-training 和蒸馏
Cloudflare 发布 clef 模型,用于根据问题选项方案做出决策2026 年 9 月 30 日,HuggingFace 上出现了 Cloudflare/clef 模型,任务类型为 image-text-to-text。该模型接受文本、JSON、图像或视频形式的状态,并针对每个问题的每个可选选项返回概率
Whistle:面向 CPU 的语音识别模型已在 HuggingFace 发布2026 年 9 月 30 日,模型 Cactus-Compute/whistle 在 HuggingFace 发布,任务为 automatic-speech-recognition。作者将其描述为一款面向移动设备、可穿戴电子设备、机器人、智能家居、汽车- Rig 智能体平台:0.43.0 版本发布,支持 YOLOv8 本地姿态估计2026 年 9 月 30 日,Rig 平台发布 0.43.0 版本——这是一个用于构建基于 LLM 的模块化、可扩展应用的 Rust 库。新功能:YOLOv8 本地姿态估计——rig-candle 中新增了姿态估计支持,可执行
Wind Comic v12.460.0 — main 分支 700 次更新后的首个版本wind-comic 工具发布了 v12.460.0 版本——这是自 2026 年 4 月以来首个 GitHub Release。此后所有改动都直接进入 main 分支,期间累计了 700 多个版本,每个版本都记录在 VERSIONS.md 中。该版本固定了
FracGen 教视频生成模型根据物理信号模拟物体破碎FracGen 的作者提出了一种视频生成模型,它能根据一张完整物体的图像,生成由物理信号驱动的、逼真的破碎动态。为训练该模型,作者构建了基于 material point 的模拟器 FracSim
EndoPrior-GS 改进内窥镜动态 3D 重建研究人员提出了 EndoPrior-GS——一种基于 3D Gaussian Splatting 的动态内窥镜重建方法。该工作发表在 arXiv 上,项目页面可通过链接访问。作者将提取的视觉启发式方法与
MLX v0.32.3:修复在 Apple Silicon 上运行模型的问题MLX 运行工具发布 v0.32.3 版本。本次更新修复了零尺寸轴上的 scan 和 sort 操作,为 std 和 var 添加了 correction 参数,消除了调用 mx.clear_streams() 时的死锁,并修复了整数错误
OOOSplat 0.5.0:自动优化、桥接补帧与补拍OOOSplat 0.5.0 发布——一款将视频和照片转换为 3D Gaussian Splatting 的本地工具。此版本新增参数自动优化、覆盖不足时的桥接补帧、考虑可用视频的训
Pydantic AI 2.51.0:支持 GPT-Live,两周内发布六个版本2026 年 9 月 25 日,Pydantic AI 平台发布 2.51.0 版本——这是一个用于构建 AI 智能体的 Python 框架,具有类型化的智能体循环。自上次解析以来已累积六个版本:2.46.0、2.47.0、2.48.0、2.49.0、2.50.0 和 2.51.0。功能
Ollama v0.40.0 在 Apple Silicon 上默认将模型切换到 MLXOllama v0.40.0 发布。主要变化:在 Apple Silicon 设备上,架构受 MLX 运行时支持的模型现在会自动通过 MLX 启动。开发者的示例——ollama pull qwen3.8 和 ollama r
YuE2 Music skill 1.2.0:根据描述、ABC 或录音生成器乐与翻唱YuE 工具发布了 YuE2 Music skill 1.2.0 版本,新增根据文本描述、ABC 乐谱或参考录音生成器乐音乐和器乐翻唱的功能。详情见 GitHub 上的发布说明。软件包 yue2-m
Reliability-Regulated Trajectory Optimization 用于无 COLMAP 的 3DGS 已发布到 arXivarXiv 上发布了一篇关于渐进式无 COLMAP 3D Gaussian Splatting 的相机轨迹优化方法的论文。作者提出了一种统一的自监督双向循环机制,用于调节轨迹估计
ViRDM 在 few-step 视频蒸馏中移除教师和评论器ViRDM 作者提出一种无需教师和评论器的视频生成器后训练方法,可降低显存占用。该工作于 2026 年 9 月 24 日发表在 arXiv 上。原本的三个网络——教师、评论器和生成器——现在只剩下
DeltaWAM 加速双臂机器人动作生成并开源代码AIGeeksGroup 的研究人员推出了 DeltaWAM——一种用于控制机器人双臂的 world-action 模型。它不预测密集的未来帧,而是预测视觉增量和动作,而 Streaming Delta Memory 则更新缓存
Qwen-Image-2.1 已在 HuggingFace 发布:基于 7B 模型的图像生成与编辑HuggingFace 上发布了模型 unsloth/Qwen-Image-2.1 —— 一款用于文本生成图像和编辑的统一模型。发布日期为 2026 年 9 月 23 日。该模型支持最多 10 张参考图像、本地编辑
LeWAM 放弃视频扩散,改用 JEPA 嵌入构建 world action modelsarXiv 上发布了 Latent evolving World Action Model 论文,作者研究了视觉表示如何影响 World Action Models 中的动作生成。他们表明,来自 JEPA 编码器的预测性嵌入可支持
LichtFeld-Studio 发布原生 lfw 格式的 MoGe-3 ViT-L 权重LichtFeld-Studio 发布了一个版本,包含原生 .lfw 格式的 MoGe-3 ViT-L base 权重。这是 SLAM 流水线和 preprocess CLI 的默认深度模型。该版本被标记为 pre-release,只是为了不进入 Latest 徽章:这是 p
小米在 HuggingFace 发布 MiMo-V2.6-Flash-RL2026 年 9 月 21 日,XiaomiMiMo/MiMo-V2.6-Flash-RL 模型在 HuggingFace 上发布,任务为 text-generation。作者将其描述为 MiMo-V2.6 系列的 efficiency-balanced checkpoint,该系列围绕 reinf…
Audio8-ASR-Infinite:内存占用恒定的流式语音识别2026年9月21日,模型 Edge0/Audio8-ASR-Infinite 在 HuggingFace 上发布,任务为 text-generation。作者将其描述为原生流式语音识别,面向最低延迟设计:模型以 12,5 做出决策