神经网络新闻:3D、视频及可在自己硬件上运行的语言模型
关于工具变化的简讯:发布了新版本、许可证变更、新增对其他平台的支持。不转述新闻稿:如果某个说法无法关联到代码仓库、模型页面或官方网站,就不会发布简讯。
文章
132 篇文章
SupraLabs 发布紧凑型 text-to-image 模型 Supra2-IMGHuggingFace 上发布了模型 SupraLabs/Supra2-IMG——用于根据文本描述生成图像的 diffusion transformer。作者称其极小:约 1 亿参数,从零开始在合成数据上训练,输出分辨
Qwen(通义千问)发布用于改写提示词的模型 Qwen-Image-2.1-PE-T2I2026 年 9 月 20 日,模型 Qwen/Qwen-Image-2.1-PE-T2I 在 HuggingFace 上发布。它不是图像生成器,而是用于准备请求的辅助模型:它接收任意语言的简短描述,并将其转换为详细的
FrontierAgent:全新智能体环境,带 TUI、Agent Team 模式与质量评估FrontierAgent 是面向长时间研究与文件任务的开源智能体环境,仓库于 2026 年 8 月 22 日开放,28 天内获得约 4 千颗星。它集运行时、终端产品与智能体评估套件于一体
OpenBot:自带浏览器且完全掌控操作的智能体环境OpenBot 是一个用于创建 AI 智能体的新平台,其代码仓库于 2026 年 8 月 17 日开放,32 天内在 GitHub 上获得 5 112 颗星。作者将其描述为 open-source AI coworkers,其中每个智能体都获得自己的计算
Moondream 发布 Parakeet Redux — 1.58 位语音识别模型,参数量 149 百万2026 年 9 月 18 日,模型 moondream/parakeet-redux 在 HuggingFace 上发布,用于 automatic-speech-recognition。这是 parakeet-tdt-0.6b-v3 的 1.58 位版本:架构和分词器相同,但编码器的每个权重取值为…
Cube-Splat 发布开源全景 Gaussian Splatting SLAMarXiv 上发布了 Cube-Splat 的研究成果——一种基于 3D Gaussian Splatting 的全景 360 度图像同步定位与建图(SLAM)方法。作者将每个全景帧拆分为由清晰面组成的立方体贴图- Pipecat 1.11.0:支持手动重置的重采样器与场景中的函数调用评估2026 年 9 月 18 日,Pipecat 1.11.0 发布——这是一个用于实时语音和多模态智能体的开源 Python 框架。自上次解析以来共发布了两个版本:1.10.0 和 1.11.0。新增内容:音频流边界的手动控制。在 BaseAudio
LocalAI v4.10.0:集群仪表板、凭据文件和基准测试本地运行工具 LocalAI 发布了 v4.10.0 版本。作者描述了三个工作方向:集群管理、从私有来源加载模型以及后端修复。详情见 GitHub 上的发布说明。这意味着什么 对于那些
LichtFeld-Studio 发布用于图像匹配的 RoMa v1 权重工具 LichtFeld-Studio 发布了新版本——RoMa v1 dense matcher weights。这是一个采用原生 .lfw 格式的常驻模型资产,用于稠密化流程中匹配图像对。作者将该版本标记为
Xing4.0-29B-A4B:中国电信全新 310 亿参数 MoE 模型9 月 16 日,XingChen-AGI/Xing4.0-29B-A4B 模型在 HuggingFace 上发布——这是由中国电信人工智能技术研发的 Xing 系列(原 TeleChat)text-generation 模型。总参数量 290 亿,每个 token- PhysStream 推出带物理运动控制的流式视频生成一个研究团队在 arXiv 上发布了 PhysStream 工作——一种从图像生成视频的自回归模型,允许在生成过程中直接控制物体运动。与在开始前制定完整运动计划不同,
MoE-JEPA 以专家混合增强 V-JEPA,用于合成图像检测研究人员提出了 MoE-JEPA——一种基于 V-JEPA 2、加入 Residual Mixture-of-Experts 和独立噪声分析分支的架构,用于识别生成和伪造图像。该工作于 2026 年 9 月 15 日发表
NVIDIA 在 HuggingFace 上发布用于立体像对深度估计的模型 c-foundationstereo-sNVIDIA 在 HuggingFace 上发布了任务为 depth-estimation 的模型 c-foundationstereo-s。这是 FoundationStereo——一款根据立体相机的一对 RGB 图像进行深度估计的模型,输出视差图。开发者将其定位
llama.cpp v0.4.1:支持 Maple 20B-A1B、Tencent Hy 4 和 Spark2.5llama.cpp v0.4.1 于 2026 年 9 月 14 日发布。本次更新新增对三种架构的支持:Maple 20B-A1B——面向 CPU 的 ternary MoE,处于 preview 状态的 Tencent Hy 4,以及 Spark2.5。此外,ggml 已更新至 v0.24.0,改…
VC-Attention 在 GPU 上加速视频生成器的低位注意力VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention 的作者提出了一种针对 Diffusion Transformers 的免训练低位注意力方法。它解决了两个问题:value token 中的离群值导致的量化误…
廉价中国编程模型:2026年9月该选哪个一位网页项目开发者提出了一个简单问题:按 token 付费接入哪款不贵的编程模型,同时还能表现出色。我们汇总了中国模型截至9月14日的价格和独立测评
BubbleID:用于沸腾分析的图像分割模型已在 HuggingFace 发布2026 年 9 月 14 日,模型 UARK-NED3/BubbleID 在 HuggingFace 上发布,任务为 image-segmentation。这是一个用于分析泡状沸腾高速视频序列中液—汽边界的研究包。这意味着什么
OOOSplat v0.4.1 改进错误处理与预览稳定性OOOSplat v0.4.1 发布——本地 3D Gaussian Splatting 生成器的更新,聚焦于稳定性和故障处理。GitHub 上的发布说明描述了 COLMAP 重建失败时改进的提示,以及分离的错误诊断
Agnes-AI 发布 33 亿参数的开放预览模型 Agnes-3.0-FlashHuggingFace 上发布了任务为 text-generation 的模型 Agnes-AI/Agnes-3.0-Flash。这是 Agnes 3.0 Flash 的开放预览检查点,作者将其与 production/API 版本区分开来:开放模型的上下文为 262 144 个 token,而 A…
whisper.cpp v1.9.4:支持 Windows on ARM 并将 ggml 更新至 0.23.0whisper.cpp 运行工具发布 v1.9.4 版本。GitHub 仓库中公布了变更:构建流水线新增对 Windows on ARM 的支持,后端 ggml 更新至 0.23.0 版本,修复了解码器重复启动和顺序
Tri-DehazeGS 在照片 3D 重建中分离场景与雾霾研究团队提出了 Tri-DehazeGS——一种从烟雾或雾霾图像中恢复纯净 3D 场景的方法。该工作于 2026 年 9 月 10 日发表在 arXiv 上。作者提出将场景的纯净几何与大气
ComfyUI v0.35.0:支持 WAN3-Prime、Omni 1.1 及新增 3D 节点2026 年 09 月 09 日,ComfyUI v0.35.0 发布。本次更新包括对新合作模型的支持、用于处理网格的 3D 节点,以及若干与内存和视频相关的修复。这意味着什么 对于在自己的硬件上运行模型的用户,主要关注点在于
YuE2 开源发布,权重采用 CC BY-NC 4.0YuE(YuE(乐))工具发布了新版本 YuE2 · frontier music generation with symbolic planning。发布日期为 09.09.2026。GitHub 上的发布说明描述了三种场景:根据文本创作歌曲、基于转录旋律的 zero-shot 翻唱,以及迭代
YuE2-3B:可编辑乐谱的开源音乐生成模型HuggingFace 上发布了模型 m-a-p/YuE2-3B,任务为 text-to-audio。作者是 m-a-p,其工具已收录在我们的指南中。该模型有 3.6 亿参数,最大的权重文件为 safetensors 格式,占用 6.8 GB,压缩包
Programmable World Model — 用于具有持久状态的可控视频世界的新框架arXiv 上发表了 Programmable World Model 的研究,作者在其中提出了一个用于创建具有显式、在帧间保持状态的交互式视频世界的框架。与其直接从文本提示生成视频,
Test-time guidance 改善 image-to-3D 模型在部分观测下的几何研究人员提出了一种免训练方法,可在生成阶段考虑物体的部分几何观测,而无需微调模型。该方法在论文 Guiding Image-to-3D Generation with Test-Time Partial Ob 中描述
流式说话头像:作者分离音频与渲染以加速生成arXiv 上发表了论文 Decoupled Self-Forcing Distillation for Streaming Talking Head Generation。作者提出,对于流式说话头像生成,不将音频直接与视频的每个像素绑定,而是在低维空间中进行条件融合。
Edge0 发布可在 3 GB 内存中运行的 35B MoE 模型HuggingFace 上发布了 Edge0-35B-A3B-preview——一款 35B 级别的文本模型,采用稀疏 MoE 架构。作者声称其解码速度达 15 token/s,而活跃内存占用低于 3 GB。这意味着什么 该模型
Spectral Transport Homeostasis 方法无需修正视频时间一致性研究团队在 arXiv 上发表了一篇关于视频生成中时间一致性诊断与修正的论文。作者引入了 Spectral Tension 这一有符号诊断指标,用于比较局部散度
Nex-AGI 发布 Nex-N2.5-mini,350 亿参数的智能体模型HuggingFace 上发布了模型 nex-agi/Nex-N2.5-mini,任务类型为 text-generation。这是新系列 Nex-N2.5 中的较小模型,该系列专注于真实环境中的长程智能体任务:控制计算机、浏览器、自主...