CPU3D3D、视频与音频的 AI 工具

llama.cpp v0.4.1:支持 Maple 20B-A1B、Tencent Hy 4 和 Spark2.5

llama.cpp v0.4.1 于 2026 年 9 月 14 日发布。本次更新新增对三种架构的支持:Maple 20B-A1B——面向 CPU 的 ternary MoE,Tencent Hy 4 处于 preview 状态,以及 Spark2.5。此外,ggml 已更新至 v0.24.0,改进了 JSON 模式处理、聊天解析、日志记录以及服务器子进程管理。

这意味着什么

对于在自己的硬件上运行模型的人来说,最重要的是新架构。Maple 20B-A1B 据称是支持 CPU 的 ternary MoE 模型,这意味着无需独立 GPU 即可运行。Tencent Hy 4 以 preview 模式加入:开发者警告称支持可能不完整,并会在后续版本中发生变化。Spark2.5 是另一种新架构,其细节在发布说明中并未披露。 API 的改动会影响开发者:llama_sampler_chain_n() 现在返回 int32_t 而非 int,server-common.h 中新增了 server_subproc 和 waiter,用于监控路由器的子进程。模型转换方面新增了 --fuse-qkv 标志,允许在将 HF 转换为 GGUF 时合并 Q/K/V 张量。 本次更新还修复了 Kimi-K3、DeepSeek2、GLM-MoE、Qwen(通义千问)和 Granite 相关的错误。已移除过时的参数 --mmap、--mlock 和 --direct-io——改用 --load-mode。新增了通过 --log-jsonl 实现的结构化 JSONL 日志记录。 对于使用 llama.cpp 在自己的机器上进行推理的用户,本次更新值得优先考虑,主要是为了现有模型的修复以及面向 CPU 的新架构 Maple。有关神经网络和本地运行工具的更多动态——请见 CPU3D 动态
llama.cpp v0.4.1 — 2026年9月14日发布 新架构 Maple 20B-A1B 面向 CPU 的三元 MoE Tencent Hy 4 预览模式 Spark2.5 细节未披露 内核与 API ggml v0.24.0 内核更新 llama_sampler_chain_n() 返回 int32_t server_subproc, waiter 进程监控 转换与日志 --fuse-qkv 合并 Q/K/V --log-jsonl 结构化日志 --load-mode 取代旧标志 错误修复 Kimi-K3, DeepSeek2, GLM-MoE, Qwen, Granite 现有模型的修复 值得为修复和 CPU 版 Maple 更新
该方法的原理。示意图根据这篇简讯绘制。

相关阅读