llama.cpp v0.4.1 于 2026 年 9 月 14 日发布。本次更新新增对三种架构的支持:Maple 20B-A1B——面向 CPU 的 ternary MoE,Tencent Hy 4 处于 preview 状态,以及 Spark2.5。此外,ggml 已更新至 v0.24.0,改进了 JSON 模式处理、聊天解析、日志记录以及服务器子进程管理。
这意味着什么
对于在自己的硬件上运行模型的人来说,最重要的是新架构。Maple 20B-A1B 据称是支持 CPU 的 ternary MoE 模型,这意味着无需独立 GPU 即可运行。Tencent Hy 4 以 preview 模式加入:开发者警告称支持可能不完整,并会在后续版本中发生变化。Spark2.5 是另一种新架构,其细节在发布说明中并未披露。
API 的改动会影响开发者:llama_sampler_chain_n() 现在返回 int32_t 而非 int,server-common.h 中新增了 server_subproc 和 waiter,用于监控路由器的子进程。模型转换方面新增了 --fuse-qkv 标志,允许在将 HF 转换为 GGUF 时合并 Q/K/V 张量。
本次更新还修复了 Kimi-K3、DeepSeek2、GLM-MoE、Qwen(通义千问)和 Granite 相关的错误。已移除过时的参数 --mmap、--mlock 和 --direct-io——改用 --load-mode。新增了通过 --log-jsonl 实现的结构化 JSONL 日志记录。
对于使用 llama.cpp 在自己的机器上进行推理的用户,本次更新值得优先考虑,主要是为了现有模型的修复以及面向 CPU 的新架构 Maple。有关神经网络和本地运行工具的更多动态——请见
CPU3D 动态。
该方法的原理。示意图根据这篇简讯绘制。