CPU3D3D、视频与音频的 AI 工具

Aleph Alpha 发布 780 亿参数的开放 MoE 模型 Kolibri-1-BF16

2026 年 10 月 2 日,HuggingFace 上发布了模型 Aleph-Alpha/Kolibri-1-BF16,任务为 text-generation。这是一个用于推理的 mixture-of-experts 模型,聚焦德语和英语,具有显式的 reasoning 模式和工具调用。上下文为 1 048 576 个 token,对于复杂任务,作者建议最多使用 262 144 个 token。

这意味着什么

模型以 safetensors 格式计重 145.5 GB,最大的文件为 4.7 GB。参数总量为 78.1 亿,每个 token 激活 3.46 亿。许可证为 Apache 2.0。通过 vllm 启动。对于 BF16 权重,作者给出的最低配置为 4x A100 80 GB、4x H100 SXM5、2x H200、1x B200 或 1x B300。平台上还有 5 个 FP8 和 GGUF 量化版本,最小的可用版本是来自 InsidiousFiddler 的 Q4_K_XL,为 44.2 GB。 对于在单张消费级显卡上本地运行,BF16 版本的模型并不合适:占用约 156 GB。量化的 Q4_K_XL 为 44.2 GB,更接近现实,但作者并未说明其内存要求。可以在 CPU3D 动态中关注新版本和详细信息的出现。
Kolibri-1-BF16:78.1 亿参数的 MoE 模型 输入 德语文本 或英语 最多 1 048 576 tokens Kolibri-1-BF16 mixture-of-experts reasoning 模式 工具调用 共 78.1 亿 / 激活 3.46 亿 输出 text-generation 带推理的回答 工具结果 运行要求 BF16 权重 145.5 GB safetensors 占用约 156 GB 4x A100 80 GB 4x H100 SXM5 量化版本 5 个 FP8 与 GGUF 版本 Q4_K_XL — 44.2 GB 来自 InsidiousFiddler 单张显卡可用 硬件 2x H200 1x B200 1x B300 通过 vllm 运行 许可证 Apache 2.0 · HuggingFace · 任务 text-generation
该方法的构造。示意图根据这篇简讯绘制。

相关阅读