2026 年 10 月 2 日,HuggingFace 上发布了模型
Aleph-Alpha/Kolibri-1-BF16,任务为 text-generation。这是一个用于推理的 mixture-of-experts 模型,聚焦德语和英语,具有显式的 reasoning 模式和工具调用。上下文为 1 048 576 个 token,对于复杂任务,作者建议最多使用 262 144 个 token。
这意味着什么
模型以 safetensors 格式计重 145.5 GB,最大的文件为 4.7 GB。参数总量为 78.1 亿,每个 token 激活 3.46 亿。许可证为 Apache 2.0。通过 vllm 启动。对于 BF16 权重,作者给出的最低配置为 4x A100 80 GB、4x H100 SXM5、2x H200、1x B200 或 1x B300。平台上还有 5 个 FP8 和 GGUF 量化版本,最小的可用版本是来自 InsidiousFiddler 的 Q4_K_XL,为 44.2 GB。
对于在单张消费级显卡上本地运行,BF16 版本的模型并不合适:占用约 156 GB。量化的 Q4_K_XL 为 44.2 GB,更接近现实,但作者并未说明其内存要求。可以在
CPU3D 动态中关注新版本和详细信息的出现。
该方法的构造。示意图根据这篇简讯绘制。