HuggingFace 上发布了模型
IFM/K2-Horizon-MoVA-36B-A4B,任务为 text-generation。这是 K2-Horizon 系列中的稀疏模型:采用 Mixture-of-Experts 架构,搭配 Mixture-of-Values attention,存储 360 亿参数,每个 token 激活 40 亿。据作者描述,原生支持 512K token 上下文,并承诺将发布中间检查点、数据和训练代码。
这意味着什么
仓库中的完整权重以 safetensors 格式占用 69.7 GB,最大的文件为 3.9 GB。许可证为 apache-2.0,可通过 transformers 运行。平台上已有 15 个量化版本可供本地使用:GGUF、FP8、MLX、NVFP4、GPTQ。最紧凑的可运行版本是 NANI-Nithin 提供的 IQ4_XS,大小为 18.7 GB。
每个 token 激活 40 亿参数的模型,对本地运行来说负载适中,尤其是量化版本。完整权重需要较大的显存,但量化版本可以将模型放入单张消费级 GPU。开发者未明确不同格式的最低内存要求。
关注新模型和量化版本,可查看
CPU3D 动态。
方法原理示意图。此图根据该简讯绘制。