CPU3D3D、视频与音频的 AI 工具

Edge0 发布可在 3 GB 内存中运行的 35B MoE 模型

HuggingFace 上发布了 Edge0-35B-A3B-preview —— 一款 35B 级别的文本模型,采用稀疏 MoE 架构。作者声称,它在活跃内存占用低于 3 GB 的情况下,解码速度可达 15 令牌/秒。

这意味着什么

该模型共有 34.7 亿参数,仓库中的权重以 safetensors 格式占用 18.3 GB,许可证为 apache-2.0。运行通过 edge0 框架完成,采用专家流式加载:完整的 4 比特检查点保留在磁盘上,只有活跃权重会被加载进内存。平台上目前还没有量化版本——检查点已经以 int4 形式提供,并附带 LoRA 和 prerouter 适配器。 运行需要 edge0 框架本身,它会按访问情况从存储中流式加载专家权重。峰值内存受限于活跃权重集合,而非参数总量,因此该模型无需分片即可装入手机内存。这种方案对磁盘速度有多敏感,开发者并未说明。 该模型处于早期预览状态,现在判断其实际适用性还为时过早。但这种思路——把权重放在磁盘上、只加载所需的专家——对于那些在内存有限的机器上运行 LLM 的人来说很有意思。可以关注 CPU3D 动态了解后续进展。
Edge0-35B-A3B-preview:3 GB 内存中的 MoE 模型 稀疏 MoE 架构,34.7 亿参数,int4,apache-2.0 磁盘 完整 int4 检查点 18.3 GB safetensors LoRA + prerouter 适配器 edge0 框架 专家流式加载 从存储流式加载权重 按需访问 内存 活跃专家权重 低于 3 GB 无需分片 结果 解码 15 令牌/秒 手机 可装入内存 无需分片 状态 早期预览 实际可用性 思路:将权重保存在磁盘上,仅加载所需专家——适用于内存有限的机器
该方法的原理。示意图根据这篇简讯绘制。

相关阅读