CPU3D3D、视频与音频的 AI 工具

Xing4.0-29B-A4B:中国电信全新 310 亿参数 MoE 模型

9月16日在 HuggingFace 上发布了模型 XingChen-AGI/Xing4.0-29B-A4B —— 这是 Xing 系列(前身为 TeleChat)的 text-generation 模型,由中国电信人工智能技术公司开发。在 290 亿总参数下,每个 token 仅激活 40 亿,上下文为 256K,可扩展至 512K。该模型完全在 Ascend NPU 平台上使用 MindSpore 框架训练。

这意味着什么

safetensors 格式的完整权重占用 58.1 GB,最大的文件为 4.1 GB。许可证为 apache-2.0。可通过 transformers 运行,同时声明兼容 vLLM、SGLang 和 KTransformers。平台上已有三个量化 GGUF 构建版本,最紧凑的可用版本是来自 jmarceno 的 12 GB 的 Q8_0。 本地运行完整模型需要可观的显存容量,但 12 GB 的 Q8_0 构建版本对消费级 GPU 来说看起来是现实的。代码已开源,因此如有需要可以针对自己的硬件重新构建。更多本地 AI 工具动态——请见 CPU3D 动态
Xing4.0-29B-A4B:中国电信 MoE 模型 Xing4.0-29B-A4B 290 亿参数 MoE, text-generation Apache-2.0 40 亿激活 每 token 上下文 256K—512K Ascend NPU 训练平台 MindSpore 58.1 GB safetensors 最大文件 4.1 GB 完整权重 Q8_0:12 GB GGUF 构建 transformers vLLM, SGLang KTransformers 本地运行 12 GB 上跑 Q8_0——消费级 GPU 可行 开源——可在自己的硬件上构建
该方法的原理。示意图根据这篇简讯绘制。

相关阅读