9月16日在 HuggingFace 上发布了模型
XingChen-AGI/Xing4.0-29B-A4B —— 这是 Xing 系列(前身为 TeleChat)的 text-generation 模型,由中国电信人工智能技术公司开发。在 290 亿总参数下,每个 token 仅激活 40 亿,上下文为 256K,可扩展至 512K。该模型完全在 Ascend NPU 平台上使用 MindSpore 框架训练。
这意味着什么
safetensors 格式的完整权重占用 58.1 GB,最大的文件为 4.1 GB。许可证为 apache-2.0。可通过 transformers 运行,同时声明兼容 vLLM、SGLang 和 KTransformers。平台上已有三个量化 GGUF 构建版本,最紧凑的可用版本是来自 jmarceno 的 12 GB 的 Q8_0。
本地运行完整模型需要可观的显存容量,但 12 GB 的 Q8_0 构建版本对消费级 GPU 来说看起来是现实的。代码已开源,因此如有需要可以针对自己的硬件重新构建。更多本地 AI 工具动态——请见
CPU3D 动态。
该方法的原理。示意图根据这篇简讯绘制。