2026 年 9 月 21 日,模型 XiaomiMiMo/MiMo-V2.6-Flash-RL 在 HuggingFace 上发布,任务为 text-generation。作者将其描述为 MiMo-V2.6 系列中效率均衡的 checkpoint,该系列围绕将强化学习扩展到自我改进方向而构建:一次混合 RL 训练涵盖编码、智能体、视觉任务和网络安全,大批量下的异步 GRPO,以及用分组智能体评估取代二元检查。详情见
模型页面。
这意味着什么
模型很大:159.4 亿参数,MoE 架构。仓库中的完整权重占用 165.5 GB,最大的单个文件为 12.5 GB。许可证为 mit。通过 transformers 启动,权重以 safetensors 和 pt 格式发布。
该平台上有 24 个量化构建可用于本地运行:FP8、MLX、GGUF、NVFP4、GPTQ 和 EXL。最小的可用构建是 AesSedai/MiMo-V2.6-Flash-GGUF,为 90.1 GB,如果不算低于 4 比特的版本。这仍然是相当可观的体积:加载这样的构建需要相应数量的系统内存或显存,而开发者并未说明最低硬件要求。
要跟踪面向 3D 和视频的新 AI 工具,以及可在自己的硬件上运行的模型,请关注
CPU3D 动态。
该方法的结构。示意图根据这篇简讯绘制。