HuggingFace 上发布了模型
Agnes-AI/Agnes-3.0-Flash,任务为 text-generation。这是 Agnes 3.0 Flash 的开放 preview 检查点,作者将其与 production/API 版本区分开来:开放模型的上下文为 262 144 个 token,而 API 版本为 1 百万个 token。该模型宣称是多模态的——文本、图像和视频。
这意味着什么
模型权重以 safetensors 格式发布,仓库总计 61.6 GB,最大的文件为 5.7 GB。许可证为 apache-2.0,通过 transformers 运行。平台上还有 8 个量化版本:GGUF、NVFP4、FP8 和 MLX。最小的可用版本是 4 位量化的 16.9 GB,即 Agnes-3.0-Flash-MLX-4bit。
要在本地以原始形式运行完整模型需要相当可观的显存,但 4 位版本降低了入门门槛。作者没有说明不同量化版本对 GPU 的最低要求。更多本地 AI 工具动态——见
CPU3D 动态。
该方法的原理。示意图根据本简讯绘制。