CPU3D3D、视频与音频的 AI 工具

廉价中国编程模型:2026年9月该选哪个

一位网页项目的开发者提出了一个简单的问题:该接入哪个不贵的模型来编程,按 token 付费,同时又能很好地完成任务。我们汇总了截至 2026 年 9 月 14 日中国模型的价格和独立测评,另外还把我们自己在用的 DeepSeek 放到自己的任务上做了额外验证。

简短回答。在便宜的模型里,首先值得试的是 DeepSeek V4.1-FlashGLM-5.3-Flash:两者都是每百万输入 token 约 $0.15、每百万输出 token $0.50—0.60,两者都处在独立排行榜的前列,而且都能原生接入 Claude Code、Cline 和 OpenCode。如果任务很重、预算允许花几倍的钱,那么明显更强的是 GLM-5.3。而如果看重的正是解决一个任务的成本而不是速度,那就看看小米的 MiMo-V2.5-Pro

我们对 DeepSeek V4.1-Flash 的实测给排行榜补充了一条实践观察。在不开启推理模式的情况下,模型解决了我们 20 个任务中的 19 个,每个任务耗时约两秒、花费三百分之一美分。两个智能体任务——借助工具修复一个小型仓库——模型在所有运行和所有模式下都解决了,而 Flash 的一次运行花费不到半美分。推理模式在这类任务上几乎没有任何增益,却贵 20—30 倍,而且在 32 千 token 的回答上限下有时会中断,最终没能给出代码。

质量与价格:中国代码模型Artificial Analysis 指数,越高越好输出,$ / 1MGLM-5.345$4.40Kimi K344$15.00GLM-5.3-Flash42$0.50DeepSeek V4.1-Flash40$0.60Qwen3.8-Flash40$0.47Claude Sonnet 538对比参考MiniMax-M330$1.20MiMo-V2.5-Pro26$0.87Hy326$0.53输出 token 低于 $1/百万更贵指数 v4.3 — Artificial Analysis;价格 — 官方页面;14.09.2026
Artificial Analysis 综合指数(其中包含编程和终端操作)与每百万输出 token 的价格。绿色为价格低于一美元的模型。

这要花多少钱

价格来自官方页面,按每百万 token 计。对编程来说最重要的是第三列:智能体会把同一批文件反复重读几十次,而输入的大部分都是重复内容,服务商会从缓存中读取。

模型输入缓存输入输出开放权重
DeepSeek V4.1-Flash$0.15$0.003$0.60是,MIT
GLM-5.3-Flash (Z.ai)$0.15$0.03$0.50是,MIT
Qwen3.8-Flash (Alibaba)$0.15有缓存折扣$0.47
MiMo-V2.5 (Xiaomi)$0.14$0.0028$0.28
MiMo-V2.5-Pro (Xiaomi)$0.435$0.0036$0.87是,MIT
Hy3 (Tencent)$0.132$0.033$0.528是,Apache 2.0
MiniMax-M3$0.30$0.06$1.20
GLM-5.3 (Z.ai)$1.40$0.26$4.40
Kimi K3 (Moonshot)$3.00$0.30$15.00

DeepSeek 有一个特点:上述价格适用于非高峰时段,而在工作日 01:00 至 04:00 和 06:00 至 10:00 UTC 一切都要贵一倍。按莫斯科时间算是 4:00—7:00 和 9:00—13:00,也就是说高峰正好落在工作日的上午。

独立测评显示了什么

厂商会公布令人印象深刻的数字,但那是他们自己的运行结果。与独立测评的差距有时大得惊人:据 Alibaba 的数据,Qwen3.6-27B 在 SWE-bench Verified 上解决了 77.2% 的任务,而在模型训练时不可能见过的新任务 SWE-rebench 上只有 31.2%。因此下面只列第三方测评。

Artificial Analysis —— 一组测试的综合指数,包含编程和终端操作(版本 4.3):

模型指数速度,token/秒
GLM-5.34572
Kimi K34437
GLM-5.3-Flash42109
DeepSeek V4.1-Flash40212
Qwen3.8-Flash4051
MiniMax-M330107
MiMo-V2.5-Pro2643
Hy32691
作为对比:Claude Sonnet 53876
作为对比:GPT-5.6 Luna38120

三个便宜的「flash」模型在指数上都高于 Claude Sonnet 5,同时 DeepSeek V4.1-Flash 是表中回答最快的——比 GLM-5.3-Flash 快一倍,比 Qwen3.8-Flash 快三倍。对于一个要连续执行几十步的智能体来说,速度直接转化为等待的分钟数。

SWE-rebench —— 修复真实仓库中的真实错误,111 个任务,出现在 2026 年 5 月 15 日至 7 月 1 日之间。这里有其他排行榜没有的东西:解决一个任务要花多少钱。

模型解决率$ / 任务$ / 已解决任务
GLM-5.262,9%1.402.23
MiniMax M347,2%0.952.01
MiMo-V2.5-Pro46,5%0.100.22
DeepSeek V4-Pro40,2%0.150.37
Qwen3.6-27B31,2%0.621.99
作为对比:Claude Opus 563,4%3.475.47
作为对比:Claude Sonnet 556,8%1.432.52

最后一列是我们的换算:任务价格除以解决率。较新的模型(DeepSeek V4.1-Flash、GLM-5.3、Qwen3.8)还不在这个窗口里,它们的任务会进入下一期。但格局已经可见:GLM 高配系列在解决率上几乎追平 Claude Opus 5,而价格低两倍半,而 MiMo-V2.5-Pro 解决得少一些,但它解决一个任务只要二十多美分。MiniMax M3 每 token 便宜,但消耗得多——每个任务 13,9 百万 token,而表中相邻的模型是 4—5,5 百万,所以最终算下来很贵。

Arena WebDev —— 由人工盲测比较各模型做出的网页界面的评分(数据截至 9 月 11 日)。中国模型中排名最高的是 Qwen3.8-Max(第 4 名)和 Kimi K3(第 5 名),Qwen3.8-Flash 第 9 名,GLM-5.3 和 DeepSeek V4.1-Flash 并列第 15—16 名,GLM-5.3-Flash 第 17 名。作为对比,Claude Opus 5 排第三。

实际中人们用什么。按 OpenRouter 上 9 月「编程」类别的 token 份额,排在最前的是 MiMo-V2.5(15,4%)、GPT-5.6 Luna(14,4%)和 GLM-5.3-Flash(12,8%);DeepSeek V4-Flash 和 V4.1-Flash 合计再贡献 12,1%。开发者用钱投票,投的正是便宜的模型。

我们的实测:DeepSeek V4.1-Flash 在自己的任务上

别人的排行榜回答的是「哪个模型更强」,但不回答「该开哪个模式、要花多少钱」。所以我们把自己在用的 DeepSeek 放到专门为这次验证编写的任务上跑了一遍:这些任务不可能出现在模型的训练数据里。

十个单一答案的任务,每个都有隐藏测试:解析形如「1h30m」的时长字符串、按 SemVer 规则排序版本、为 SQLite 写带窗口函数的 SQL 查询、修复一个有三个错误且运行缓慢的工作日计数函数、按 RFC 6902 实现 JSON Patch、把以戈比表示的金额拆分成份额且不丢失一戈比(最多到 1030)、带并发限制和取消的异步启动、用于限制请求频率的「令牌桶」、一个在 UTF-8 和数组键处理上有错误的 PHP 函数、带生存期的 JavaScript LRU 缓存。八个任务用 Python,各一个用 PHP 和 JavaScript。每个任务在每个模式下都做两次;如果测试失败,模型会看到测试输出并获得一次修正机会。

两个智能体任务——更接近在 Claude Code 或 Cline 中的工作。一个小型仓库,测试失败,模型有四个工具:列出文件、读取、写入和运行测试,最多 30 步。第一个仓库是网店的购物车,有舍入、优惠码和商品项相加的错误,外加一个没写完的收据;第二个是解析带时区、百分位数和需要从零编写的报告的 nginx 日志。成功标准是「所有测试通过,且测试文件未被改动」。

模式首次尝试借助测试提示每任务耗时回答 token 数任务价格
Flash 无推理18 / 2019 / 201,9 秒446$0.0003
Flash,推理 high17 / 2020 / 2040 秒11 829$0.0075
Flash,推理 max18 / 2020 / 2057 秒15 572$0.010
V4-Pro,推理 high16 / 2019 / 20232 秒16 881$0.043

不开启推理时模型几乎全部搞定,这是对日常工作最重要的结论。它只在版本排序上栽了跟头:用带结尾 $ 的正则表达式检查字符串,而在 Python 中这样的模式会放过带换行符的字符串,「1.2.3\n」被判定为合法版本。在一次运行中模型看到失败的测试后改正了,在另一次中重复了同样的错误。这是个经典错误,人在评审时也常常漏掉。

推理要贵 20—30 倍、慢 20—30 倍。它带来的提升不大,而这些模式下五次失败的首轮尝试中有四次根本与代码质量无关:模型撞上了我们设定的回答上限 32 768 token,在推理中途中断,一行代码都没写出来。许多智能体默认就设有类似的回答长度限制。如果你开启推理,就把上限调高:DeepSeek 允许最多 384 千 token。

这一点我们也验证了:把三个推理被中断的任务用 131 千 token 的余量再跑了一遍。max 模式解决了全部六次尝试(其中一次是第二次才成功,它误解了关于前导零的条件),high 模式六次中成功五次,但平均每个任务花掉 45—55 千推理 token、2—3 分钟和约三美分——比不推理贵一百倍。而在六次中有一次,high 模式为一个三十行的函数把全部 131 千 token 都想完了,花了五分钟,还是没给出回答。

智能体任务所有模式都搞定了:两个仓库在四次运行中的每一次都被修好,没有一次错误的工具调用,也没有试图改测试而不是改代码。

模式解决步数运行时间缓存输入运行价格
Flash 无推理4 / 4815 秒86%$0.0022
Flash,推理 high4 / 4516 秒82%$0.0027
Flash,推理 max4 / 4520 秒82%$0.0035
V4-Pro,推理 high4 / 4557 秒84%$0.0117

不开启推理时模型的做法不同:做八步而不是五步,工具调用更多,根据测试输出尝试和修正——但依然在同样的时间内完成,而且花费最低。而几分钱的价格来自缓存:智能体会重复读取 82—86% 的输入 token,DeepSeek 对它们每百万只收 $0.003。

V4-Pro 我们赶在最后一天做了验证。DeepSeek 宣布自 9 月 14 日起对它的请求会转发到 V4.1-Flash,但在实测期间 Pro 仍由自己的模型回答——这从回答中的服务端指纹可以看出。它解决得略少——20 个任务中 19 个,而同一模式下 Flash 是 20 个——而且每个任务平均耗时 232 秒对 40 秒,按 Pro 的价格花费 $0.043 对 $0.0075。它五次失败的尝试都是同样的 32 千 token 中断,而且每一次都要等七分钟以上:Pro 写回答明显更慢。智能体任务它解决得和 Flash 一样,但慢三倍、贵四倍。所以 DeepSeek 转向单一编程模型并不会损失什么。

订阅还是按 token 付费

除 DeepSeek 外几乎所有厂商都有按月付费、按五小时窗口限制请求的「编程计划」:GLM Coding Plan 每月 $18 起,小米的 Token Plan 每月 $6 起,MiniMax 每月 $22 起,Alibaba 只剩 $50 的 Pro 且模型列表中没有 Qwen3.8。如果你每天都用智能体,是有划算的。但订阅有两个限制:只允许从受支持的工具(Claude Code、Cline、OpenCode 之类)使用,而不能从自己的脚本使用,而且确切的限额往往不公布。对于不规律的使用和自己的代码,按 token 付费更简单。

如何接入 Claude Code

前三个候选都有兼容 Anthropic API 的地址,所以 Claude Code 无需中间层就能用它们——只要设置环境变量 ANTHROPIC_BASE_URLANTHROPIC_AUTH_TOKEN

  • DeepSeek:https://api.deepseek.com/anthropic,模型 deepseek-flash[1m](带百万 token 上下文)。DeepSeek 的官方说明要求设置 CLAUDE_CODE_EFFORT_LEVEL=max
  • Z.ai (GLM):https://api.z.ai/api/anthropic。默认所有角色都用 GLM-5.3-Flash,要用高配模型需手动指定。
  • Xiaomi (MiMo):https://api.xiaomimimo.com/anthropic

对于 Cline、Roo 以及其他使用 OpenAI 兼容 API 的工具,这些服务商也有普通地址。

关于从俄罗斯付款

据用户反馈,俄罗斯银行卡既不被 DeepSeek 接受,也不被 Z.ai 和 Alibaba Cloud 接受,而美团旗下的 LongCat 只收支付宝和微信支付。常见的办法是外国银行卡或 OpenRouter:它允许从俄罗斯访问,接受加密货币并收取约 5% 的手续费,出售表中大多数模型的访问权限。在 OpenRouter 上要留意具体是哪个供应商在服务该模型:便宜的有时是精简版本,工具调用不可用,而 DeepSeek 通过其自有节点的价格与官方一致。

那在自己的硬件上运行呢?

表中的所有模型都公开了权重,但并非所有都能在家里认真跑起来。DeepSeek V4.1-Flash 有 5520 亿参数,GLM-5.3-Flash 有 3200 亿,它们需要服务器。新模型里适合单张显卡的是 Apache 2.0 许可的 Qwen3.8-27B:在四比特量化 Q4_K_M 下它重 16,5 GB,连同上下文能装进 24 GB 的显卡。在 Arena WebDev 上它排第 18 名,紧随 GLM-5.3-Flash 之后——对本地模型来说相当不错,尽管在智能体工作上离云端「flash」还差得远。

结论

  • DeepSeek V4.1-Flash —— 默认的合理选择:便宜模型中最快,重复输入最便宜(缓存每百万 $0.003),而且经过我们实际验证。应该从无推理模式开始,只在棘手的算法上开启推理,并调高回答上限。繁重的会话适合在非高峰时段跑——工作日莫斯科时间 13:00 之后。
  • GLM-5.3-Flash —— 值得一试作对比:综合指数略高,输出更便宜,但缓存比 DeepSeek 贵十倍,而且回答速度慢一倍。Z.ai 有每月 $18 起的订阅。
  • GLM-5.3 —— 用于便宜模型卡壳的困难任务。该系列上一版本是中国模型中 SWE-rebench 上最好的,但按 token 算它比「flash」贵 7—9 倍。
  • MiMo-V2.5-Pro —— SWE-rebench 上最便宜的已解决任务,但模型很慢;适合没人等着回答的后台工作。
  • Kimi K3(每百万输出 token $15)和 MiniMax-M3(每个任务消耗大量 token)在成本上算不上便宜,尽管后者的每 token 价格并不高。

我们这次验证的局限值得记住:十个任务和两个小仓库不是 SWE-bench,而且我们只验证了 DeepSeek,其他模型是按独立排行榜比较的。在真实项目里,智能体每一步的上下文比我们仓库里大几十倍,所以各服务商之间缓存价格的差异在那里会比表中更明显。

来源

价格来自 DeepSeek、Z.ai、Alibaba Cloud Model Studio、Xiaomi MiMo、Tencent Cloud、MiniMax 和 Moonshot 的官方页面,截至 2026 年 9 月 14 日。独立测评:Artificial AnalysisSWE-rebenchArena WebDevOpenRouter,编程类别。厂商自己发布的关于自家模型的结果有意未纳入比较——只举了一个这样的数字作为差异的例子。

相关阅读