Дешёвые китайские модели для программирования: что выбрать в сентябре 2026
Разработчик одного веб-проекта задал простой вопрос: какую недорогую модель подключить для программирования с оплатой по токенам, чтобы она при этом хорошо справлялась. Мы собрали цены и независимые замеры по китайским моделям на 14 сентября 2026 года, а DeepSeek, которым сами пользуемся, дополнительно проверили на своих задачах.
Короткий ответ. Из дешёвых первыми стоит пробовать DeepSeek V4.1-Flash и GLM-5.3-Flash: обе стоят около $0.15 за миллион входных токенов и $0.50—0.60 за миллион выходных, обе в верхней части независимых рейтингов и обе подключаются к Claude Code, Cline и OpenCode штатно. Если задачи тяжёлые и бюджет позволяет платить в несколько раз больше, заметно сильнее GLM-5.3. А если важна именно цена решённой задачи, а не скорость, посмотрите на MiMo-V2.5-Pro от Xiaomi.
Свой замер DeepSeek V4.1-Flash добавил к рейтингам практическое наблюдение. Без режима рассуждений модель решила 19 из 20 наших задач, тратя около двух секунд и три сотых цента на задачу. Оба агентных задания — починить небольшой репозиторий, пользуясь инструментами, — модель решила во всех прогонах и во всех режимах, а прогон на Flash обходился дешевле половины цента.Режим рассуждений на таких задачах почти ничего не прибавляет, стоит в 20—30 раз дороже, а при потолке ответа в 32 тысячи токенов иногда обрывается, так и не выдав код.
Сколько это стоит
Цены за миллион токенов с официальных страниц. Для программирования важнее всего третья колонка: агент перечитывает одни и те же файлы десятки раз, и большая часть входа приходится на повторы, которые провайдер берёт из кэша.
| Модель | Вход | Вход из кэша | Выход | Открытые веса |
|---|---|---|---|---|
| DeepSeek V4.1-Flash | $0.15 | $0.003 | $0.60 | да, MIT |
| GLM-5.3-Flash (Z.ai) | $0.15 | $0.03 | $0.50 | да, MIT |
| Qwen3.8-Flash (Alibaba) | $0.15 | скидка на кэш есть | $0.47 | да |
| MiMo-V2.5 (Xiaomi) | $0.14 | $0.0028 | $0.28 | да |
| MiMo-V2.5-Pro (Xiaomi) | $0.435 | $0.0036 | $0.87 | да, MIT |
| Hy3 (Tencent) | $0.132 | $0.033 | $0.528 | да, Apache 2.0 |
| MiniMax-M3 | $0.30 | $0.06 | $1.20 | да |
| GLM-5.3 (Z.ai) | $1.40 | $0.26 | $4.40 | да |
| Kimi K3 (Moonshot) | $3.00 | $0.30 | $15.00 | да |
У DeepSeek есть особенность: указанные цены действуют вне пика, а в будни с 01:00 до 04:00 и с 06:00 до 10:00 UTC всё стоит вдвое дороже. По московскому времени это 4:00—7:00 и 9:00—13:00, то есть пик приходится как раз на утро рабочего дня.
Что показывают независимые замеры
Производители публикуют впечатляющие числа, но это их собственные прогоны. Разница с независимыми бывает огромной: Qwen3.6-27B по данным Alibaba решает 77,2% задач SWE-bench Verified, а на свежих задачах SWE-rebench, которых модель не могла видеть при обучении, — 31,2%. Поэтому ниже только сторонние измерения.
Artificial Analysis — общий индекс по набору тестов, включая программирование и работу в терминале (версия 4.3):
| Модель | Индекс | Скорость, токенов/с |
|---|---|---|
| GLM-5.3 | 45 | 72 |
| Kimi K3 | 44 | 37 |
| GLM-5.3-Flash | 42 | 109 |
| DeepSeek V4.1-Flash | 40 | 212 |
| Qwen3.8-Flash | 40 | 51 |
| MiniMax-M3 | 30 | 107 |
| MiMo-V2.5-Pro | 26 | 43 |
| Hy3 | 26 | 91 |
| для сравнения: Claude Sonnet 5 | 38 | 76 |
| для сравнения: GPT-5.6 Luna | 38 | 120 |
Три дешёвые «флэш»-модели стоят в индексе выше Claude Sonnet 5, при этом DeepSeek V4.1-Flash отвечает быстрее всех в таблице — вдвое быстрее GLM-5.3-Flash и вчетверо быстрее Qwen3.8-Flash. Для агента, который делает десятки шагов подряд, скорость напрямую превращается в минуты ожидания.
SWE-rebench — исправление настоящих ошибок в настоящих репозиториях, 111 задач, появившихся с 15 мая по 1 июля 2026 года. Здесь есть то, чего нет в других рейтингах: сколько денег уходит на одну задачу.
| Модель | Решено | $ на задачу | $ на решённую |
|---|---|---|---|
| GLM-5.2 | 62,9% | 1.40 | 2.23 |
| MiniMax M3 | 47,2% | 0.95 | 2.01 |
| MiMo-V2.5-Pro | 46,5% | 0.10 | 0.22 |
| DeepSeek V4-Pro | 40,2% | 0.15 | 0.37 |
| Qwen3.6-27B | 31,2% | 0.62 | 1.99 |
| для сравнения: Claude Opus 5 | 63,4% | 3.47 | 5.47 |
| для сравнения: Claude Sonnet 5 | 56,8% | 1.43 | 2.52 |
Последняя колонка — наш пересчёт: цена задачи, делённая на долю решённых. Свежих моделей (DeepSeek V4.1-Flash, GLM-5.3, Qwen3.8) в этом окне ещё нет, их задачи попадут в следующее. Но расклад виден: GLM старшей линейки почти догоняет Claude Opus 5 по доле решённого при цене в два с половиной раза ниже, а MiMo-V2.5-Pro решает меньше, зато его решённая задача стоит двадцать с небольшим центов. MiniMax M3 дёшев за токен, но тратит их много — 13,9 млн на задачу против 4—5,5 млн у соседей по таблице, поэтому в итоге выходит дорого.
Arena WebDev — оценки людей, которые сравнивают сделанные моделями веб-интерфейсы вслепую (данные на 11 сентября). Из китайских моделей выше всех Qwen3.8-Max (4-е место) и Kimi K3 (5-е), Qwen3.8-Flash на 9-м, GLM-5.3 и DeepSeek V4.1-Flash делят 15—16-е, GLM-5.3-Flash на 17-м. Для сравнения, Claude Opus 5 — третий.
Чем пользуются на деле. По доле токенов в категории «программирование» на OpenRouter в сентябре первые места у MiMo-V2.5 (15,4%), GPT-5.6 Luna (14,4%) и GLM-5.3-Flash (12,8%); DeepSeek V4-Flash и V4.1-Flash вместе дают ещё 12,1%. Разработчики голосуют деньгами ровно за дешёвые модели.
Наш замер: DeepSeek V4.1-Flash на своих задачах
Чужие рейтинги отвечают на вопрос «какая модель сильнее», но не на вопрос «какой режим включать и сколько это будет стоить». Поэтому DeepSeek, которым мы сами пользуемся, мы прогнали на задачах, написанных специально для этой проверки: в обучающих данных модели их быть не могло.
Десять задач с одним ответом, у каждой скрытые тесты: разбор строки длительности вида «1h30m», сортировка версий по правилам SemVer, SQL-запрос с оконными функциями для SQLite, исправление медленной функции подсчёта рабочих дней с тремя ошибками, JSON Patch по RFC 6902, раскладка суммы в копейках на доли без потери копейки (до 1030), асинхронный запуск с ограничением параллельности и отменой, «ведро токенов» для ограничения частоты запросов, функция на PHP с ошибками работы с UTF-8 и ключами массивов, LRU-кэш со сроком жизни на JavaScript. Восемь задач на Python, по одной на PHP и JavaScript. Каждая решалась дважды в каждом режиме; если тесты падали, модель видела их вывод и получала одну попытку исправить.
Два агентных задания — ближе к работе в Claude Code или Cline. Маленький репозиторий с падающими тестами, у модели четыре инструмента: список файлов, чтение, запись и запуск тестов, до 30 шагов. В первом репозитории корзина интернет-магазина с ошибками округления, промокодов и сложения позиций плюс недописанный чек, во втором — разбор журналов nginx с часовыми поясами, процентилями и отчётом, который нужно написать с нуля. Успехом считалось «все тесты проходят, а файлы тестов не тронуты».
| Режим | С первой попытки | С подсказкой тестов | Время на задачу | Токенов в ответе | Цена задачи |
|---|---|---|---|---|---|
| Flash без рассуждений | 18 из 20 | 19 из 20 | 1,9 с | 446 | $0.0003 |
| Flash, рассуждения high | 17 из 20 | 20 из 20 | 40 с | 11 829 | $0.0075 |
| Flash, рассуждения max | 18 из 20 | 20 из 20 | 57 с | 15 572 | $0.010 |
| V4-Pro, рассуждения high | 16 из 20 | 19 из 20 | 232 с | 16 881 | $0.043 |
Без рассуждений модель справилась почти со всем, и это главный вывод для повседневной работы. Спотыкалась она только на сортировке версий: проверяла строку регулярным выражением с $ в конце, а в Python такой шаблон пропускает строку с переводом строки, и «1.2.3\n» признавалась правильной версией. В одном прогоне модель исправилась, увидев упавший тест, в другом повторила ту же ошибку. Ошибка классическая, её нередко пропускает и человек на ревью.
Рассуждения обходятся в 20—30 раз дороже и в 20—30 раз медленнее. Итог они улучшили ненамного, а четыре из пяти неудачных первых попыток в этих режимах вообще не связаны с качеством кода: модель упиралась в заданный нами потолок ответа, 32 768 токенов, и обрывалась на середине рассуждений, так и не написав ни строки. Похожие ограничения на длину ответа стоят по умолчанию во многих агентах. Если включаете рассуждения, поднимите потолок: DeepSeek разрешает до 384 тысяч токенов.
Мы проверили и это: три задачи, на которых рассуждения обрывались, прогнали ещё раз с запасом в 131 тысячу токенов. Режим max решил все шесть попыток (одну — со второго раза, неверно поняв условие про ведущие нули), high — пять из шести, но в среднем на задачу ушло 45—55 тысяч токенов рассуждений, 2—3 минуты и около трёх центов — в сто раз больше, чем без рассуждений. А в одном случае из шести режим high продумал над функцией в тридцать строк все 131 тысячу токенов, пять минут, и снова не выдал ответа.
С агентными заданиями справились все режимы: оба репозитория починены в каждом из четырёх прогонов, без единого ошибочного вызова инструмента и без попыток подогнать тесты вместо кода.
| Режим | Решено | Шагов | Время прогона | Вход из кэша | Цена прогона |
|---|---|---|---|---|---|
| Flash без рассуждений | 4 из 4 | 8 | 15 с | 86% | $0.0022 |
| Flash, рассуждения high | 4 из 4 | 5 | 16 с | 82% | $0.0027 |
| Flash, рассуждения max | 4 из 4 | 5 | 20 с | 82% | $0.0035 |
| V4-Pro, рассуждения high | 4 из 4 | 5 | 57 с | 84% | $0.0117 |
Без рассуждений модель действует по-другому: делает восемь шагов вместо пяти и больше вызовов инструментов, пробуя и поправляя по выводу тестов, — и всё равно укладывается в то же время и выходит дешевле всех. А копеечные цены объясняются кэшем: 82—86% входных токенов агент перечитывает повторно, и DeepSeek берёт за них $0.003 за миллион.
V4-Pro мы успели проверить в последний день. DeepSeek объявил, что с 14 сентября запросы к нему переадресуются на V4.1-Flash, но во время замера Pro ещё отвечал своей моделью — это видно по служебному отпечатку в ответе. Решил он чуть меньше — 19 задач из 20 против 20 у Flash в том же режиме, — а задача занимала у него в среднем 232 секунды против 40 и стоила по ценам Pro $0.043 против $0.0075. Все пять его неудачных попыток — тот же обрыв на 32 тысячах токенов, и каждого приходилось ждать больше семи минут: ответ Pro пишет заметно медленнее. Агентные задания он решил так же, как Flash, но втрое дольше и вчетверо дороже. Так что переход DeepSeek на одну модель для программирования ничего не отнимает.
Подписка или оплата по токенам
Почти у всех производителей, кроме DeepSeek, есть «планы для программирования» с месячной оплатой и лимитом запросов на пятичасовое окно: GLM Coding Plan от $18 в месяц, Token Plan у Xiaomi от $6, у MiniMax от $22, у Alibaba остался только Pro за $50 и без Qwen3.8 в списке моделей. Выгода есть, если в агенте сидят каждый день. Но у подписок два ограничения: пользоваться ими разрешено только из поддерживаемых инструментов (Claude Code, Cline, OpenCode и подобных), а не из своих скриптов, и точные лимиты часто не публикуются. Для нерегулярной работы и для своего кода проще оплата по токенам.
Как подключить к Claude Code
У всех трёх первых кандидатов есть адрес, совместимый с API Anthropic, поэтому Claude Code работает с ними без прослоек — достаточно переменных окружения ANTHROPIC_BASE_URL и ANTHROPIC_AUTH_TOKEN:
- DeepSeek:
https://api.deepseek.com/anthropic, модельdeepseek-flash[1m](с контекстом на миллион токенов). Официальная инструкция DeepSeek ставитCLAUDE_CODE_EFFORT_LEVEL=max. - Z.ai (GLM):
https://api.z.ai/api/anthropic. По умолчанию все роли получают GLM-5.3-Flash, старшую модель нужно указать вручную. - Xiaomi (MiMo):
https://api.xiaomimimo.com/anthropic.
Для Cline, Roo и других инструментов с OpenAI-совместимым API у тех же провайдеров есть обычные адреса.
Про оплату из России
По сообщениям пользователей, российские карты не принимают ни DeepSeek, ни Z.ai, ни Alibaba Cloud, а LongCat от Meituan берёт только Alipay и WeChat Pay. Обычные пути — зарубежная карта или OpenRouter: он пускает из России, принимает криптовалюту с комиссией около 5% и продаёт доступ к большинству моделей из таблицы. У OpenRouter стоит смотреть, какой именно поставщик обслуживает модель: у дешёвых бывают урезанные сборки и не работает вызов инструментов, а цена DeepSeek через его собственный узел совпадает с официальной.
А на своём железе?
Все модели из таблицы выложены с открытыми весами, но запускать дома всерьёз можно не всё. DeepSeek V4.1-Flash — это 552 млрд параметров, GLM-5.3-Flash — 320 млрд, для них нужен сервер. Из свежего для одной видеокарты годится Qwen3.8-27B под лицензией Apache 2.0: в четырёхбитной сборке Q4_K_M она весит 16,5 ГБ и помещается в видеокарту на 24 ГБ вместе с контекстом. На Arena WebDev она стоит 18-й, сразу за GLM-5.3-Flash, — для локальной модели очень прилично, хотя до облачных «флэшей» в агентной работе ей далеко.
Итог
- DeepSeek V4.1-Flash — разумный выбор по умолчанию: самый быстрый из дешёвых, самый дешёвый на повторном входе ($0.003 за миллион из кэша) и проверен нами на деле. Начинать стоит с режима без рассуждений, включая их только на заковыристых алгоритмах и с поднятым потолком ответа. Тяжёлые сессии выгодно запускать вне пика — в будни после 13:00 по Москве.
- GLM-5.3-Flash — стоит попробовать для сравнения: в общем индексе чуть выше, выход дешевле, но кэш вдесятеро дороже, чем у DeepSeek, и отвечает модель вдвое медленнее. У Z.ai есть подписка от $18 в месяц.
- GLM-5.3 — для трудных задач, когда дешёвая модель буксует. Предыдущая версия этой линейки лучшая из китайских на SWE-rebench, но за токены она в 7—9 раз дороже «флэшей».
- MiMo-V2.5-Pro — самая дешёвая решённая задача на SWE-rebench, но модель медленная; подойдёт для фоновой работы, где никто не ждёт ответа.
- Kimi K3 ($15 за миллион выходных токенов) и MiniMax-M3 (много токенов на задачу) к дешёвым в работе не относятся, хотя цена за токен у второй и невысокая.
Ограничения нашей проверки стоит держать в голове: десять задач и два небольших репозитория — это не SWE-bench, а проверяли мы только DeepSeek, остальные модели сравнены по независимым рейтингам. На реальном проекте контекст каждого шага агента в десятки раз больше, чем в наших репозиториях, поэтому разница в цене кэша между провайдерами там ощущается сильнее, чем в таблице.
Источники
Цены — с официальных страниц DeepSeek, Z.ai, Alibaba Cloud Model Studio, Xiaomi MiMo, Tencent Cloud, MiniMax и Moonshot на 14 сентября 2026 года. Независимые замеры: Artificial Analysis, SWE-rebench, Arena WebDev, OpenRouter, категория «программирование». Результаты, которые производители публикуют о своих моделях сами, в сравнения намеренно не вошли — одно такое число приведено только как пример расхождения.



