CPU3DИИ-инструменты для 3D, видео и звука

Дешёвые китайские модели для программирования: что выбрать в сентябре 2026

Разработчик одного веб-проекта задал простой вопрос: какую недорогую модель подключить для программирования с оплатой по токенам, чтобы она при этом хорошо справлялась. Мы собрали цены и независимые замеры по китайским моделям на 14 сентября 2026 года, а DeepSeek, которым сами пользуемся, дополнительно проверили на своих задачах.

Короткий ответ. Из дешёвых первыми стоит пробовать DeepSeek V4.1-Flash и GLM-5.3-Flash: обе стоят около $0.15 за миллион входных токенов и $0.50—0.60 за миллион выходных, обе в верхней части независимых рейтингов и обе подключаются к Claude Code, Cline и OpenCode штатно. Если задачи тяжёлые и бюджет позволяет платить в несколько раз больше, заметно сильнее GLM-5.3. А если важна именно цена решённой задачи, а не скорость, посмотрите на MiMo-V2.5-Pro от Xiaomi.

Свой замер DeepSeek V4.1-Flash добавил к рейтингам практическое наблюдение. Без режима рассуждений модель решила 19 из 20 наших задач, тратя около двух секунд и три сотых цента на задачу. Оба агентных задания — починить небольшой репозиторий, пользуясь инструментами, — модель решила во всех прогонах и во всех режимах, а прогон на Flash обходился дешевле половины цента.Режим рассуждений на таких задачах почти ничего не прибавляет, стоит в 20—30 раз дороже, а при потолке ответа в 32 тысячи токенов иногда обрывается, так и не выдав код.

Качество и цена: китайские модели для кодаиндекс Artificial Analysis, больше — лучшевыход, $ за 1MGLM-5.345$4.40Kimi K344$15.00GLM-5.3-Flash42$0.50DeepSeek V4.1-Flash40$0.60Qwen3.8-Flash40$0.47Claude Sonnet 538для сравненияMiniMax-M330$1.20MiMo-V2.5-Pro26$0.87Hy326$0.53до $1 за миллион выходных токеновдорожеИндекс v4.3 — Artificial Analysis; цены — официальные страницы; 14.09.2026
Общий индекс Artificial Analysis (в него входят программирование и работа в терминале) и цена миллиона выходных токенов. Зелёным — модели дешевле доллара.

Сколько это стоит

Цены за миллион токенов с официальных страниц. Для программирования важнее всего третья колонка: агент перечитывает одни и те же файлы десятки раз, и большая часть входа приходится на повторы, которые провайдер берёт из кэша.

МодельВходВход из кэшаВыходОткрытые веса
DeepSeek V4.1-Flash$0.15$0.003$0.60да, MIT
GLM-5.3-Flash (Z.ai)$0.15$0.03$0.50да, MIT
Qwen3.8-Flash (Alibaba)$0.15скидка на кэш есть$0.47да
MiMo-V2.5 (Xiaomi)$0.14$0.0028$0.28да
MiMo-V2.5-Pro (Xiaomi)$0.435$0.0036$0.87да, MIT
Hy3 (Tencent)$0.132$0.033$0.528да, Apache 2.0
MiniMax-M3$0.30$0.06$1.20да
GLM-5.3 (Z.ai)$1.40$0.26$4.40да
Kimi K3 (Moonshot)$3.00$0.30$15.00да

У DeepSeek есть особенность: указанные цены действуют вне пика, а в будни с 01:00 до 04:00 и с 06:00 до 10:00 UTC всё стоит вдвое дороже. По московскому времени это 4:00—7:00 и 9:00—13:00, то есть пик приходится как раз на утро рабочего дня.

Что показывают независимые замеры

Производители публикуют впечатляющие числа, но это их собственные прогоны. Разница с независимыми бывает огромной: Qwen3.6-27B по данным Alibaba решает 77,2% задач SWE-bench Verified, а на свежих задачах SWE-rebench, которых модель не могла видеть при обучении, — 31,2%. Поэтому ниже только сторонние измерения.

Artificial Analysis — общий индекс по набору тестов, включая программирование и работу в терминале (версия 4.3):

МодельИндексСкорость, токенов/с
GLM-5.34572
Kimi K34437
GLM-5.3-Flash42109
DeepSeek V4.1-Flash40212
Qwen3.8-Flash4051
MiniMax-M330107
MiMo-V2.5-Pro2643
Hy32691
для сравнения: Claude Sonnet 53876
для сравнения: GPT-5.6 Luna38120

Три дешёвые «флэш»-модели стоят в индексе выше Claude Sonnet 5, при этом DeepSeek V4.1-Flash отвечает быстрее всех в таблице — вдвое быстрее GLM-5.3-Flash и вчетверо быстрее Qwen3.8-Flash. Для агента, который делает десятки шагов подряд, скорость напрямую превращается в минуты ожидания.

SWE-rebench — исправление настоящих ошибок в настоящих репозиториях, 111 задач, появившихся с 15 мая по 1 июля 2026 года. Здесь есть то, чего нет в других рейтингах: сколько денег уходит на одну задачу.

МодельРешено$ на задачу$ на решённую
GLM-5.262,9%1.402.23
MiniMax M347,2%0.952.01
MiMo-V2.5-Pro46,5%0.100.22
DeepSeek V4-Pro40,2%0.150.37
Qwen3.6-27B31,2%0.621.99
для сравнения: Claude Opus 563,4%3.475.47
для сравнения: Claude Sonnet 556,8%1.432.52

Последняя колонка — наш пересчёт: цена задачи, делённая на долю решённых. Свежих моделей (DeepSeek V4.1-Flash, GLM-5.3, Qwen3.8) в этом окне ещё нет, их задачи попадут в следующее. Но расклад виден: GLM старшей линейки почти догоняет Claude Opus 5 по доле решённого при цене в два с половиной раза ниже, а MiMo-V2.5-Pro решает меньше, зато его решённая задача стоит двадцать с небольшим центов. MiniMax M3 дёшев за токен, но тратит их много — 13,9 млн на задачу против 4—5,5 млн у соседей по таблице, поэтому в итоге выходит дорого.

Arena WebDev — оценки людей, которые сравнивают сделанные моделями веб-интерфейсы вслепую (данные на 11 сентября). Из китайских моделей выше всех Qwen3.8-Max (4-е место) и Kimi K3 (5-е), Qwen3.8-Flash на 9-м, GLM-5.3 и DeepSeek V4.1-Flash делят 15—16-е, GLM-5.3-Flash на 17-м. Для сравнения, Claude Opus 5 — третий.

Чем пользуются на деле. По доле токенов в категории «программирование» на OpenRouter в сентябре первые места у MiMo-V2.5 (15,4%), GPT-5.6 Luna (14,4%) и GLM-5.3-Flash (12,8%); DeepSeek V4-Flash и V4.1-Flash вместе дают ещё 12,1%. Разработчики голосуют деньгами ровно за дешёвые модели.

Наш замер: DeepSeek V4.1-Flash на своих задачах

Чужие рейтинги отвечают на вопрос «какая модель сильнее», но не на вопрос «какой режим включать и сколько это будет стоить». Поэтому DeepSeek, которым мы сами пользуемся, мы прогнали на задачах, написанных специально для этой проверки: в обучающих данных модели их быть не могло.

Десять задач с одним ответом, у каждой скрытые тесты: разбор строки длительности вида «1h30m», сортировка версий по правилам SemVer, SQL-запрос с оконными функциями для SQLite, исправление медленной функции подсчёта рабочих дней с тремя ошибками, JSON Patch по RFC 6902, раскладка суммы в копейках на доли без потери копейки (до 1030), асинхронный запуск с ограничением параллельности и отменой, «ведро токенов» для ограничения частоты запросов, функция на PHP с ошибками работы с UTF-8 и ключами массивов, LRU-кэш со сроком жизни на JavaScript. Восемь задач на Python, по одной на PHP и JavaScript. Каждая решалась дважды в каждом режиме; если тесты падали, модель видела их вывод и получала одну попытку исправить.

Два агентных задания — ближе к работе в Claude Code или Cline. Маленький репозиторий с падающими тестами, у модели четыре инструмента: список файлов, чтение, запись и запуск тестов, до 30 шагов. В первом репозитории корзина интернет-магазина с ошибками округления, промокодов и сложения позиций плюс недописанный чек, во втором — разбор журналов nginx с часовыми поясами, процентилями и отчётом, который нужно написать с нуля. Успехом считалось «все тесты проходят, а файлы тестов не тронуты».

РежимС первой попыткиС подсказкой тестовВремя на задачуТокенов в ответеЦена задачи
Flash без рассуждений18 из 2019 из 201,9 с446$0.0003
Flash, рассуждения high17 из 2020 из 2040 с11 829$0.0075
Flash, рассуждения max18 из 2020 из 2057 с15 572$0.010
V4-Pro, рассуждения high16 из 2019 из 20232 с16 881$0.043

Без рассуждений модель справилась почти со всем, и это главный вывод для повседневной работы. Спотыкалась она только на сортировке версий: проверяла строку регулярным выражением с $ в конце, а в Python такой шаблон пропускает строку с переводом строки, и «1.2.3\n» признавалась правильной версией. В одном прогоне модель исправилась, увидев упавший тест, в другом повторила ту же ошибку. Ошибка классическая, её нередко пропускает и человек на ревью.

Рассуждения обходятся в 20—30 раз дороже и в 20—30 раз медленнее. Итог они улучшили ненамного, а четыре из пяти неудачных первых попыток в этих режимах вообще не связаны с качеством кода: модель упиралась в заданный нами потолок ответа, 32 768 токенов, и обрывалась на середине рассуждений, так и не написав ни строки. Похожие ограничения на длину ответа стоят по умолчанию во многих агентах. Если включаете рассуждения, поднимите потолок: DeepSeek разрешает до 384 тысяч токенов.

Мы проверили и это: три задачи, на которых рассуждения обрывались, прогнали ещё раз с запасом в 131 тысячу токенов. Режим max решил все шесть попыток (одну — со второго раза, неверно поняв условие про ведущие нули), high — пять из шести, но в среднем на задачу ушло 45—55 тысяч токенов рассуждений, 2—3 минуты и около трёх центов — в сто раз больше, чем без рассуждений. А в одном случае из шести режим high продумал над функцией в тридцать строк все 131 тысячу токенов, пять минут, и снова не выдал ответа.

С агентными заданиями справились все режимы: оба репозитория починены в каждом из четырёх прогонов, без единого ошибочного вызова инструмента и без попыток подогнать тесты вместо кода.

РежимРешеноШаговВремя прогонаВход из кэшаЦена прогона
Flash без рассуждений4 из 4815 с86%$0.0022
Flash, рассуждения high4 из 4516 с82%$0.0027
Flash, рассуждения max4 из 4520 с82%$0.0035
V4-Pro, рассуждения high4 из 4557 с84%$0.0117

Без рассуждений модель действует по-другому: делает восемь шагов вместо пяти и больше вызовов инструментов, пробуя и поправляя по выводу тестов, — и всё равно укладывается в то же время и выходит дешевле всех. А копеечные цены объясняются кэшем: 82—86% входных токенов агент перечитывает повторно, и DeepSeek берёт за них $0.003 за миллион.

V4-Pro мы успели проверить в последний день. DeepSeek объявил, что с 14 сентября запросы к нему переадресуются на V4.1-Flash, но во время замера Pro ещё отвечал своей моделью — это видно по служебному отпечатку в ответе. Решил он чуть меньше — 19 задач из 20 против 20 у Flash в том же режиме, — а задача занимала у него в среднем 232 секунды против 40 и стоила по ценам Pro $0.043 против $0.0075. Все пять его неудачных попыток — тот же обрыв на 32 тысячах токенов, и каждого приходилось ждать больше семи минут: ответ Pro пишет заметно медленнее. Агентные задания он решил так же, как Flash, но втрое дольше и вчетверо дороже. Так что переход DeepSeek на одну модель для программирования ничего не отнимает.

Подписка или оплата по токенам

Почти у всех производителей, кроме DeepSeek, есть «планы для программирования» с месячной оплатой и лимитом запросов на пятичасовое окно: GLM Coding Plan от $18 в месяц, Token Plan у Xiaomi от $6, у MiniMax от $22, у Alibaba остался только Pro за $50 и без Qwen3.8 в списке моделей. Выгода есть, если в агенте сидят каждый день. Но у подписок два ограничения: пользоваться ими разрешено только из поддерживаемых инструментов (Claude Code, Cline, OpenCode и подобных), а не из своих скриптов, и точные лимиты часто не публикуются. Для нерегулярной работы и для своего кода проще оплата по токенам.

Как подключить к Claude Code

У всех трёх первых кандидатов есть адрес, совместимый с API Anthropic, поэтому Claude Code работает с ними без прослоек — достаточно переменных окружения ANTHROPIC_BASE_URL и ANTHROPIC_AUTH_TOKEN:

  • DeepSeek: https://api.deepseek.com/anthropic, модель deepseek-flash[1m] (с контекстом на миллион токенов). Официальная инструкция DeepSeek ставит CLAUDE_CODE_EFFORT_LEVEL=max.
  • Z.ai (GLM): https://api.z.ai/api/anthropic. По умолчанию все роли получают GLM-5.3-Flash, старшую модель нужно указать вручную.
  • Xiaomi (MiMo): https://api.xiaomimimo.com/anthropic.

Для Cline, Roo и других инструментов с OpenAI-совместимым API у тех же провайдеров есть обычные адреса.

Про оплату из России

По сообщениям пользователей, российские карты не принимают ни DeepSeek, ни Z.ai, ни Alibaba Cloud, а LongCat от Meituan берёт только Alipay и WeChat Pay. Обычные пути — зарубежная карта или OpenRouter: он пускает из России, принимает криптовалюту с комиссией около 5% и продаёт доступ к большинству моделей из таблицы. У OpenRouter стоит смотреть, какой именно поставщик обслуживает модель: у дешёвых бывают урезанные сборки и не работает вызов инструментов, а цена DeepSeek через его собственный узел совпадает с официальной.

А на своём железе?

Все модели из таблицы выложены с открытыми весами, но запускать дома всерьёз можно не всё. DeepSeek V4.1-Flash — это 552 млрд параметров, GLM-5.3-Flash — 320 млрд, для них нужен сервер. Из свежего для одной видеокарты годится Qwen3.8-27B под лицензией Apache 2.0: в четырёхбитной сборке Q4_K_M она весит 16,5 ГБ и помещается в видеокарту на 24 ГБ вместе с контекстом. На Arena WebDev она стоит 18-й, сразу за GLM-5.3-Flash, — для локальной модели очень прилично, хотя до облачных «флэшей» в агентной работе ей далеко.

Итог

  • DeepSeek V4.1-Flash — разумный выбор по умолчанию: самый быстрый из дешёвых, самый дешёвый на повторном входе ($0.003 за миллион из кэша) и проверен нами на деле. Начинать стоит с режима без рассуждений, включая их только на заковыристых алгоритмах и с поднятым потолком ответа. Тяжёлые сессии выгодно запускать вне пика — в будни после 13:00 по Москве.
  • GLM-5.3-Flash — стоит попробовать для сравнения: в общем индексе чуть выше, выход дешевле, но кэш вдесятеро дороже, чем у DeepSeek, и отвечает модель вдвое медленнее. У Z.ai есть подписка от $18 в месяц.
  • GLM-5.3 — для трудных задач, когда дешёвая модель буксует. Предыдущая версия этой линейки лучшая из китайских на SWE-rebench, но за токены она в 7—9 раз дороже «флэшей».
  • MiMo-V2.5-Pro — самая дешёвая решённая задача на SWE-rebench, но модель медленная; подойдёт для фоновой работы, где никто не ждёт ответа.
  • Kimi K3 ($15 за миллион выходных токенов) и MiniMax-M3 (много токенов на задачу) к дешёвым в работе не относятся, хотя цена за токен у второй и невысокая.

Ограничения нашей проверки стоит держать в голове: десять задач и два небольших репозитория — это не SWE-bench, а проверяли мы только DeepSeek, остальные модели сравнены по независимым рейтингам. На реальном проекте контекст каждого шага агента в десятки раз больше, чем в наших репозиториях, поэтому разница в цене кэша между провайдерами там ощущается сильнее, чем в таблице.

Источники

Цены — с официальных страниц DeepSeek, Z.ai, Alibaba Cloud Model Studio, Xiaomi MiMo, Tencent Cloud, MiniMax и Moonshot на 14 сентября 2026 года. Независимые замеры: Artificial Analysis, SWE-rebench, Arena WebDev, OpenRouter, категория «программирование». Результаты, которые производители публикуют о своих моделях сами, в сравнения намеренно не вошли — одно такое число приведено только как пример расхождения.

Смотрите также