Летом 2025 года на OpenRouter (маршрутизатор, через который разработчики гоняют запросы к разным моделям) около двух третей всех токенов — единиц, в которых считается объём работы модели, — уходило в модели американской разработки, прежде всего Google, OpenAI и Anthropic. Год спустя их доля опустилась примерно до 40%. В конце марта 2026 года модели китайской разработки впервые обогнали американские по недельному объёму и с тех пор держатся впереди.

Модели верхнего уровня — те, что задают текущий потолок возможностей, — за этот год стали заметно сильнее. Спрос при этом двинулся в обратную сторону.

Полтора месяца назад мы писали в статье «ИИ становится дорогой инфраструктурой», что доступ к сильным моделям дорожает и расслаивается, а умение понимать, какую модель для чего использовать, станет отдельным навыком. Тогда это был прогноз. Сейчас он виден в цифрах, и сдвиг идёт быстрее, чем мы ожидали.

Только объяснять его через цену — значит промахнуться. Дешёвые модели были и год назад, и два, а спрос стоял на месте. Изменилось не то, что появился дешёвый вариант. Изменилось то, что вопрос «какую модель взять» впервые стало осмысленно задавать не про компанию и даже не про продукт, а про отдельный шаг работы. Раньше на него был один ответ на всех. Про это и статья.

Куда ушёл спрос

Разворот случился быстро. В январе 2025 на модели китайской разработки (DeepSeek, Tencent, Alibaba, MiniMax, Xiaomi, Moonshot) приходилось меньше 5% токенов на OpenRouter. Летом 2025 они впервые дотянулись до 30%, к январю 2026 держались около трети, в конце марта обогнали американские, а к июлю подошли к 60%. Один DeepSeek идёт впереди любого другого поставщика: около 17% всего объёма.

Читать эти цифры буквально не стоит. OpenRouter — срез трафика разработчиков, а не весь рынок: корпоративные контракты с Microsoft, Google и Anthropic в него не попадают, и в деньгах картина другая, потому что дешёвые токены дают объём, но не выручку. Считаются доли по стране разработчика, так что американская — это не только три названные компании. И главное: «китайская модель» давно не синоним ни открытой, ни дешёвой. Китайские лаборатории вышли на верхний уровень и там же подняли цены — свежий флагман Kimi K3 стоит примерно столько же, сколько западные топовые модели, а отдельные западные дешевле него.

Так что граница проходит не по странам и не по лицензиям. Она проходит по уровню модели и её цене, а разница там серьёзная: дешёвая линейка идёт по 0,14 доллара за миллион входных токенов, флагман — по 5 долларов за тот же миллион. Разрыв больше чем в тридцать раз на одном и том же запросе. География тут следствие: так вышло, что нижний и средний уровень последний год активнее всего наполняли китайские лаборатории.

Что изменилось: середина дошла до рабочего состояния

Не верхний уровень подешевел — средний дорос до нормальной работы. Уровень GPT-4, который в 2023 году был вершиной и стоил около 30 долларов за миллион токенов, сегодня лежит в дешёвой линейке любого поставщика и стоит меньше доллара.

Но цена — не самое интересное. Для бизнеса и агентов важнее то, чего по бенчмаркам почти не видно. Подтянулись скучные вещи, на которых раньше всё разваливалось:

  • следование инструкции. Слабая модель год назад стабильно уплывала с формата на третьем абзаце. Сейчас средняя держит рамку;
  • структурированный вывод. Отдать данные по заданной схеме и не сломать её стало нормой, а не удачей;
  • вызов инструментов. Агент — это в основном цикл «подумал, дёрнул функцию, посмотрел результат». Год назад корректный вызов функции у дешёвых моделей был лотереей, сейчас это базовая ставка.

Агентская работа состоит не из олимпиадных задач, а из аккуратного выполнения понятных шагов много раз подряд. Пока средние модели на этой рутине ломались, выбор был предрешён: флагман везде, иначе не поедет. Как только они перестали ломаться, у каждого шага появился свой ответ — и вопрос про модель распался на много маленьких вопросов.

Почему шаг, а не продукт

Наш агент для исполнительной документации в строительстве разбирает документы стройки, проверяет комплектность и готовит акты. Звучит как одна большая задача, для которой надо выбрать одну модель. На деле это цепочка: понять, что за документ пришёл, вытащить поля, сверить со списком требований, собрать черновик акта, задать вопрос там, где данных не хватает.

Половина шагов — распознавание и перекладывание, где сильная и дешёвая модель дают один и тот же ответ, а счёт отличается в разы. Сложность живёт не по всей цепочке равномерно, она собрана в двух-трёх местах: где надо понять неоднозначную формулировку, состыковать противоречивые данные или решить, что делать дальше. Выбирать модель на весь процесс — значит платить по самому дорогому шагу за все остальные.

Юридический ИИ Harvey, где цена ошибки высокая и на дешёвых решениях обычно не экономят, пришёл к тому же. Они собрали гибридную схему: тяжёлые задачи уходят на флагманскую модель, рутина — на открытую и дешёвую. Счёт за обработку запросов упал втрое без потери качества. Их формулировка точнее нашей: определение качества сместилось с «берём самую мощную модель на всё» к «берём ту, что даёт правильный ответ наиболее эффективно».

Как выбирать на шаге

Главный параметр тут не сложность задачи, а длина участка, который агент проходит без человека. Когда он выполняет цепочку зависимых шагов, вероятности перемножаются. Шаг с точностью 95%, повторённый десять раз подряд, даёт на выходе около 59% успеха. При 90% на шаге получается 35%. При 85% остаётся 20% — то есть цепочка отрабатывает целиком один раз из пяти. Разница между моделями, которая на одном шаге выглядит как «ну чуть хуже», на длинной цепочке превращается в «не работает».

Отсюда правило: чем длиннее автономный участок, где никто не проверяет промежуточный результат, тем дороже должна быть модель.

Участок работыКто ловит ошибкуМожно ли экономить
Один шаг, результат смотрит человекчеловек, сразуДа. Разница между моделями почти не видна
Цепочка 3–5 шагов, проверка в концечеловек, в концеЧастично: на распознавании и переносе данных — да, на решениях — нет
10+ шагов подряд без остановкиниктоНет. Ошибки перемножаются
Вход в свободной форме: документ, который каждый заполняет по-своемуникто до самого концаНет
Длинный контекст, который надо удерживать целикомниктоНет
Цена ошибки выше, чем годовая разница в счётезависит от процессаНет, считать надо не токены

Обратная сторона правила приятнее: там, где проверка живая, требования к модели заметно мягче. Мы про это писали отдельно, когда разбирали связку человек плюс ИИ — средняя модель с проверкой регулярно сильнее флагманской без неё.

У самого подхода есть цена. Роутер, который решает, куда отправить запрос, — это код, который надо написать, отладить и поддерживать, плюс второй поставщик, второй ключ, второй режим отказа. На объёмах, где счёт за месяц измеряется десятками долларов, эта работа не окупится: там правильный ответ — одна модель на всё, и не думать.

На некоторых шагах дело вообще не в модели

Разложив процесс на шаги, мы наткнулись на неприятное. Тендерный агент Torgi (у нас пока пилот) работал неровно: где-то давал хороший разбор закупки, где-то терял половину документа или путал заказчика. Вышла модель посильнее, мы её подключили и ждали, что качество подтянется само. Получили чуть более гладкие формулировки и ровно те же потерянные документы. Модель тут была ни при чём: до неё просто не доезжала половина текста.

Пока середина была слабой, это различие не имело значения — выбор модели решал всё. Сейчас, когда середина выровнялась, на многих шагах разница между моделями стала меньше, чем разница между тем, что вокруг них построено.

Вокруг модели стоит обвязка: как собирается контекст, какие инструменты доступны, что делать при ошибке, где остановиться и спросить человека, что запоминается между запусками, как проверяется результат. Модель решает, насколько умный ответ вообще возможен. Обвязка решает, доедет ли до модели правильный вопрос и что произойдёт с ответом дальше.

Это достраивает вопрос про шаг. На каждом шаге спрашивать надо не только «какая модель», но и «модель ли здесь узкое место». Проверка простая: когда агент работает плохо, посмотрите на ошибки поштучно. Если модель получила всё нужное и всё равно ответила глупо — это про модель, и её стоит менять. Если она ответила плохо, потому что ей не дали половину документа, дали противоречивые инструкции или не оставили инструмента, чтобы уточнить, — никакая замена модели не поможет. По нашему опыту второй случай встречается заметно чаще.

Хорошая новость в том, что работающая обвязка переживает смену модели. Она пишется один раз и потом позволяет менять поставщика под задачу и под цену — а это ровно то, чего требует рынок, где лучший выбор устаревает за квартал. Средний сегмент шевелится быстрее всех: то, что было лучшим выбором в марте, к июлю уже вытеснено.

Что с этим делать компании

Пересмотрите решения, принятые больше года назад. Если вы выбирали модель в 2025 году, вы выбирали на другом рынке, где ставка на флагман была правильной, потому что альтернативы не работали. Сейчас та же ставка может стоить в разы дороже без выигрыша в качестве.

Разложите процесс на шаги и померьте. Не спорьте на совещании, какая модель умнее. Возьмите полсотни реальных случаев, прогоните каждый шаг на средней модели и на флагманской, сравните с эталоном. Обычно выясняется, что расхождение есть на двух шагах из семи — а заодно видно, на каких шагах виновата не модель.

Сначала контур, потом прайс. Если у вас персональные данные, медицина, финансы, гостайна или КИИ, вопрос «где эти данные имеют право обрабатываться» решается раньше вопроса про цену. Выбор сузится сам, и половина споров отпадёт.

Считайте стоимость операции. Один разобранный тендер, один комплект документов, один ответ клиенту — и что с этой цифрой станет, когда поток вырастет в десять раз.

Вместо итога

Год назад главный вопрос звучал так: дадут ли нам доступ к самой сильной модели. Он был осмысленным, пока ответ на всё был один.

Сейчас его больше нет. Есть два десятка мелких вопросов — по одному на каждый шаг процесса, — и на большинстве из них верхний уровень не нужен. Верхний уровень никуда не делся и на своих задачах незаменим, просто этих задач в обычной работе обычной компании оказалось немного.

Заголовки достаются вершине. Работу делает середина. А куда именно её ставить — решается не на уровне компании и не на уровне продукта, а на уровне шага.