Летом 2025 года на OpenRouter (маршрутизатор, через который разработчики гоняют запросы к разным моделям) около двух третей всех токенов — единиц, в которых считается объём работы модели, — уходило в модели американской разработки, прежде всего Google, OpenAI и Anthropic. Год спустя их доля опустилась примерно до 40%. В конце марта 2026 года модели китайской разработки впервые обогнали американские по недельному объёму и с тех пор держатся впереди.
Модели верхнего уровня — те, что задают текущий потолок возможностей, — за этот год стали заметно сильнее. Спрос при этом двинулся в обратную сторону.
Полтора месяца назад мы писали в статье «ИИ становится дорогой инфраструктурой», что доступ к сильным моделям дорожает и расслаивается, а умение понимать, какую модель для чего использовать, станет отдельным навыком. Тогда это был прогноз. Сейчас он виден в цифрах, и сдвиг идёт быстрее, чем мы ожидали.
Только объяснять его через цену — значит промахнуться. Дешёвые модели были и год назад, и два, а спрос стоял на месте. Изменилось не то, что появился дешёвый вариант. Изменилось то, что вопрос «какую модель взять» впервые стало осмысленно задавать не про компанию и даже не про продукт, а про отдельный шаг работы. Раньше на него был один ответ на всех. Про это и статья.
Куда ушёл спрос
Разворот случился быстро. В январе 2025 на модели китайской разработки (DeepSeek, Tencent, Alibaba, MiniMax, Xiaomi, Moonshot) приходилось меньше 5% токенов на OpenRouter. Летом 2025 они впервые дотянулись до 30%, к январю 2026 держались около трети, в конце марта обогнали американские, а к июлю подошли к 60%. Один DeepSeek идёт впереди любого другого поставщика: около 17% всего объёма.
Читать эти цифры буквально не стоит. OpenRouter — срез трафика разработчиков, а не весь рынок: корпоративные контракты с Microsoft, Google и Anthropic в него не попадают, и в деньгах картина другая, потому что дешёвые токены дают объём, но не выручку. Считаются доли по стране разработчика, так что американская — это не только три названные компании. И главное: «китайская модель» давно не синоним ни открытой, ни дешёвой. Китайские лаборатории вышли на верхний уровень и там же подняли цены — свежий флагман Kimi K3 стоит примерно столько же, сколько западные топовые модели, а отдельные западные дешевле него.
Так что граница проходит не по странам и не по лицензиям. Она проходит по уровню модели и её цене, а разница там серьёзная: дешёвая линейка идёт по 0,14 доллара за миллион входных токенов, флагман — по 5 долларов за тот же миллион. Разрыв больше чем в тридцать раз на одном и том же запросе. География тут следствие: так вышло, что нижний и средний уровень последний год активнее всего наполняли китайские лаборатории.
Что изменилось: середина дошла до рабочего состояния
Не верхний уровень подешевел — средний дорос до нормальной работы. Уровень GPT-4, который в 2023 году был вершиной и стоил около 30 долларов за миллион токенов, сегодня лежит в дешёвой линейке любого поставщика и стоит меньше доллара.
Но цена — не самое интересное. Для бизнеса и агентов важнее то, чего по бенчмаркам почти не видно. Подтянулись скучные вещи, на которых раньше всё разваливалось:
- следование инструкции. Слабая модель год назад стабильно уплывала с формата на третьем абзаце. Сейчас средняя держит рамку;
- структурированный вывод. Отдать данные по заданной схеме и не сломать её стало нормой, а не удачей;
- вызов инструментов. Агент — это в основном цикл «подумал, дёрнул функцию, посмотрел результат». Год назад корректный вызов функции у дешёвых моделей был лотереей, сейчас это базовая ставка.
Агентская работа состоит не из олимпиадных задач, а из аккуратного выполнения понятных шагов много раз подряд. Пока средние модели на этой рутине ломались, выбор был предрешён: флагман везде, иначе не поедет. Как только они перестали ломаться, у каждого шага появился свой ответ — и вопрос про модель распался на много маленьких вопросов.
Почему шаг, а не продукт
Наш агент для исполнительной документации в строительстве разбирает документы стройки, проверяет комплектность и готовит акты. Звучит как одна большая задача, для которой надо выбрать одну модель. На деле это цепочка: понять, что за документ пришёл, вытащить поля, сверить со списком требований, собрать черновик акта, задать вопрос там, где данных не хватает.
Половина шагов — распознавание и перекладывание, где сильная и дешёвая модель дают один и тот же ответ, а счёт отличается в разы. Сложность живёт не по всей цепочке равномерно, она собрана в двух-трёх местах: где надо понять неоднозначную формулировку, состыковать противоречивые данные или решить, что делать дальше. Выбирать модель на весь процесс — значит платить по самому дорогому шагу за все остальные.
Юридический ИИ Harvey, где цена ошибки высокая и на дешёвых решениях обычно не экономят, пришёл к тому же. Они собрали гибридную схему: тяжёлые задачи уходят на флагманскую модель, рутина — на открытую и дешёвую. Счёт за обработку запросов упал втрое без потери качества. Их формулировка точнее нашей: определение качества сместилось с «берём самую мощную модель на всё» к «берём ту, что даёт правильный ответ наиболее эффективно».
Как выбирать на шаге
Главный параметр тут не сложность задачи, а длина участка, который агент проходит без человека. Когда он выполняет цепочку зависимых шагов, вероятности перемножаются. Шаг с точностью 95%, повторённый десять раз подряд, даёт на выходе около 59% успеха. При 90% на шаге получается 35%. При 85% остаётся 20% — то есть цепочка отрабатывает целиком один раз из пяти. Разница между моделями, которая на одном шаге выглядит как «ну чуть хуже», на длинной цепочке превращается в «не работает».
Отсюда правило: чем длиннее автономный участок, где никто не проверяет промежуточный результат, тем дороже должна быть модель.
| Участок работы | Кто ловит ошибку | Можно ли экономить |
|---|---|---|
| Один шаг, результат смотрит человек | человек, сразу | Да. Разница между моделями почти не видна |
| Цепочка 3–5 шагов, проверка в конце | человек, в конце | Частично: на распознавании и переносе данных — да, на решениях — нет |
| 10+ шагов подряд без остановки | никто | Нет. Ошибки перемножаются |
| Вход в свободной форме: документ, который каждый заполняет по-своему | никто до самого конца | Нет |
| Длинный контекст, который надо удерживать целиком | никто | Нет |
| Цена ошибки выше, чем годовая разница в счёте | зависит от процесса | Нет, считать надо не токены |
Обратная сторона правила приятнее: там, где проверка живая, требования к модели заметно мягче. Мы про это писали отдельно, когда разбирали связку человек плюс ИИ — средняя модель с проверкой регулярно сильнее флагманской без неё.
У самого подхода есть цена. Роутер, который решает, куда отправить запрос, — это код, который надо написать, отладить и поддерживать, плюс второй поставщик, второй ключ, второй режим отказа. На объёмах, где счёт за месяц измеряется десятками долларов, эта работа не окупится: там правильный ответ — одна модель на всё, и не думать.
На некоторых шагах дело вообще не в модели
Разложив процесс на шаги, мы наткнулись на неприятное. Тендерный агент Torgi (у нас пока пилот) работал неровно: где-то давал хороший разбор закупки, где-то терял половину документа или путал заказчика. Вышла модель посильнее, мы её подключили и ждали, что качество подтянется само. Получили чуть более гладкие формулировки и ровно те же потерянные документы. Модель тут была ни при чём: до неё просто не доезжала половина текста.
Пока середина была слабой, это различие не имело значения — выбор модели решал всё. Сейчас, когда середина выровнялась, на многих шагах разница между моделями стала меньше, чем разница между тем, что вокруг них построено.
Вокруг модели стоит обвязка: как собирается контекст, какие инструменты доступны, что делать при ошибке, где остановиться и спросить человека, что запоминается между запусками, как проверяется результат. Модель решает, насколько умный ответ вообще возможен. Обвязка решает, доедет ли до модели правильный вопрос и что произойдёт с ответом дальше.
Это достраивает вопрос про шаг. На каждом шаге спрашивать надо не только «какая модель», но и «модель ли здесь узкое место». Проверка простая: когда агент работает плохо, посмотрите на ошибки поштучно. Если модель получила всё нужное и всё равно ответила глупо — это про модель, и её стоит менять. Если она ответила плохо, потому что ей не дали половину документа, дали противоречивые инструкции или не оставили инструмента, чтобы уточнить, — никакая замена модели не поможет. По нашему опыту второй случай встречается заметно чаще.
Хорошая новость в том, что работающая обвязка переживает смену модели. Она пишется один раз и потом позволяет менять поставщика под задачу и под цену — а это ровно то, чего требует рынок, где лучший выбор устаревает за квартал. Средний сегмент шевелится быстрее всех: то, что было лучшим выбором в марте, к июлю уже вытеснено.
Что с этим делать компании
Пересмотрите решения, принятые больше года назад. Если вы выбирали модель в 2025 году, вы выбирали на другом рынке, где ставка на флагман была правильной, потому что альтернативы не работали. Сейчас та же ставка может стоить в разы дороже без выигрыша в качестве.
Разложите процесс на шаги и померьте. Не спорьте на совещании, какая модель умнее. Возьмите полсотни реальных случаев, прогоните каждый шаг на средней модели и на флагманской, сравните с эталоном. Обычно выясняется, что расхождение есть на двух шагах из семи — а заодно видно, на каких шагах виновата не модель.
Сначала контур, потом прайс. Если у вас персональные данные, медицина, финансы, гостайна или КИИ, вопрос «где эти данные имеют право обрабатываться» решается раньше вопроса про цену. Выбор сузится сам, и половина споров отпадёт.
Считайте стоимость операции. Один разобранный тендер, один комплект документов, один ответ клиенту — и что с этой цифрой станет, когда поток вырастет в десять раз.
Вместо итога
Год назад главный вопрос звучал так: дадут ли нам доступ к самой сильной модели. Он был осмысленным, пока ответ на всё был один.
Сейчас его больше нет. Есть два десятка мелких вопросов — по одному на каждый шаг процесса, — и на большинстве из них верхний уровень не нужен. Верхний уровень никуда не делся и на своих задачах незаменим, просто этих задач в обычной работе обычной компании оказалось немного.
Заголовки достаются вершине. Работу делает середина. А куда именно её ставить — решается не на уровне компании и не на уровне продукта, а на уровне шага.
