В июне 2025 года на OpenRouter (маршрутизатор, через который разработчики гоняют запросы к разным моделям) около 70% всех токенов уходило в модели трёх американских лабораторий: Google, OpenAI, Anthropic. Через год, в июне 2026, их доля упала примерно до 30%. Остальное разошлось по открытым и дешёвым моделям, в основном китайским.

Модели верхнего уровня — те, что задают текущий потолок возможностей, — за этот год стали заметно сильнее. Спрос при этом двинулся в обратную сторону.

Полтора месяца назад мы писали в статье «ИИ становится дорогой инфраструктурой», что доступ к сильным моделям дорожает и расслаивается, а умение понимать, какую модель для чего использовать, станет отдельным навыком. Тогда это был наш прогноз. Сейчас это видно в цифрах, и сдвиг идёт быстрее, чем мы ожидали. Только объяснение у него другое, чем кажется на первый взгляд.

Куда ушёл спрос

На том же OpenRouter к середине июня 2026 расклад между открытыми и закрытыми моделями перевернулся: 60 на 40 в пользу открытых. Тремя месяцами раньше, в марте, было ровно наоборот. Модели китайского происхождения (DeepSeek, Tencent, Alibaba, MiniMax, Xiaomi, Moonshot) занимают больше 45% всего объёма токенов, а годом раньше держали меньше 2%. Один DeepSeek за полгода удвоил долю, с 9% до примерно 18%, и идёт впереди любого другого поставщика.

Оговорка важная: OpenRouter — это срез трафика разработчиков, а не весь рынок. Корпоративные контракты с Microsoft, Google и Anthropic в эту статистику не попадают, и в деньгах картина другая, потому что дешёвые токены дают объём, но не выручку. Как индикатор поведения тех, кто платит за каждый запрос из своего кармана, срез всё равно показательный.

Самое простое объяснение звучит так: люди побежали за низкой ценой. Разница действительно большая: дешёвая открытая линейка идёт по 0,14 доллара за миллион входных токенов, флагман закрытого вендора — по 5 долларов за тот же миллион. Тридцатикратный разрыв на одном и том же запросе. Только цена сама по себе ничего не объясняет. Дешёвые модели были и год назад, и два. Просто раньше на них нельзя было ничего построить.

Что изменилось на самом деле: подтянулась нижняя планка

Вот это и есть главный сдвиг. Не верхний уровень подешевел, а средний дорос до нормальной работы.

Считать удобно по классу интеллекта. Уровень GPT-4, который в 2023 году был вершиной и стоил около 30 долларов за миллион токенов, сейчас стоит меньше доллара, а по отдельным оценкам считанные центы. Это падение примерно на 95% за два года и на порядки за три. Модель, за доступ к которой два года назад стояла очередь, сегодня лежит в дешёвой линейке любого поставщика и на многих задачах остаётся вполне рабочей.

Дистилляция усилила эффект. Смысл её в том, что большая модель обучает маленькую, и маленькая наследует нужное поведение, оставаясь в разы дешевле. Phi-4-reasoning-plus на 14 миллиардов параметров показывает 77,7% на математической олимпиаде AIME 2025 — столько же, сколько DeepSeek-R1 на 671 миллиард на том же бенчмарке. Это узкий срез, и переносить его на всё подряд нельзя, но направление понятное: разрыв между «большая» и «маленькая» перестал совпадать с разрывом «умная» и «глупая».

Для бизнеса и агентов важнее другое, и по бенчмаркам этого почти не видно. Подтянулись скучные вещи, на которых раньше всё разваливалось:

  • следование инструкции. Слабая модель год назад стабильно уплывала с формата на третьем абзаце. Сейчас средняя держит рамку;
  • структурированный вывод. Отдать JSON по схеме и не сломать его стало нормой, а не удачей;
  • вызов инструментов. Агент — это в основном цикл «подумал, дёрнул функцию, посмотрел результат». Год назад корректный вызов функции у дешёвых моделей был лотереей, сейчас это базовая ставка, и отдельные средние модели с тонкой настройкой под инструменты обгоняют универсальные флагманы на оркестрации.

Именно поэтому спрос переехал. Агентская работа состоит не из олимпиадных задач, а из аккуратного выполнения понятных шагов много раз подряд. Как только средние модели научились не ломаться на этой рутине, платить за флагман на каждом шаге стало нечем оправдать.

Вторая половина объяснения в том, что рабочие процессы устроены проще, чем выглядят снаружи. Наш агент для исполнительной документации в строительстве разбирает документы стройки, проверяет комплектность и готовит акты. Звучит как одна большая задача. На деле это цепочка: понять, что за документ пришёл, вытащить поля, сверить со списком требований, собрать черновик акта, задать вопрос там, где данных не хватает. Половина шагов — распознавание и перекладывание, где сильная и дешёвая модель дают один ответ, а счёт отличается в разы. Сложность живёт не по всей цепочке равномерно, она собрана в двух-трёх местах: где надо понять неоднозначную формулировку, состыковать противоречивые данные или решить, что делать дальше.

Юридический ИИ Harvey, где цена ошибки высокая и на дешёвых решениях обычно не экономят, пришёл к тому же. Они собрали гибридную схему: тяжёлые задачи уходят на флагманскую модель, рутина — на открытую и дешёвую. Стоимость инференса упала втрое без потери качества. Их формулировка точнее нашей: определение качества сместилось с «берём самую мощную модель на всё» к «берём ту, что даёт правильный ответ наиболее эффективно».

Где на модели экономить нельзя

Если остановиться здесь, получится вредный совет «поставьте везде среднюю модель и радуйтесь счёту». Есть математика, которая это ломает.

Когда агент выполняет цепочку зависимых шагов, вероятности перемножаются. Шаг с точностью 95%, повторённый десять раз подряд, даёт на выходе около 59% успеха. При 90% на шаге получается 35%. При 85% остаётся 20% — то есть цепочка отрабатывает целиком один раз из пяти. Разница между моделями, которая на одном шаге выглядит как «ну чуть хуже», на длинной цепочке превращается в «не работает».

Отсюда правило: чем длиннее автономный участок, где никто не проверяет промежуточный результат, тем дороже должна быть модель.

Участок работыКто ловит ошибкуМожно ли экономить
Один шаг, результат смотрит человекчеловек, сразуДа. Разница между моделями почти не видна
Цепочка 3–5 шагов, проверка в концечеловек, в концеЧастично: на распознавании и переносе данных — да, на решениях — нет
10+ шагов подряд без остановкиниктоНет. Ошибки перемножаются
Вход в свободной форме: документ, который каждый заполняет по-своемуникто до самого концаНет
Длинный контекст, который надо удерживать целикомниктоНет
Цена ошибки выше, чем годовая разница в счётезависит от процессаНет, считать надо не токены

Обратная сторона правила приятнее: там, где проверка живая, требования к модели заметно мягче. Мы про это писали отдельно, когда разбирали связку человек плюс ИИ — средняя модель с проверкой регулярно сильнее флагманской без неё.

И ещё одно, про что забывают на этапе презентации экономии. Роутер, который решает, куда отправить запрос, — это код, который надо написать, отладить и поддерживать. Плюс второй поставщик, второй ключ, второй режим отказа. По оценкам консультантов, средняя экономия у проектов, доведших роутинг до прода, около 38%, с разбросом от 30 до 70% в зависимости от однородности задач. На объёмах, где счёт за месяц измеряется десятками долларов, эта работа не окупится.

Отдельная история — организации, где данные вообще не могут покидать закрытый контур: банки, медицина, госсектор, объекты критической информационной инфраструктуры. Там выбор начинается не с прайса, а с вопроса, где эти данные имеют право обрабатываться, и подорожавшая середина открыла им отдельную дверь. Это тема отдельного разговора.

Почему замена модели чаще всего не помогает

Теперь неприятная часть, которая портит всю красивую арифметику про экономию.

У нас был понятный соблазн. Тендерный агент Torgi работал неровно: где-то давал хороший разбор закупки, где-то терял половину документа или путал заказчика. Вышла модель посильнее, мы её подключили и ждали, что качество подтянется само. Получили чуть более гладкие формулировки и ровно те же потерянные документы. Модель тут была ни при чём: до неё просто не доезжала половина текста.

Пока середина была слабой, выбор модели действительно решал: поставил флагман — поехало, поставил дешёвую — развалилось. Сейчас, когда середина выровнялась, разница между моделями на рутине стала меньше, чем разница между тем, что вокруг них построено.

Вокруг модели стоит обвязка: как собирается контекст, какие инструменты доступны, что делать при ошибке, где остановиться и спросить человека, что запоминается между запусками, как проверяется результат. Модель решает, насколько умный ответ вообще возможен. Обвязка решает, доедет ли до модели правильный вопрос и что произойдёт с ответом дальше. На потоке второе обычно дороже.

Отсюда практическая проверка, которая экономит месяцы. Когда агент работает плохо, посмотрите на ошибки поштучно. Если модель получила всё нужное и всё равно ответила глупо — это про модель, и её стоит менять. Если она ответила плохо, потому что ей не дали половину документа, дали противоречивые инструкции или не оставили инструмента, чтобы уточнить, — никакая замена модели не поможет. Мы это оплатили своим временем, и по нашему опыту второй случай встречается заметно чаще.

Есть тут и хорошая новость. Работающая обвязка переживает смену модели. Она пишется один раз и потом позволяет менять поставщика под задачу и под цену — а это ровно то, чего требует рынок, где лучший выбор устаревает за квартал. Средний сегмент шевелится быстрее всех: то, что было лучшим выбором в марте, к июлю уже вытеснено. Если смена модели означает переписывание половины кода, вы заплатите этой негибкостью больше, чем сэкономите на токенах.

Что с этим делать компании

Практический вывод не в том, чтобы срочно всё переводить на дешёвое. Он в том, что вопрос «какую модель взять» задан на неправильном уровне. Модель выбирается не для компании и даже не для продукта, а для шага.

Пересмотрите решения, принятые больше года назад. Если вы выбирали модель в 2025 году, вы выбирали на другом рынке. Тогда средний уровень действительно не тянул агентскую рутину, и ставка на флагман была правильной. Сейчас та же ставка может стоить вам в разы дороже без выигрыша в качестве.

Прежде чем менять модель, разберите ошибки. Замена модели — самое заметное действие и почти всегда не самое полезное. Сначала посмотрите, что вообще доехало до модели и что с её ответом сделали дальше.

Разложите процесс на шаги и померьте. Не спорьте на совещании, какая модель умнее. Возьмите полсотни реальных случаев, прогоните каждый шаг на средней модели и на флагманской, сравните с эталоном. Обычно выясняется, что расхождение есть на двух шагах из семи. Дальше вопрос закрыт цифрами, а не мнениями.

Сначала контур, потом прайс. Если у вас персональные данные, медицина, финансы, гостайна или КИИ, начинайте с вопроса, где эти данные имеют право обрабатываться. Выбор модели после этого сузится сам, и половина споров про цену отпадёт.

Считайте стоимость операции, а не подписки. Сколько стоит один разобранный тендер, один комплект документов, один ответ клиенту. И что с этой цифрой станет, когда поток вырастет в десять раз.

Вместо итога

Год назад главный вопрос звучал так: дадут ли нам доступ к самой сильной модели. Сейчас он звучит иначе: на каких шагах она нам действительно нужна и что мы построили вокруг неё.

Верхний уровень никуда не делся и на своих задачах незаменим. Просто планка снизу поднялась настолько, что обычная работа обычной компании почти вся оказалась ниже неё. Рутину закрывает модель, которая стоит в разы дешевле, помещается в собственный ЦОД и не попадает в заголовки про рекорды на бенчмарках.

Заголовки достаются вершине. Работу делает середина. А получится из неё рабочий инструмент или дорогая игрушка, решает уже не модель, а то, что вы собрали вокруг неё.