ИИ стал главным потребителем ИИ: агенты обогнали людей в 5 раз

Момент, который мы проспали
Есть даты, которые осознаёшь задним числом. 6 февраля 2026 года — именно такая. В этот день, по данным аналитика OpenRouter Питера Уокера, люди в последний раз потребили больше токенов, чем ИИ-агенты. Потом кривые разошлись — и больше не сошлись.
Сегодня, спустя полгода, агенты генерируют 7,3 триллиона токенов в неделю против 1,4 триллиона у людей. Соотношение — более пяти к одному. Рост агентного трафика составил 14x, тогда как человеческий вырос лишь в 2,8 раза. Это не тренд. Это структурный перелом в том, как вообще работает ИИ-инфраструктура.
Что такое OpenRouter и почему его данные важны
OpenRouter — это крупнейший агрегатор и маршрутизатор ИИ-моделей: около 70 провайдеров, сотни моделей, единый API. Через него проходит примерно 1% всей мировой инференс-нагрузки — и платформа ожидает обработать порядка 28 триллионов токенов за одну неделю. Это больше, чем Salesforce обработал за всё время своего существования.
Половина трафика — США, половина — остальной мир. Это делает данные OpenRouter редкой возможностью увидеть реальную картину, а не маркетинговые слайды отдельных лабораторий. Большинство платформ не публикует такую детализацию — OpenRouter публикует, и именно поэтому его статистика стала точкой отсчёта для всей индустрии.
Почему агенты едят токены как не в себя
Обычный чат с человеком — это короткий запрос и ответ. Агентная задача — совершенно другой зверь. Возьмём отладку кода: агент анализирует кодовую базу, воспроизводит ошибку, ищет решения, пишет патч, тестирует его, замечает новую проблему, начинает цикл заново. Каждый шаг тащит за собой тяжёлый контекст: определения инструментов, MCP-шлюзы, историю вызовов, результаты предыдущих итераций.
Одна агентная задача может стоить в 10–100 раз больше токенов, чем простой вопрос-ответ. По данным OpenRouter, агентные воркфлоу потребляют в 13–15 раз больше токенов на запрос, чем типичное человеческое взаимодействие. Если ваша финансовая модель по-прежнему считает ИИ-расходы как «люди печатают в чатбот» — она неверна.
Кэш спасает, но не полностью
Здесь важная оговорка: около 70% агентного потребления приходится на кэшированные промпты, которые тарифицируются значительно дешевле. Механизм KV-кэширования позволяет повторно использовать вычисления для повторяющихся фрагментов контекста — а у агентов таких фрагментов много (системные промпты, определения инструментов, неизменяемые части задачи).
Это означает, что реальный рост затрат медленнее, чем кажется по сырым цифрам. Но он всё равно колоссальный — и по мере усложнения задач кэш помогает всё меньше.
Hermes Agent: один агент против 49 приложений
Конкретный пример масштаба — агент Hermes от Nous Research. За одну неделю начала августа он обработал 1,5 триллиона токенов — почти столько же, сколько 49 других приложений вместе взятых на платформе. С момента запуска в марте 2026 года агент накопил 33,1 триллиона токенов в совокупности и задействовал 407 различных моделей.
Hermes Agent — это персистентная система с памятью между сессиями, более чем 40 встроенными инструментами и способностью вырабатывать новые навыки из собственного опыта. Nous Research вертикально интегрировали стек: их собственные модели Hermes 4 70B и Hermes 4 405B питают агента, одновременно будучи доступны другим разработчикам.
Три вещи, которые нужны агентам — и где всё ломается
КОО и сооснователь OpenRouter Крис Кларк выделяет три критических требования для агентного ИИ.
Первое — качество инференса. Один и тот же открытый чекпоинт, запущенный у разных провайдеров, показывает разные результаты на бенчмарках. Не из-за квантизации и не из-за злого умысла — просто между весами модели и валидным API-ответом стоит огромный слой программного обеспечения, в котором легко что-то сломать.
Второе — надёжный вызов инструментов. По данным OpenRouter, у одного из топовых семейств моделей 55% запросов содержали вызовы инструментов, модель использовала их в 83% случаев, и 46% завершений происходили именно через tool call. Агент, который красиво рассуждает, но генерирует невалидный JSON для вызова инструмента — бесполезен.
Третье — стабильность этих вызовов. Если JSON кривой, имя инструмента выдумано или параметры неверны — агент зависает. И success rate тоже варьируется от провайдера к провайдеру.
«Закон токенов» вместо закона Мура
Есть соблазн назвать происходящее новым законом Мура, только со стороны спроса. Закон Мура описывал удвоение транзисторов каждые два года — предложение полупроводников. «Закон токенов» описывает взрывной рост сложности задач, которые мы доверяем ИИ. OpenRouter показывает 12-кратный рост за год при времени удвоения около 3,5 месяца. Google перешёл от 980 триллионов до 1,3 квадриллиона токенов в месяц за два месяца. Alibaba сообщает об удвоении каждые несколько месяцев.
Открытые модели, особенно китайские, захватывают значительную долю в высокообъёмных задачах автоматизации и кодирования — они дешевле в расчёте на токен и достаточно хороши для конвейерных задач. Это давит на маржу OpenAI и Anthropic в сегменте агентного использования.
Что это значит для российских разработчиков
OpenRouter работает через VPN из России без особых проблем — платформа принимает карты международных платёжных систем, доступных через нерезидентские аккаунты. Для тех, кто строит агентные системы: единый API OpenRouter — это реальная страховка от vendor lock-in. Когда один провайдер меняет цены или деградирует по качеству, маршрутизатор переключает трафик.
Главный вывод для всех, кто закладывает бюджеты на ИИ в 2026–2027 годах: агентные воркфлоу — это другой порядок затрат. Не в два раза дороже чатбота. В десятки раз. Планируйте соответственно.
Данные, приведённые в этом материале, подтверждены несколькими независимыми публикациями на основе официальной статистики OpenRouter.
Похожие новости
Netflix убивает ручную логику рекомендаций: GenRec на языковой модели
Netflix противопоставил свой многолетний движок рекомендаций внутренней языковой модели GenRec — и старая система проиграла. Теперь история просмотров превращается в обычный текст.
DeepSeek даёт своей Flash-модели зрение и бросает вызов Claude Opus
DeepSeek выпустил экспериментальную мультимодальную модель V4-Flash-Vision-Exp, которая видит изображения и на агентных бенчмарках вплотную подходит к Anthropic Opus 4.8 — за десятую часть его цены.
Liquid AI ускорила инференс в 3,2 раза без потери качества
Liquid AI выпустила DSpark — черновики для спекулятивного декодирования LFM2.5, разгоняющие генерацию до 1362 токенов/с на H100 без изменения выходных данных.