ИИ стал главным потребителем ИИ: агенты обогнали людей в 5 раз

Момент, который мы проспали
Есть даты, которые осознаешь задним числом. 6 февраля 2026 года - именно такая. В этот день, по данным аналитика OpenRouter Питера Уокера, люди в последний раз потребили больше токенов, чем ИИ-агенты. Потом кривые разошлись - и больше не сошлись.
Сегодня, спустя полгода, агенты генерируют 7,3 триллиона токенов в неделю против 1,4 триллиона у людей. Соотношение - более пяти к одному. Рост агентного трафика составил 14x, тогда как человеческий вырос лишь в 2,8 раза. Это не тренд. Это структурный перелом в том, как вообще работает ИИ-инфраструктура.
Что такое OpenRouter и почему его данные важны
OpenRouter - это крупнейший агрегатор и маршрутизатор ИИ-моделей: около 70 провайдеров, сотни моделей, единый API. Через него проходит примерно 1% всей мировой инференс-нагрузки - и платформа ожидает обработать порядка 28 триллионов токенов за одну неделю. Это больше, чем Salesforce обработал за все время своего существования.
Половина трафика - США, половина - остальной мир. Это делает данные OpenRouter редкой возможностью увидеть реальную картину, а не маркетинговые слайды отдельных лабораторий. Большинство платформ не публикует такую детализацию - OpenRouter публикует, и именно поэтому его статистика стала точкой отсчета для всей индустрии.
Почему агенты едят токены как не в себя
Обычный чат с человеком - это короткий запрос и ответ. Агентная задача - совершенно другой зверь. Возьмем отладку кода: агент анализирует кодовую базу, воспроизводит ошибку, ищет решения, пишет патч, тестирует его, замечает новую проблему, начинает цикл заново. Каждый шаг тащит за собой тяжелый контекст: определения инструментов, MCP-шлюзы, историю вызовов, результаты предыдущих итераций.
Одна агентная задача может стоить в 10-100 раз больше токенов, чем простой вопрос-ответ. По данным OpenRouter, агентные воркфлоу потребляют в 13-15 раз больше токенов на запрос, чем типичное человеческое взаимодействие. Если ваша финансовая модель по-прежнему считает ИИ-расходы как "люди печатают в чатбот" - она неверна.
Кэш спасает, но не полностью
Здесь важная оговорка: около 70% агентного потребления приходится на кэшированные промпты, которые тарифицируются значительно дешевле. Механизм KV-кэширования позволяет повторно использовать вычисления для повторяющихся фрагментов контекста - а у агентов таких фрагментов много (системные промпты, определения инструментов, неизменяемые части задачи).
Это означает, что реальный рост затрат медленнее, чем кажется по сырым цифрам. Но он все равно колоссальный - и по мере усложнения задач кэш помогает все меньше.
Hermes Agent: один агент против 49 приложений
Конкретный пример масштаба - агент Hermes от Nous Research. За одну неделю начала августа он обработал 1,5 триллиона токенов - почти столько же, сколько 49 других приложений вместе взятых на платформе. С момента запуска в марте 2026 года агент накопил 33,1 триллиона токенов в совокупности и задействовал 407 различных моделей.
Hermes Agent - это персистентная система с памятью между сессиями, более чем 40 встроенными инструментами и способностью вырабатывать новые навыки из собственного опыта. Nous Research вертикально интегрировали стек: их собственные модели Hermes 4 70B и Hermes 4 405B питают агента, одновременно будучи доступны другим разработчикам.
Три вещи, которые нужны агентам - и где все ломается
КОО и сооснователь OpenRouter Крис Кларк выделяет три критических требования для агентного ИИ.
Первое - качество инференса. Один и тот же открытый чекпоинт, запущенный у разных провайдеров, показывает разные результаты на бенчмарках. Не из-за квантизации и не из-за злого умысла - просто между весами модели и валидным API-ответом стоит огромный слой программного обеспечения, в котором легко что-то сломать.
Второе - надежный вызов инструментов. По данным OpenRouter, у одного из топовых семейств моделей 55% запросов содержали вызовы инструментов, модель использовала их в 83% случаев, и 46% завершений происходили именно через tool call. Агент, который красиво рассуждает, но генерирует невалидный JSON для вызова инструмента - бесполезен.
Третье - стабильность этих вызовов. Если JSON кривой, имя инструмента выдумано или параметры неверны - агент зависает. И success rate тоже варьируется от провайдера к провайдеру.
"Закон токенов" вместо закона Мура
Есть соблазн назвать происходящее новым законом Мура, только со стороны спроса. Закон Мура описывал удвоение транзисторов каждые два года - предложение полупроводников. "Закон токенов" описывает взрывной рост сложности задач, которые мы доверяем ИИ. OpenRouter показывает 12-кратный рост за год при времени удвоения около 3,5 месяца. Google перешел от 980 триллионов до 1,3 квадриллиона токенов в месяц за два месяца. Alibaba сообщает об удвоении каждые несколько месяцев.
Открытые модели, особенно китайские, захватывают значительную долю в высокообъемных задачах автоматизации и кодирования - они дешевле в расчете на токен и достаточно хороши для конвейерных задач. Это давит на маржу OpenAI и Anthropic в сегменте агентного использования.
Что это значит для российских разработчиков
OpenRouter работает через VPN из России без особых проблем - платформа принимает карты международных платежных систем, доступных через нерезидентские аккаунты. Для тех, кто строит агентные системы: единый API OpenRouter - это реальная страховка от vendor lock-in. Когда один провайдер меняет цены или деградирует по качеству, маршрутизатор переключает трафик.
Главный вывод для всех, кто закладывает бюджеты на ИИ в 2026-2027 годах: агентные воркфлоу - это другой порядок затрат. Не в два раза дороже чатбота. В десятки раз. Планируйте соответственно.
Данные, приведенные в этом материале, подтверждены несколькими независимыми публикациями на основе официальной статистики OpenRouter.
Похожие новости
Google урезает бесплатный Gemini: с 9 октября только Flash Lite
С 9 октября бесплатные пользователи Gemini получат доступ только к Flash Lite. Платный AI Plus тоже теряет Pro - теперь он только в подписках за $20 и $100 в месяц.
Aleph Alpha выпустила Kolibri-1: 78B MoE с немецким языком и 1M токенов
Немецкая Aleph Alpha открыла веса модели Kolibri-1 под Apache 2.0: 78B параметров, из которых на каждый токен тратится лишь 3.46B, контекст до 1M токенов и ставка на суверенный ИИ.
Google урезает бесплатный Gemini: теперь только слабейшая модель
С октября 2026 Google оставляет бесплатным пользователям только Flash-Lite - самую слабую версию Gemini. Flash и Pro уходят за paywall.