Токен дешевеет — счёт растёт

Если вы следите за рынком AI, у вас наверняка сложилось ощущение: модели становятся мощнее, а стоимость токенов падает. Логично предположить, что и общие расходы на AI снижаются. Но именно здесь кроется ловушка, которую аналитики Gartner назвали Inference Paradox — «Инференс-парадокс».

По прогнозу Gartner, затраты на AI-инференс в расчёте на один агентный воркфлоу вырастут более чем в пять раз к 2028 году. И это несмотря на то, что стоимость обработки отдельных токенов продолжает снижаться. Как такое возможно? Давайте разберёмся.

ℹ Что такое AI-инференс?
Инференс (inference) — это процесс применения уже обученной AI-модели для получения ответов и выполнения задач. В отличие от обучения модели, инференс происходит при каждом запросе пользователя или каждом шаге агентного воркфлоу. Именно инференс составляет основную статью операционных расходов при эксплуатации AI-продуктов.

Что такое «Инференс-парадокс» по версии Gartner

Gartner называет это явление «Inference Paradox»: улучшение экономики моделей делает более мощные приложения финансово доступными, однако именно эти приложения требуют значительно большего объёма инференса для работы.

Gartner выделил три фундаментальных тренда, определяющих экономику токенов: экономика базовых моделей стремительно улучшается; рост эффективности AI открывает путь к развёртыванию более мощных и дорогих моделей для высокоценных приложений; более сложные AI-воркфлоу потребляют значительно больше токенов, чем простые чат-боты, что увеличивает общие затраты на инференс. В итоге токены становятся дешевле, но не так быстро, как растут возможности AI и связанные с ними расходы. Темп инноваций опережает кривую снижения стоимости.

Это и есть «Инференс-парадокс»: улучшение юнит-экономики ведёт к росту общей стоимости AI без чёткого пути к соразмерной и предсказуемой ценности.

«Рынок захвачен иллюзией дефляции токенов. Покупатели опасно предполагают, что по мере улучшения экономики токенов у провайдеров эта экономия будет отражена в их роадмапах.» — аналитики Gartner Уилл Соммер и Сабин Циммерханзл

⚠ Опасное заблуждение
Многие продакт-менеджеры и CTO ориентируются на стоимость токена как на главный индикатор AI-затрат. Однако токен-цены становятся всё менее полезным прокси для экономики AI-продукта. Более важный вопрос — сколько «интеллекта» система потребляет для выполнения полезной работы. Переход к агентным системам делает этот вопрос критическим.

Чат-бот против AI-агента: почему разница огромна

«Суровая экономика Инференс-парадокса наглядно видна в разнице между простым чат-ботом и AI-агентом», — говорит Соммер. «Там, где чат-бот должен лишь прочитать запрос и быстро ответить, AI-агент постоянно рассуждает, ведёт переговоры и ставит под сомнение собственные решения». Маршрутизация задачи к агентной reasoning-модели увеличивает затраты на инференс у провайдера как минимум в пять раз, а нередко и значительно больше по мере роста сложности задачи.

В отличие от базовых чат-ботов, которые отвечают на отдельные вопросы, AI-агенты умеют планировать, принимать решения, использовать инструменты и выполнять множество шагов. Эти возможности требуют значительно большей вычислительной мощности, увеличивая общую стоимость эксплуатации AI-сервиса.


graph TD
    A[Пользовательский запрос] --> B{Тип системы}
    B -->|Чат-бот| C[1 LLM-вызов]
    B -->|AI-агент| D[Reasoning: постановка задачи]
    D --> E[Планирование шагов]
    E --> F[Вызов инструментов / API]
    F --> G[Самопроверка и рефлексия]
    G --> H{Задача выполнена?}
    H -->|Нет| E
    H -->|Да| I[Финальный ответ]
    C --> J[Ответ]
    style C fill:#4ade80,color:#000
    style D fill:#f97316,color:#fff
    style E fill:#f97316,color:#fff
    style F fill:#f97316,color:#fff
    style G fill:#f97316,color:#fff

Масштаб потребления токенов

Исследование Goldman Sachs прогнозирует, что потребление токенов AI-агентами вырастет в 24 раза в период с 2026 по 2030 год, достигнув 120 квадриллионов токенов в месяц к 2030 году.

При этом производители полупроводников достигают расчётного снижения стоимости инференса примерно на 60–70% в год в пересчёте на токен. Эти тенденции выглядят противоречиво, но именно они объясняют Инференс-парадокс: даже если стоимость обработки одного токена падает на 60–70% в год, общие AI-расходы продолжают расти, если агентные приложения генерируют несравнимо больше токенов и вычислительных шагов.


Цифры: прогнозы затрат и масштаб проблемы

Сравнительная таблица: чат-бот vs AI-агент

ПараметрПростой чат-ботAI-агент (reasoning)
Количество LLM-вызовов15–50+
Токенов на запрос~500–2 00010 000–200 000+
Стоимость инференса (относительно)×1 (базис)×5 и выше
Самостоятельное планирование
Вызов внешних инструментов
Рефлексия / самопроверка
Мультиагентная оркестрация

Прогнозная таблица роста затрат и потребления

Показатель20262027 (оценка)2028 (прогноз)
Затраты на инференс / воркфлоу×1 (базис)~×2,5>×5
Потребление токенов AI-агентамибазис~×6~×24 (к 2030)
Глобальные AI-расходы$2,59 трлн~$3,5 трлн~$5+ трлн
Снижение стоимости токена (год к году)−60–70%−60–70%−60–70%

Gartner прогнозирует, что глобальные расходы на AI достигнут $2,59 триллиона в 2026 году — рост на 47% год к году, включая $401 миллиард на AI-инфраструктуру.

По оценкам Gartner, хотя стоимость токенов упадёт на 95% к 2030 году, затраты на инференс для агентных воркфлоу вырастут более чем в пять раз в течение ближайших двух лет.


Стратегии управления расходами на инференс

«Руководители продуктов не могут полагаться на улучшение токеновой экономики для обоснования AI-затрат», — предупреждает Уилл Соммер, старший директор-аналитик Gartner. Но что делать на практике? Gartner и индустриальные эксперты выделяют несколько рабочих подходов.

1. Inference Tiering (многоуровневый инференс)

Не все задачи требуют мощной reasoning-модели. Эффективная стратегия — маршрутизировать задачи по принципу сложности:

  • Простые запросы → лёгкая, дешёвая модель (например, small LLM или специализированная модель)
  • Средней сложности → стандартная LLM
  • Сложные, многошаговые → мощная reasoning-модель

Обеспечение ROI от продвинутого AI, такого как reasoning-агенты, требует экспоненциально более высокой отдачи по сравнению с базовыми моделями — либо высоко оптимизированного инференс-тиринга, маршрутизации и оркестрации для калибровки сложных задач относительно более экономичного интеллекта.

2. Оркестрация и кеширование

Многие токены в агентных воркфлоу расходуются повторно: системные промпты, контекст задачи, инструкции. Кеширование промптов (prompt caching) уже поддерживается крупными провайдерами и позволяет сократить повторные расходы на 50–80%.

3. Мультимодельные экосистемы

«Надёжной, экономичной универсальной модели на горизонте нет. Создание конкурентоспособных AI-продуктов потребует разработки и поддержки сложных мультимодельных экосистем».

4. Измерение «интеллекта на задачу», а не стоимости токена

Ключевой сдвиг в метриках: вместо «стоимость токена» использовать «стоимость завершённой задачи» или «ROI на воркфлоу». Это позволяет реально оценить экономическую эффективность AI-агентов в сравнении с человеческим трудом или более простыми автоматизациями.

💡 Практический совет
При проектировании агентного воркфлоу начните с аудита задач: какие шаги действительно требуют reasoning-модели, а какие можно решить детерминированным кодом, SQL-запросом или лёгкой моделью? Замена даже 30–40% «тяжёлых» шагов более дешёвыми альтернативами может снизить итоговый счёт в 2–3 раза без потери качества результата.
📝 Реальный кейс: автоматизация юридического анализа

Представьте юридическую фирму, которая запускает AI-агент для анализа договоров. Первоначальная архитектура направляла каждый шаг — от извлечения текста до классификации рисков и генерации резюме — в одну мощную reasoning-модель.

Результат до оптимизации: $4,20 за анализ одного договора.

После аудита команда разделила воркфлоу:

  • Извлечение текста и нормализация → специализированная лёгкая модель
  • Классификация рисков по шаблонам → fine-tuned малая модель
  • Только финальный анализ нюансов и генерация резюме → reasoning-модель

Результат после оптимизации: $0,85 за договор — снижение затрат в ~5 раз при сопоставимом качестве.

Этот подход соответствует принципу inference tiering, рекомендованному Gartner: калибруй сложность задачи под стоимость модели, а не наоборот.


Что это означает для бизнеса и продуктовых команд

По мере того как Nvidia и другие технологические гиганты продвигают инференс и агентный AI как следующую стадию AI-волны, Gartner предупреждает: стоимость внедрения этих систем будет расти, даже когда базовые модели дешевеют.

По мере того как AI-продукты эволюционируют от вспомогательных функций к многошаговому исполнению, руководители продуктов сталкиваются с новой проблемой маржи: снижение цен на модели субсидирует более сложные воркфлоу и ведёт к росту общих AI-затрат. В результате управление стоимостью инференса стало приоритетом номер один для продуктовых руководителей.

Это означает конкретные сдвиги в том, как компании должны планировать AI-продукты:

  1. Включать стоимость инференса в юнит-экономику продукта с первого дня — не как DevOps-расход, а как переменную себестоимость.
  2. Моделировать сценарии роста: если пользователей станет вдвое больше, а задачи усложнятся — насколько вырастет счёт?
  3. Строить observability для AI-затрат: логировать расход токенов на уровне каждого шага воркфлоу, а не только на уровне запроса.
  4. Проектировать деградацию: при превышении бюджета — автоматически переключаться на более дешёвые модели, а не останавливать сервис.

Заключение: платите за результат, а не за токены

Мало кто ожидал, что именно рост эффективности может привести к увеличению счёта. По мере того как улучшенная эффективность позволяет исследовательским лабораториям разрабатывать и развёртывать более мощные и дорогие модели, а пользователи находят всё более сложные применения — например, агентные воркфлоу — потребление токенов продолжает расти.

Инференс-парадокс — не приговор для агентного AI. Это сигнал к тому, что индустрия переходит в новую фазу зрелости: фазу, где побеждает не тот, кто имеет доступ к самой мощной модели, а тот, кто умеет выстраивать умную оркестрацию, измерять реальную ценность и управлять затратами на уровне архитектуры.

Обеспечение ROI от продвинутого AI требует либо экспоненциально более высокой отдачи по сравнению с базовыми моделями, либо высоко оптимизированного инференс-тиринга, маршрутизации и оркестрации. Оба исхода вполне достижимы, но потребуют значительных усилий в рамках сложных воркфлоу.

Компании, которые воспримут это как архитектурный вызов, а не как статью расходов, получат конкурентное преимущество в мире, где агентный AI становится нормой.