Как на самом деле измерять ценность ИИ для бизнеса

Компании по всему миру тратят миллиарды на искусственный интеллект. Мировые расходы на ИИ в 2026 году прогнозируются на уровне $2,59 трлн — рост на 47% по сравнению с прошлым годом. Но вот парадокс: по данным исследования PwC, лишь 12% генеральных директоров заявили, что ИИ принёс им одновременно выгоды по затратам и по выручке. В целом 56% опрошенных сообщили, что пока не увидели значимой финансовой отдачи.

Именно в этот момент Сара Фрайер (Sarah Friar), финансовый директор (CFO) OpenAI, опубликовала материал, который уже окрестили «манифестом для корпоративных финансистов эпохи ИИ». В своём блог-посте она изложила четырёхэтапный процесс достижения того, что назвала «идеальным scorecard (системой показателей) для эпохи ИИ».

«Годами рынок измерял успех программного обеспечения через принятие: купленные лицензии, активные пользователи, продления. Понимание ценности ИИ требует более сильного измерения — выполненной работы.» — Сара Фрайер, CFO OpenAI


Почему старые метрики не работают

Раньше успех программного обеспечения измерялся через принятие — количество мест, активных пользователей и продлений. Фрайер утверждает, что ИИ принципиально иной: его нужно измерять по реально выполненной работе.

Основная экономическая проблема, стоящая перед CFO, сформулирована чётко: главный вопрос — растёт ли ценность работы, которую выполняет ИИ, быстрее, чем стоимость её производства.

⚠ Ловушка дешёвых токенов
Низкая цена за токен ≠ низкая стоимость результата. Модели с доступными токенами не всегда эквивалентны ценности — иногда им требуется больше времени на выполнение задачи, чем более дорогим аналогам. Считайте полную стоимость успешного исхода, а не стоимость входных данных.

Метрика «Useful Intelligence per Dollar» (полезный интеллект за доллар)

Фрайер представила то, что назвала scorecard «полезного интеллекта за доллар» для ИИ, основанный на четырёх факторах: выполняет ли технология значимую работу, какова стоимость каждой успешной задачи, насколько надёжен её результат и приносит ли каждый потраченный на ИИ доллар всё большую ценность по мере роста использования.

Разберём каждый из четырёх компонентов подробно.


Компонент 1: Полезная работа (Useful Work)

Прежде всего OpenAI призывает компании измерять объём реально выполненной полезной работы. Для этого бизнесу необходимо определить, что именно означает «сделано» в рамках конкретного процесса, и сравнить этот результат с тем, как задачи решались до внедрения ИИ.

Конкретные примеры полезной работы:

  • Сколько обращений клиентов ИИ помог разрешить?
  • Сколько изменений в коде было отправлено с его помощью?
  • Сколько договоров было проверено?
  • Сколько времени было возвращено сотрудникам?

Токены создают ценность только тогда, когда превращаются в работу, которую люди могут использовать. Именно это разграничение — между «использованием ИИ» и «получением результата от ИИ» — является ключевым сдвигом в мышлении.

💡 Совет для менеджеров
Прежде чем запускать ИИ-проект, сформулируйте чёткое определение «выполненной задачи» применительно к вашему процессу. Без этого вы не сможете ни измерить ROI, ни обосновать бюджет перед советом директоров.

Компонент 2: Стоимость успешной задачи (Cost per Successful Task)

Это самый нетривиальный компонент фреймворка. На уровне модели стоимость успешной задачи зависит от цены, объёма использованных вычислительных ресурсов и вероятности получения правильного результата. Для бизнеса полная стоимость также включает время сотрудников, проверку человеком, повторные попытки и доработку.

Практическая формула расчёта:

  1. Подсчитайте задачи, которые соответствуют требуемому уровню качества. Разделите полную стоимость на количество успешных задач.

Именно поэтому самая низкая цена за токен не всегда даёт наименьшую стоимость результата. Фронтирная (передовая) модель может обеспечивать наилучшую ценность даже для рутинного запроса, если выдаёт правильный ответ с первого раза, сокращая повторные попытки, задержки, проверку и общий объём вычислений.

Пример: семейство GPT-5.6

GPT-5.6, выпущенный недавно OpenAI, имеет три уровня: Sol — флагманская версия; Terra — баланс производительности и стоимости; Luna — самая быстрая и доступная модель.

Клиент может выбрать Luna для высокообъёмного рабочего процесса, Terra — для задач, требующих большей глубины, и Sol — когда усиленное рассуждение сокращает количество необходимых попыток. По мнению OpenAI, экономика всей задачи, а не номинальная цена модели, должна определять, какую версию использовать.

Уровень моделиХарактеристикаОптимальное применение
SolМаксимальная мощность рассужденийСложные, многошаговые задачи
TerraБаланс качества и ценыСтандартные бизнес-процессы
LunaСкорость и экономичностьВысокообъёмные рутинные задачи

Компонент 3: Надёжность (Dependability)

Третья метрика — надёжность. Внедрение ИИ, как правило, углубляется поэтапно. Сначала ИИ помогает составлять черновики. Затем он находит контекст и рассуждает, используя инструменты и данные. Со временем он начинает предпринимать действия, обрабатывать исключения и завершать рабочие процессы — при этом люди обеспечивают суждение и контроль там, где это необходимо.

Надёжность имеет прямую экономическую ценность. Когда результаты точны, хорошо обоснованы, последовательны и своевременно эскалируются, люди тратят меньше времени на проверку, исправление и повторение работы.

Для практического отслеживания надёжности компании могут фиксировать: как часто инструмент выдавал результат, соответствующий стандартам качества; как часто требовалась правка человеком; и как часто специалисту приходилось вмешиваться и завершать задачу самостоятельно.

ℹ Три состояния результата

OpenAI рекомендует отслеживать три исхода каждой задачи:

  • Готово к использованию — результат принят без правок
  • ✏️ Требует доработки — небольшая коррекция человеком
  • 🔄 Требует эскалации — задача возвращена специалисту

Компонент 4: Отдача от вычислений (Return on Compute)

Последняя часть фреймворка рассматривает, улучшается ли экономика ИИ при масштабировании. Компании должны отслеживать один и тот же рабочий процесс в динамике, сравнивать общую стоимость с количеством успешных задач и оценивать, растёт ли объём выполненной работы быстрее расходов при сохранении или улучшении качества.

Вычисления (compute) находятся в центре этого уравнения, поскольку влияют на исследования, качество моделей, скорость, надёжность, доступность и стоимость. Вычисления для обучения формируют будущие модели, а вычисления для инференса (inference) определяют полезную работу, которую клиенты получают сегодня.

По мере роста использования стоимость каждой успешной задачи в идеале должна снижаться, или генерируемая ценность должна опережать затраты.


Как выглядит scorecard на практике


graph TD
    A[🎯 Определите 'выполненную задачу'] --> B[📊 Считайте успешные результаты]
    B --> C[💰 Рассчитайте полную стоимость задачи]
    C --> D[🔍 Оцените надёжность: готово / доработка / эскалация]
    D --> E[📈 Отслеживайте динамику во времени]
    E --> F[✅ Useful Intelligence per Dollar]
    F -->|Рост ценности опережает затраты| G[🚀 Масштабируйте]
    F -->|Затраты опережают ценность| H[🔧 Пересмотрите модель/процесс]


Контекст: почему это важно именно сейчас

Этот фреймворк — ответ OpenAI на растущее давление со стороны корпоративного рынка, где компании всё чаще перенаправляют задачи к более дешёвым моделям и требуют более чёткой отдачи от инвестиций.

Это давление подтверждается данными. Генеральный директор Palantir Алекс Карп недавно заявил, что многие руководители бизнеса всё больше разочарованы экономикой LLM (больших языковых моделей), задаваясь вопросом, превращаются ли растущие расходы на токены в реальный ROI.

📝 Из практики: эффективность GPT-5.6
В поддержку своей позиции OpenAI процитировала результаты Artificial Analysis Coding Agent Index: GPT-5.6 Sol с максимальным режимом рассуждений установил новый бенчмарк, при этом используя на 54% меньше выходных токенов, чем одна из ведущих конкурирующих моделей. OpenAI представила это как доказательство того, что токенная эффективность и объём выполненной полезной работы могут улучшаться одновременно.

Итог: четыре вопроса, которые должен задавать каждый руководитель

Фреймворк Сары Фрайер сводится к четырём практическим вопросам, которые стоит задать перед любым ИИ-проектом и регулярно — в процессе его работы:

#ВопросЧто измеряем
1Выполняет ли ИИ значимую работу?Количество успешных задач
2Сколько стоит каждый успешный результат?Полная стоимость (токены + люди + доработки)
3Можно ли доверять результату?Доля готовых / требующих правки / эскалированных задач
4Улучшается ли экономика с ростом масштаба?Динамика стоимости задачи во времени

Ключевой сдвиг в мышлении: ИИ — не статья расходов с фиксированной ценой за токен, а производственный актив, эффективность которого нужно измерять по результату.

Этот подход особенно актуален для российских компаний, активно внедряющих ИИ-решения: вопрос «сколько стоит лицензия?» уступает место вопросу «сколько стоит один решённый кейс поддержки?» или «на сколько ускорилась проверка договора?». Именно там живёт настоящий ROI.