Scorecard для эпохи ИИ: как измерить реальный ROI
Сара Фрайер, CFO OpenAI, предлагает практический фреймворк «Полезный интеллект за доллар» для измерения реальной отдачи от инвестиций в ИИ.
Как на самом деле измерять ценность ИИ для бизнеса
Компании по всему миру тратят миллиарды на искусственный интеллект. Мировые расходы на ИИ в 2026 году прогнозируются на уровне $2,59 трлн — рост на 47% по сравнению с прошлым годом. Но вот парадокс: по данным исследования PwC, лишь 12% генеральных директоров заявили, что ИИ принёс им одновременно выгоды по затратам и по выручке. В целом 56% опрошенных сообщили, что пока не увидели значимой финансовой отдачи.
Именно в этот момент Сара Фрайер (Sarah Friar), финансовый директор (CFO) OpenAI, опубликовала материал, который уже окрестили «манифестом для корпоративных финансистов эпохи ИИ». В своём блог-посте она изложила четырёхэтапный процесс достижения того, что назвала «идеальным scorecard (системой показателей) для эпохи ИИ».
«Годами рынок измерял успех программного обеспечения через принятие: купленные лицензии, активные пользователи, продления. Понимание ценности ИИ требует более сильного измерения — выполненной работы.» — Сара Фрайер, CFO OpenAI
Почему старые метрики не работают
Раньше успех программного обеспечения измерялся через принятие — количество мест, активных пользователей и продлений. Фрайер утверждает, что ИИ принципиально иной: его нужно измерять по реально выполненной работе.
Основная экономическая проблема, стоящая перед CFO, сформулирована чётко: главный вопрос — растёт ли ценность работы, которую выполняет ИИ, быстрее, чем стоимость её производства.
Метрика «Useful Intelligence per Dollar» (полезный интеллект за доллар)
Фрайер представила то, что назвала scorecard «полезного интеллекта за доллар» для ИИ, основанный на четырёх факторах: выполняет ли технология значимую работу, какова стоимость каждой успешной задачи, насколько надёжен её результат и приносит ли каждый потраченный на ИИ доллар всё большую ценность по мере роста использования.
Разберём каждый из четырёх компонентов подробно.
Компонент 1: Полезная работа (Useful Work)
Прежде всего OpenAI призывает компании измерять объём реально выполненной полезной работы. Для этого бизнесу необходимо определить, что именно означает «сделано» в рамках конкретного процесса, и сравнить этот результат с тем, как задачи решались до внедрения ИИ.
Конкретные примеры полезной работы:
- Сколько обращений клиентов ИИ помог разрешить?
- Сколько изменений в коде было отправлено с его помощью?
- Сколько договоров было проверено?
- Сколько времени было возвращено сотрудникам?
Токены создают ценность только тогда, когда превращаются в работу, которую люди могут использовать. Именно это разграничение — между «использованием ИИ» и «получением результата от ИИ» — является ключевым сдвигом в мышлении.
Компонент 2: Стоимость успешной задачи (Cost per Successful Task)
Это самый нетривиальный компонент фреймворка. На уровне модели стоимость успешной задачи зависит от цены, объёма использованных вычислительных ресурсов и вероятности получения правильного результата. Для бизнеса полная стоимость также включает время сотрудников, проверку человеком, повторные попытки и доработку.
Практическая формула расчёта:
- Подсчитайте задачи, которые соответствуют требуемому уровню качества. Разделите полную стоимость на количество успешных задач.
Именно поэтому самая низкая цена за токен не всегда даёт наименьшую стоимость результата. Фронтирная (передовая) модель может обеспечивать наилучшую ценность даже для рутинного запроса, если выдаёт правильный ответ с первого раза, сокращая повторные попытки, задержки, проверку и общий объём вычислений.
Пример: семейство GPT-5.6
GPT-5.6, выпущенный недавно OpenAI, имеет три уровня: Sol — флагманская версия; Terra — баланс производительности и стоимости; Luna — самая быстрая и доступная модель.
Клиент может выбрать Luna для высокообъёмного рабочего процесса, Terra — для задач, требующих большей глубины, и Sol — когда усиленное рассуждение сокращает количество необходимых попыток. По мнению OpenAI, экономика всей задачи, а не номинальная цена модели, должна определять, какую версию использовать.
| Уровень модели | Характеристика | Оптимальное применение |
|---|---|---|
| Sol | Максимальная мощность рассуждений | Сложные, многошаговые задачи |
| Terra | Баланс качества и цены | Стандартные бизнес-процессы |
| Luna | Скорость и экономичность | Высокообъёмные рутинные задачи |
Компонент 3: Надёжность (Dependability)
Третья метрика — надёжность. Внедрение ИИ, как правило, углубляется поэтапно. Сначала ИИ помогает составлять черновики. Затем он находит контекст и рассуждает, используя инструменты и данные. Со временем он начинает предпринимать действия, обрабатывать исключения и завершать рабочие процессы — при этом люди обеспечивают суждение и контроль там, где это необходимо.
Надёжность имеет прямую экономическую ценность. Когда результаты точны, хорошо обоснованы, последовательны и своевременно эскалируются, люди тратят меньше времени на проверку, исправление и повторение работы.
Для практического отслеживания надёжности компании могут фиксировать: как часто инструмент выдавал результат, соответствующий стандартам качества; как часто требовалась правка человеком; и как часто специалисту приходилось вмешиваться и завершать задачу самостоятельно.
OpenAI рекомендует отслеживать три исхода каждой задачи:
- ✅ Готово к использованию — результат принят без правок
- ✏️ Требует доработки — небольшая коррекция человеком
- 🔄 Требует эскалации — задача возвращена специалисту
Компонент 4: Отдача от вычислений (Return on Compute)
Последняя часть фреймворка рассматривает, улучшается ли экономика ИИ при масштабировании. Компании должны отслеживать один и тот же рабочий процесс в динамике, сравнивать общую стоимость с количеством успешных задач и оценивать, растёт ли объём выполненной работы быстрее расходов при сохранении или улучшении качества.
Вычисления (compute) находятся в центре этого уравнения, поскольку влияют на исследования, качество моделей, скорость, надёжность, доступность и стоимость. Вычисления для обучения формируют будущие модели, а вычисления для инференса (inference) определяют полезную работу, которую клиенты получают сегодня.
По мере роста использования стоимость каждой успешной задачи в идеале должна снижаться, или генерируемая ценность должна опережать затраты.
Как выглядит scorecard на практике
graph TD
A[🎯 Определите 'выполненную задачу'] --> B[📊 Считайте успешные результаты]
B --> C[💰 Рассчитайте полную стоимость задачи]
C --> D[🔍 Оцените надёжность: готово / доработка / эскалация]
D --> E[📈 Отслеживайте динамику во времени]
E --> F[✅ Useful Intelligence per Dollar]
F -->|Рост ценности опережает затраты| G[🚀 Масштабируйте]
F -->|Затраты опережают ценность| H[🔧 Пересмотрите модель/процесс]
Контекст: почему это важно именно сейчас
Этот фреймворк — ответ OpenAI на растущее давление со стороны корпоративного рынка, где компании всё чаще перенаправляют задачи к более дешёвым моделям и требуют более чёткой отдачи от инвестиций.
Это давление подтверждается данными. Генеральный директор Palantir Алекс Карп недавно заявил, что многие руководители бизнеса всё больше разочарованы экономикой LLM (больших языковых моделей), задаваясь вопросом, превращаются ли растущие расходы на токены в реальный ROI.
Итог: четыре вопроса, которые должен задавать каждый руководитель
Фреймворк Сары Фрайер сводится к четырём практическим вопросам, которые стоит задать перед любым ИИ-проектом и регулярно — в процессе его работы:
| # | Вопрос | Что измеряем |
|---|---|---|
| 1 | Выполняет ли ИИ значимую работу? | Количество успешных задач |
| 2 | Сколько стоит каждый успешный результат? | Полная стоимость (токены + люди + доработки) |
| 3 | Можно ли доверять результату? | Доля готовых / требующих правки / эскалированных задач |
| 4 | Улучшается ли экономика с ростом масштаба? | Динамика стоимости задачи во времени |
Ключевой сдвиг в мышлении: ИИ — не статья расходов с фиксированной ценой за токен, а производственный актив, эффективность которого нужно измерять по результату.
Этот подход особенно актуален для российских компаний, активно внедряющих ИИ-решения: вопрос «сколько стоит лицензия?» уступает место вопросу «сколько стоит один решённый кейс поддержки?» или «на сколько ускорилась проверка договора?». Именно там живёт настоящий ROI.