Каждая задача теперь стоит денег — и по-разному

С появлением агентных инструментов вроде Claude Code один и тот же результат может обойтись разным количеством токенов — в зависимости от того, как именно вы ведёте сессию. Anthropic опубликовала детальное руководство от разработчика Lydia Hallie с практическими советами, как тратить токены только на то, что действительно нужно. Ниже — главное.

ℹ Суть одной фразой
Эффективное использование токенов — это не «тратить меньше», а «тратить на нужное»: каждый токен должен работать на вашу задачу, а не тащить за собой балласт из прошлых разговоров.

Что определяет стоимость токена

Вы платите за инференс (inference) — время, которое GPU тратит на обработку вашего запроса. На цену влияют три фактора:

  • Модель — чем мощнее, тем дороже каждый токен.
  • Тип токена — входные (input) vs. выходные (output). Генерация ответа происходит пошагово, токен за токеном, поэтому output стоит примерно в 5 раз дороже input.
  • Кэш промптов (prompt cache) — если начало запроса совпадает с предыдущим, сервер достаёт готовое состояние из кэша. Чтение из кэша стоит всего 0.1× от цены входного токена.
Тип токенаОтносительная стоимостьПримечание
Input (кэш-промах)Полный пересчёт
Input (кэш-попадание)0.1×Загрузка из кэша
Output (thinking)~5×Пошаговая генерация
Запись в кэшдо 2×Однократно, затем дёшево

«Одна и та же исправленная задача может стоить разное количество токенов в зависимости от того, как вы используете инструмент.» — Lydia Hallie, Anthropic


Жизненный цикл одного запроса

Даже простая задача — исправить упавший тест — порождает несколько запросов подряд. Вот как это работает:


sequenceDiagram
    participant U as Пользователь
    participant CC as Claude Code
    participant M as Модель
    U->>CC: «Исправь тест в utils.test.ts»
    CC->>M: Запрос 1 — системный промпт + CLAUDE.md + сообщение
    M-->>CC: Read(utils.test.ts)
    CC->>M: Запрос 2 — кэш + файл теста
    M-->>CC: Read(utils.ts)
    CC->>M: Запрос 3 — кэш + файл под тестом
    M-->>CC: Edit(utils.ts)
    CC->>M: Запрос 4 — кэш + результат правки
    M-->>CC: npm test
    CC->>M: Запрос 5 — кэш + вывод тестов
    M-->>U: Краткий итог

Каждый запрос несёт весь предыдущий контекст, но благодаря кэшу платите полную цену только за новое. Проблема в том, что этот кэш легко сломать.


Как не сломать кэш

Кэш работает только если начало запроса совпадает побайтово. Порядок всегда одинаковый: определения инструментов → системный промпт → разговор (с CLAUDE.md в начале). Если что-то в этом префиксе меняется — кэш сбрасывается, и вы платите полную цену за весь контекст заново.

⚠ Осторожно
Смена модели или уровня усилий (/effort) прямо в середине разговора сбрасывает кэш промптов. Это может значительно увеличить стоимость сессии. Устанавливайте модель и effort до начала работы.

Кэш также истекает через 60 минут бездействия. Если вы отошли на обед, а потом вернулись — кэша уже нет, и следующий запрос пересчитает весь контекст по полной цене.


6 практических правил от Anthropic

💡 Быстрый старт: шесть правил за минуту
  1. /clear между задачами — удаляет нерелевантный контекст прошлой задачи, снижает расход токенов.
  2. Модель и /effort — до старта — смена в середине разговора ломает кэш.
  3. @-mention файлов вместо имён — файл прикрепляется напрямую, экономя один вызов Read или поиск по репозиторию.
  4. Тихие флаги для шумных команд — вывод команды добавляется в контекст как файл и остаётся там до конца сессии.
  5. /context в начале новой сессии — показывает, что загружено (CLAUDE.md, MCP-инструменты), чтобы вырезать лишнее.
  6. /compact перед паузой — суммирует разговор, пока кэш ещё горячий; это дешевле, чем делать то же самое после перерыва.

/clear vs /compact — в чём разница

КомандаЧто делаетКогда использовать
/clearПолностью очищает контекстСмена задачи, новая тема
/compactСжимает историю в summaryПродолжение той же задачи
/contextПоказывает состав контекстаДиагностика в начале сессии
/rewindОткат к более раннему состояниюОтказ от ошибочной ветки

Дополнительно: думающие токены и effort

Большая часть output-токенов в сессии — это thinking tokens (токены «размышления»). Их количество регулируется командой /effort. Если задача рутинная, можно полностью отключить thinking:

MAX_THINKING_TOKENS=0 claude

Это работает как уровень ниже /effort low и отключает extended thinking на время одной сессии (кроме Fable 5).

💡 Проверьте настройки перед работой
Запустите /model и /effort в начале каждой новой сессии — оба параметра запоминают последнее значение и могут оказаться совсем не теми, которые нужны для текущей задачи.

Почему это важно для отрасли

Раньше редактор кода стоил фиксированную сумму вне зависимости от того, сколько файлов вы открыли. С агентными системами экономика изменилась: одна и та же задача может обойтись в разы дороже в зависимости от гигиены сессии. Руководство Anthropic — это фактически признание того, что токенная грамотность становится такой же важной профессиональной навыкой, как умение писать чистый код.

Агентные команды (Agent Teams) в Claude Code, появившиеся в феврале 2026 года, потребляют около 7× больше токенов по сравнению со стандартными сессиями, что делает вопрос оптимизации критически важным для команд, использующих эти возможности.