
Как выжать максимум из сессий Claude Code
Anthropic опубликовала руководство по эффективному использованию токенов в Claude Code: /clear, /compact, правильная модель и кэш промптов.
Каждая задача теперь стоит денег — и по-разному
С появлением агентных инструментов вроде Claude Code один и тот же результат может обойтись разным количеством токенов — в зависимости от того, как именно вы ведёте сессию. Anthropic опубликовала детальное руководство от разработчика Lydia Hallie с практическими советами, как тратить токены только на то, что действительно нужно. Ниже — главное.
Что определяет стоимость токена
Вы платите за инференс (inference) — время, которое GPU тратит на обработку вашего запроса. На цену влияют три фактора:
- Модель — чем мощнее, тем дороже каждый токен.
- Тип токена — входные (input) vs. выходные (output). Генерация ответа происходит пошагово, токен за токеном, поэтому output стоит примерно в 5 раз дороже input.
- Кэш промптов (prompt cache) — если начало запроса совпадает с предыдущим, сервер достаёт готовое состояние из кэша. Чтение из кэша стоит всего 0.1× от цены входного токена.
| Тип токена | Относительная стоимость | Примечание |
|---|---|---|
| Input (кэш-промах) | 1× | Полный пересчёт |
| Input (кэш-попадание) | 0.1× | Загрузка из кэша |
| Output (thinking) | ~5× | Пошаговая генерация |
| Запись в кэш | до 2× | Однократно, затем дёшево |
«Одна и та же исправленная задача может стоить разное количество токенов в зависимости от того, как вы используете инструмент.» — Lydia Hallie, Anthropic
Жизненный цикл одного запроса
Даже простая задача — исправить упавший тест — порождает несколько запросов подряд. Вот как это работает:
sequenceDiagram
participant U as Пользователь
participant CC as Claude Code
participant M as Модель
U->>CC: «Исправь тест в utils.test.ts»
CC->>M: Запрос 1 — системный промпт + CLAUDE.md + сообщение
M-->>CC: Read(utils.test.ts)
CC->>M: Запрос 2 — кэш + файл теста
M-->>CC: Read(utils.ts)
CC->>M: Запрос 3 — кэш + файл под тестом
M-->>CC: Edit(utils.ts)
CC->>M: Запрос 4 — кэш + результат правки
M-->>CC: npm test
CC->>M: Запрос 5 — кэш + вывод тестов
M-->>U: Краткий итог
Каждый запрос несёт весь предыдущий контекст, но благодаря кэшу платите полную цену только за новое. Проблема в том, что этот кэш легко сломать.
Как не сломать кэш
Кэш работает только если начало запроса совпадает побайтово. Порядок всегда одинаковый: определения инструментов → системный промпт → разговор (с CLAUDE.md в начале). Если что-то в этом префиксе меняется — кэш сбрасывается, и вы платите полную цену за весь контекст заново.
/effort) прямо в середине разговора сбрасывает кэш промптов. Это может значительно увеличить стоимость сессии. Устанавливайте модель и effort до начала работы.Кэш также истекает через 60 минут бездействия. Если вы отошли на обед, а потом вернулись — кэша уже нет, и следующий запрос пересчитает весь контекст по полной цене.
6 практических правил от Anthropic
/clearмежду задачами — удаляет нерелевантный контекст прошлой задачи, снижает расход токенов.- Модель и
/effort— до старта — смена в середине разговора ломает кэш. @-mentionфайлов вместо имён — файл прикрепляется напрямую, экономя один вызов Read или поиск по репозиторию.- Тихие флаги для шумных команд — вывод команды добавляется в контекст как файл и остаётся там до конца сессии.
/contextв начале новой сессии — показывает, что загружено (CLAUDE.md, MCP-инструменты), чтобы вырезать лишнее./compactперед паузой — суммирует разговор, пока кэш ещё горячий; это дешевле, чем делать то же самое после перерыва.
/clear vs /compact — в чём разница
| Команда | Что делает | Когда использовать |
|---|---|---|
/clear | Полностью очищает контекст | Смена задачи, новая тема |
/compact | Сжимает историю в summary | Продолжение той же задачи |
/context | Показывает состав контекста | Диагностика в начале сессии |
/rewind | Откат к более раннему состоянию | Отказ от ошибочной ветки |
Дополнительно: думающие токены и effort
Большая часть output-токенов в сессии — это thinking tokens (токены «размышления»). Их количество регулируется командой /effort. Если задача рутинная, можно полностью отключить thinking:
MAX_THINKING_TOKENS=0 claude
Это работает как уровень ниже /effort low и отключает extended thinking на время одной сессии (кроме Fable 5).
/model и /effort в начале каждой новой сессии — оба параметра запоминают последнее значение и могут оказаться совсем не теми, которые нужны для текущей задачи.Почему это важно для отрасли
Раньше редактор кода стоил фиксированную сумму вне зависимости от того, сколько файлов вы открыли. С агентными системами экономика изменилась: одна и та же задача может обойтись в разы дороже в зависимости от гигиены сессии. Руководство Anthropic — это фактически признание того, что токенная грамотность становится такой же важной профессиональной навыкой, как умение писать чистый код.
Агентные команды (Agent Teams) в Claude Code, появившиеся в феврале 2026 года, потребляют около 7× больше токенов по сравнению со стандартными сессиями, что делает вопрос оптимизации критически важным для команд, использующих эти возможности.