GPT-6: улучшенное кэширование промптов — быстрее и дешевле

22 сентября 2026 года OpenAI выпустила семейство моделей GPT-6 Sol и Luna — и вместе с ними представила переосмысленную систему prompt caching (кэширования промптов). Это не косметическое улучшение: речь идёт о фундаментальном изменении в том, как долгосрочные агенты обрабатывают повторяющийся контекст, и о реальной экономии для разработчиков, работающих с большими объёмами запросов.

Зачем вообще нужен prompt caching?

GPT-6 позволяет персистентным агентам работать часами над сложными задачами — от рефакторинга кодовых баз до создания хорошо проработанных документов и презентаций. Приложения, лежащие в основе таких агентов, выполняют серию последовательных API-запросов, часто передавая вперёд одни и те же инструкции, определения инструментов и контекст предыдущих шагов.

Представьте себе ИИ-ассистента для юридической фирмы: каждый его запрос несёт в себе один и тот же системный промпт с инструкциями на 5 000 токенов, список доступных инструментов, историю диалога. Без кэширования каждый раз всё это обрабатывается заново — что увеличивает и задержку, и стоимость.

OpenAI кэширует этот общий контекст, чтобы переиспользовать вычисления между запросами, сокращая время ответа и давая разработчикам скидки до 90% на кэшированные входные токены.

ℹ Что такое prompt caching?
Prompt caching — механизм, при котором модель сохраняет промежуточные вычисленные состояния (KV-states) для повторяющихся фрагментов промпта. При следующем запросе с тем же префиксом эти состояния извлекаются из кэша, а не пересчитываются заново — это ускоряет ответ и снижает затраты.

Что изменилось в GPT-6

С семейством GPT-6 OpenAI запустила улучшенную систему кэширования промптов, которая по умолчанию обеспечивает более высокие показатели попадания в кэш (cache hit rate). Теперь скидки на кэш применяются к подходящим общим префиксам, повторно используемым в течение 30-минутного окна.

Среди новых инструментов — Prompt Caching Dashboard для отслеживания показателей попаданий в кэш и состава входных данных, инструмент диагностики для выявления причин промахов кэша (например, изменение инструментов или настроек), явные точки останова кэша для управления тем, какие префиксы кэшируются, возможность изменять «усилие рассуждения» (reasoning effort) в середине разговора без сброса кэша, а также предварительный прогрев кэша для снижения задержки.

Обзор ключевых изменений

ФункцияРаньше (GPT-5.5 и старше)GPT-6 (Sol / Luna)
Cache hit rate по умолчанию~85%Стабильно >90%
Скидка на кэшированные токеныДо 75%До 90%
Окно кэшированияВарьировалосьФиксированные 30 минут
Явные breakpointsОтсутствовалиДо 4 на запрос
Диагностика промаховНедоступнаПолная с кодами причин
Dashboard мониторингаОграниченныйPrompt Caching Dashboard
Изменение reasoning effortСбрасывало кэшНе сбрасывает кэш

Prompt Caching Dashboard и диагностика

Новый Prompt Caching Dashboard отслеживает показатели попаданий в кэш во времени и разбивает входные данные на кэшированные и некэшированные токены.

Инструмент диагностики позволяет сравнить запрос с недавним ответом и определить, что изменилось — модель, инструменты, настройки или входные данные — что помешало повторному использованию кэша. В ответе возвращается код причины (например, tools_changed) вместе с оценочным количеством затронутых токенов, что помогает оценить масштаб проблемы и направить оптимизацию.

💡 Как использовать диагностику
Если вы заметили падение cache hit rate, запросите диагностический эндпоинт и сопоставьте код причины с последними изменениями в промпте, схеме инструментов или конфигурации. Это позволит быстро найти корень проблемы без ручного сравнения запросов.

Prompt cache diagnostics не имеют дополнительной стоимости и совместимы с режимом Zero Data Retention. OpenAI не хранит необработанные промпты или выходные данные модели для этой функции.

Явные breakpoints: контроль над кэшем

Одно из самых практичных нововведений — явные cache breakpoints (точки останова кэша). Раньше система сама решала, где заканчивается кэшируемый префикс. Теперь разработчик может явно указать границы.

В GPT-5.6 и более поздних версиях два параметра определяют, где размещаются точки останова кэша: prompt_cache_options.mode выбирает неявный или только явный режим кэширования, а prompt_cache_breakpoint отмечает границу, которую выбирает разработчик.

Неявное кэширование устанавливает точку останова в конце последнего подходящего сообщения — это удобно для многоходовых диалогов, в которых контекст наращивается.

Явные маркеры размещаются в конце стабильного контента. Режим «только явного кэширования» позволяет избежать лишних записей в кэш для изменяющихся суффиксов.

Пример использования явных breakpoints в Python:

response = client.responses.create(
    model="gpt-6-sol",
    prompt_cache_options={"mode": "implicit"},
    input=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": system_instructions,  # Стабильная часть
                    "prompt_cache_breakpoint": {"type": "ephemeral"},
                },
                {
                    "type": "text",
                    "text": dynamic_user_query,  # Изменяемая часть
                },
            ],
        }
    ],
)
⚠ Ограничение
На один запрос допускается не более 4 явных breakpoints. Минимальная длина кэшируемого префикса — 1 024 токена для GPT-5.6 и новее. Более короткие префиксы просто не будут кэшироваться.

Reasoning effort больше не ломает кэш

Раньше изменение параметра «усилия рассуждения» (reasoning effort) между запросами автоматически инвалидировало кэш — это была серьёзная проблема для агентных сценариев.

В моделях GPT-6 reasoning effort можно менять между ответами без сброса кэша, добавляя configuration_update вместо изменения параметра на уровне запроса. Это позволяет агенту повысить усилие для более сложной задачи или снизить его для рутинного шага, сохраняя при этом переиспользуемый кэшированный контекст.

Прогрев кэша (cache prewarming)

Новый инструмент — предварительный прогрев кэша. Идея проста: вместо того чтобы ждать первого «холодного» запроса пользователя, можно заранее отправить тестовый вызов для прогрева общего контекста.

Протестируйте стартовые вызовы для промптов с высокой частотой переиспользования, а затем убедитесь, что последующая экономия покрывает стоимость дополнительного запроса.

Это особенно актуально для продуктов с предсказуемой пиковой нагрузкой — например, для корпоративных чат-ботов в начале рабочего дня.

Реальные результаты: кейсы

Кэширование промптов — это фундамент экономики долгосрочных агентов.

Работая с инженерной командой OpenAI, один из разработчиков оптимизировал расстановку breakpoints, комбинировал явное и автоматическое кэширование и использовал реальные запросы для выявления неожиданных промахов. Менее чем за неделю показатель попаданий в кэш для OpenAI-моделей вырос примерно с 85% до стабильных >90%, что дополнительно снизило затраты на инференс в производственной среде.

Другая команда перевела сессионных агентов на явные breakpoints. Менее чем за неделю показатели попаданий в кэш на их тестах выросли с 83% до 91%. Это означало меньше записей в кэш и более низкие затраты на инференс при той же нагрузке: количество cache writes сократилось примерно вдвое, а затраты на инференс — на 36%.

GitHub Copilot ранее добился сокращения более чем на 50% токенов, требующих повторной обработки, в миллиардах запросов с использованием более ранних версий системы кэширования OpenAI.

Как устроен процесс кэширования: схема


graph TD
    A[API-запрос от агента] --> B{Префикс ≥ 1024 токенов?}
    B -- Нет --> C[Обработка без кэширования]
    B -- Да --> D{Кэш-хит в 30-мин окне?}
    D -- Да --> E[Читаем из кэша\n💰 Скидка 90%]
    D -- Нет --> F{Явный breakpoint?}
    F -- Да --> G[Пишем в кэш по breakpoint\n⚡ Cache write × 1.25]
    F -- Нет --> H[Автоматический breakpoint\n в конце сообщения]
    G --> I[Ответ модели]
    H --> I
    E --> I
    C --> I
    I --> J[Следующий запрос переиспользует кэш]

Стоимость: сколько это стоит?

GPT-6 Sol оценивается в $2 за миллион входных токенов и $10 за миллион выходных. GPT-6 Luna стоит $0,10 за миллион входных токенов и $0,50 за миллион выходных.

Для GPT-5.6 и более поздних версий cache write стоит 1,25× от стандартной некэшированной ставки входных токенов. Эти расходы оправданы, когда известно, что префикс будет переиспользован — ведь последующие чтения стоят лишь 0,1× от этой ставки.

Тип токенаСтоимость (GPT-6 Sol)Стоимость (GPT-6 Luna)
Стандартный входной$2.00 / 1M$0.10 / 1M
Cache write (запись в кэш)$2.50 / 1M$0.125 / 1M
Кэшированное чтение$0.20 / 1M$0.01 / 1M
Выходной токен$10.00 / 1M$0.50 / 1M
💡 Совет по экономии
Если вы знаете, что один и тот же системный промпт будет использоваться в десятках тысяч запросов в день, cache write полностью окупается уже со второго обращения к кэшу. При длинных промптах (от 5 000 токенов и выше) экономия становится ощутимой уже в первые часы работы.

Практические рекомендации

Управляйте изменениями промпта: держите определения инструментов в фиксированном порядке, добавляйте явные breakpoints там, где это полезно, и управляйте доступностью инструментов через allowed_tools или tool_choice.

При диагностике деградации: запросите диагностический эндпоинт после падения hit rate и сопоставьте код причины с последними изменениями промпта, схемы или конфигурации.

Сохраняйте ранние сообщения и результаты инструментов, чтобы последующие ходы могли переиспользовать полный общий префикс.

Улучшения кэширования распространяются на несколько продуктов OpenAI, включая GPT-6 API, ChatGPT Work и Codex.

Итог

Обновление prompt caching в GPT-6 — это не просто техническая деталь. Для команд, строящих серьёзные агентные системы, это прямая экономия на инфраструктуре и ощутимое снижение задержек. Явные breakpoints дают разработчику точный контроль над тем, что кэшируется, а Dashboard и диагностика превращают оптимизацию кэша из искусства в инженерный процесс с измеримыми результатами.

Anthropic и Google также предлагают кэширование промптов, и разработчики давно используют стабильные системные промпты и детерминированный порядок инструментов для улучшения переиспользования. Обновление GPT-6 от OpenAI формализует эти практики через поддерживаемые элементы управления, а Dashboard и диагностика связывают каждый промах кэша с конкретным изменением промпта и его стоимостью в токенах.