GPT-5.6: как OpenAI объединила передовой интеллект с передовой эффективностью

Больше полезной работы на каждый потраченный доллар — именно этот принцип лежит в основе новой линейки моделей GPT-5.6 от OpenAI.

В июле 2026 года OpenAI представила семейство моделей GPT-5.6 — и это не просто очередной шаг вперёд по бенчмаркам. Каждое отдельное улучшение может показаться небольшим, но в совокупности они позволяют OpenAI удерживать позиции на фронтире сразу по двум направлениям: интеллект и эффективность. GPT-5.6 создавалась с прицелом на баланс между возможностями и стоимостью для всего спектра задач.

Три модели на все случаи жизни: Sol, Terra, Luna

GPT-5.6 объединяет Sol, Terra и Luna в трёхуровневое семейство, созданное для решения задач разного масштаба: от задач на пределе возможностей ИИ до быстрого и дешёвого массового выполнения операций.

Компания описывает три уровня как устойчивые «эшелоны возможностей»: Sol — для максимальной производительности, Terra — для повседневной работы с производительностью на уровне GPT-5.5 при меньших затратах, Luna — для быстрых задач с высоким объёмом и жёсткими ценовыми ограничениями.

Сравнение моделей семейства GPT-5.6

МодельПозиционированиеСтоимость (входящие токены)Ключевые преимущества
SolФлагман, максимальная точность$5 / 1M токеновЛучший результат на Coding Agent Index, обгоняет Claude Fable 5
TerraБаланс цены и качества~$2.5 / 1M токеновСопоставима с GPT-5.5 по бенчмаркам, вдвое дешевле
LunaСкорость и доступность~$1 / 1M токеновНа 80% дешевле Sol, идеальна для высокого объёма

Флагман GPT-5.6 Sol с максимальным рассуждением (max reasoning) опережает Claude Fable 5 на Artificial Analysis Coding Agent Index при менее чем половине стоимости. Terra показывает результаты на уровне GPT-5.5 по бенчмаркам интеллекта при вдвое меньшей цене, а Luna — самая быстрая и доступная, её цена на 80% ниже Sol.

ℹ Что такое Artificial Analysis Coding Agent Index?
Artificial Analysis Coding Agent Index — независимый индекс оценки моделей в агентных задачах программирования. Он измеряет качество кода, количество используемых токенов и скорость выполнения задач, что делает его более приближённым к реальным рабочим сценариям, чем изолированные бенчмарки.

Режимы рассуждения: от «medium» до «ultra»

Одна из ключевых новинок GPT-5.6 — гибкие уровни вычислительных затрат, которые позволяют пользователю самому выбирать соотношение скорость/качество/стоимость.

Режим max даёт GPT-5.6 больше времени, чем предыдущий уровень xhigh, для рассуждений, проверки альтернатив и пересмотра подхода. Режим ultra идёт ещё дальше: по умолчанию он координирует четырёх агентов параллельно, обменивая более высокое потребление токенов на более сильные результаты и меньшее время выполнения сложных задач.

В режиме ultra оркестрация происходит целиком на уровне inference (генерации ответа): модель распараллеливает собственные внутренние процессы рассуждения и генерации, а не просит клиента выполнять работу самостоятельно. Это по-настоящему меняет архитектуру агентных coding-воркфлоу, перенося оркестрацию из клиентского кода внутрь модели.

💡 Совет для разработчиков
Если вы строите агентный пайплайн с несколькими последовательными вызовами API, попробуйте режим ultra в GPT-5.6 Sol — он позволяет выдать единственный запрос вместо цепочки из трёх-четырёх вызовов, объединяя управление повторными попытками и слиянием результатов.

Три слоя оптимизации: модели, inference, агентный harness

OpenAI впервые подробно рассказала об оптимизациях за пределами самой модели. Эффективность достигается через улучшения в двух ключевых частях стека: 1) inference — за счёт оптимизации балансировки нагрузки (load balancing), спекулятивного декодирования (speculative decoding), кеширования и оптимизации ядер (kernel optimization), чтобы получать больше результатов с того же железа; 2) агентный harness — включая лучшее управление раздуванием контекста (context bloat), использованием инструментов и повторяющейся работой.


graph TD
    A[GPT-5.6: Эффективность на трёх уровнях] --> B[Модели]
    A --> C[Inference-стек]
    A --> D[Агентный Harness]
    B --> B1[Sol / Terra / Luna]
    B --> B2[Больше работы за токен]
    C --> C1[Load Balancing]
    C --> C2[Speculative Decoding]
    C --> C3[Kernel Optimization]
    C --> C4[Кеширование]
    D --> D1[Управление Context Bloat]
    D --> D2[Оптимизация вызовов инструментов]
    D --> D3[Устранение дублирующейся работы]

1. Оптимизация на уровне моделей: больше работы за один токен

Наибольшей эффективности «интеллект на токен» удалось достичь с GPT-5.6: модель обучена выполнять больше работы за каждый токен. В процессе обучения оптимизировались как успешность задачи, так и эффективность — модель приучалась идти к цели более прямым путём.

На Artificial Analysis Coding Agent Index Sol с максимальным рассуждением устанавливает новый рекорд — 80 баллов, на 2,8 пункта выше Claude Fable 5, при этом используя менее половины выходных токенов, затрачивая менее половины времени и стоя примерно на треть меньше.

2. Inference-стек: из тех же серверов — больше мощности

Kernel optimization — модель, оптимизирующая саму себя

Один из самых любопытных аспектов релиза — GPT-5.6 Sol использовалась для улучшения собственной инфраструктуры. С помощью Codex GPT-5.6 Sol автономно переписала и оптимизировала production-ядра (kernels) — базовый код, выполняющий математические операции модели. Это стало возможным в том числе потому, что GPT-5.6 специально обучалась писать и улучшать ядра на Triton и Gluon — двух open-source языках GPU-программирования, поддерживаемых OpenAI.

Эти усилия в совокупности с более широкими улучшениями ядер от GPT-5.6 Sol позволили снизить сквозные затраты на обслуживание на 20%.

Speculative Decoding — спекулятивное декодирование

Speculative decoding — это техника оптимизации на этапе inference, ускоряющая генерацию токенов без потери качества выходных данных. Она вдохновлена концепцией спекулятивного выполнения, при котором операции вычисляются параллельно заранее и отбрасываются, если не нужны. OpenAI применила этот подход в GPT-5.6, что дополнительно ускорило генерацию ответов.

3. Агентный harness: устранение лишней работы

В агентных сценариях — например, в Codex и ChatGPT Work — модель выполняет десятки последовательных шагов. Подготовка контекста, передача данных, запуск inference, вызов инструментов и запуск процессов — всё это требует времени и вычислений. Если задача требует 30 обращений к модели, одна лишняя секунда на каждое обращение суммируется в полминуты задержки.

📝 Реальный пример: финансовые исследования
На финансовом бенчмарке Rogo’s Big Finance Benchmark GPT-5.6 Sol улучшила качество рубрики на 6,2 балла и точность ответов на 3,6 балла по сравнению с GPT-5.5. С включённым Programmatic Tool Calling она достигла сопоставимого качества, использовав на 24% меньше выходных токенов и завершив задачи на 28% быстрее.

GPT-5.6 как инструмент саморазвития ИИ

Одна из самых показательных деталей — то, как OpenAI использовала GPT-5.6 для ускорения собственных разработок. Во время внутреннего тестирования GPT-5.6 среднее количество выходных токенов в день на одного активного исследователя превысило более чем вдвое пиковые показатели для GPT-5.5. Этот способ работы быстро становится стандартным: за последние шесть месяцев доля вычислительных ресурсов для внутренних задач программирования выросла в 100 раз, а внутреннее агентное потребление токенов увеличилось примерно в 22 раза.

Эффективность распространяется и на меньшие модели, которые принципиально важны для того, чтобы интеллект стал более доступным: GPT-5.6 Terra и GPT-5.6 Luna опережают Fable 5 примерно при одной шестнадцатой стоимости.

Взгляд в будущее: накопленные улучшения

Эффективность GPT-5.6 — результат многолетних накопленных улучшений на всех уровнях стека: исследования, inference и агентного harness. Роль GPT-5.6 в достижении многих из этих улучшений даёт OpenAI оптимизм относительно темпов будущих оптимизаций. Компания продолжит работу над улучшениями ядер и фундаментальными изменениями стека.

⚠ Важно учитывать
Несмотря на впечатляющие результаты бенчмарков, независимые оценки подтверждают, что GPT-5.6 — топовое семейство моделей с отличной ценовой эффективностью, однако не безусловный лидер по всем категориям оценки. Выбирайте модель исходя из конкретных требований вашей задачи, а не только ориентируясь на маркетинговые заголовки.

Итог: что это значит для разработчиков и бизнеса

Улучшения в программировании, дизайне, работе со знаниями и научных исследованиях свидетельствуют о том, что ИИ переходит из разряда специализированных инструментов в разряд неотъемлемой части профессиональных рабочих процессов. Организации, эффективно интегрирующие GPT-5.6 в свои операции, вероятно, получат значительные конкурентные преимущества в производительности, инновациях и рентабельности.

Kлючевая формула GPT-5.6 проста: новый стандарт по соотношению интеллекта и эффективности — превосходя предыдущие и конкурирующие флагманские модели при меньшем числе токенов и по более низкой стоимости. Результат — более высокая производительность на потраченный доллар: больше успешно выполненной работы при тех же расходах или сопоставимые результаты при более низкой общей стоимости.


Статья основана на материалах официального блога OpenAI.