GPT-6 Astra штурмует ARC-AGI-3: рекорд 99,9% и эффективность выше человеческой

OpenAI официально представила GPT-6 Astra — свою новейшую флагманскую модель — и сразу подтвердила её возможности на одном из самых жёстких тестов для ИИ. GPT-6 Astra набрал 62,7% на ARC-AGI-3 Semi-Private со стандартным режимом (Standard harness) за $26 тысяч, и 99,9% за $19 тысяч с использованием Provider Adapter harness. Оба результата — лучшие среди всех моделей на сегодняшний день. Кроме того, Astra превзошёл человеческий базовый уровень по эффективности действий: модель использовала меньше действий, чем медианный участник-человек, на 96% уровней.


Что такое ARC-AGI-3

ARC-AGI-3 — первый полностью интерактивный бенчмарк в серии ARC-AGI. Он включает сотни оригинальных пошаговых сред, созданных вручную командой дизайнеров игр. Никаких инструкций, правил или целей нет — агент должен самостоятельно исследовать каждую среду, понять, как она работает, найти условие победы и переносить накопленные знания на всё более сложные уровни.

ARC-AGI-3 — это первый интерактивный бенчмарк на рассуждение: в отличие от статических задач, ИИ-агенты должны эффективно исследовать, адаптироваться и действовать в динамических средах.

ℹ Контекст: как всё начиналось
Когда ARC-AGI-3 появился в марте 2026 года, каждая из ведущих моделей — GPT-5.4, Gemini 3.1 Pro, Claude Opus 4.6 — набирала менее 1%, тогда как обычные люди без подготовки справлялись со всеми заданиями на 100%.

Два режима — два результата

ARC Prize тестировала Astra в двух конфигурациях, которые принципиально отличаются по архитектуре запуска:

РежимОписаниеРезультатСтоимость
Standard harnessМодель сама решает, какие заметки сохранять между шагами62,7%~$26 000
Provider Adapter harnessСохраняет скрытое состояние рассуждений между запросами, использует компакцию для длинных диалогов99,9%~$19 000
Человеческий baseline~500 участников из общей аудитории100% (RHAE)~$115/сессия

Более высокие уровни рассуждений в итоге обходятся дешевле: Astra решает задачи за меньшее число действий, сокращая общее количество вызовов модели и токенов.

💡 Что такое Provider Adapter harness
Provider Adapter harness — режим запуска, при котором между запросами к модели сохраняется непрозрачное состояние рассуждений (opaque reasoning state), а длинные диалоги сжимаются через компакцию. Это позволяет модели переиспользовать уже проделанную работу, не начиная анализ с нуля при каждом следующем ходе.

Прогресс за полгода


timeline
    title Прогресс на ARC-AGI-3
    Март 2026 : Все frontier-модели < 1%
               : Люди — 100%
    Июль 2026  : GPT-5.6 Sol — 7,8% (Standard harness)
               : GPT-5.6 Sol — 38,3% (с retained reasoning)
    Сентябрь 2026 : Claude Opus 5 — 30,2%
                  : GPT-6 Astra — 62,7% (Standard)
                  : GPT-6 Astra — 99,9% (Provider Adapter)

OpenAI сообщает, что GPT-6 Astra набрал 98,6% на ARC-AGI-3, тогда как шесть месяцев назад его предшественник показывал лишь 7,8%. Скачок огромный — особенно на фоне того, что весной 2026 года задачи бенчмарка казались непреодолимыми для любой языковой модели.


Другие результаты Astra

ARC-AGI-3 — не единственный фронт. OpenAI сообщает о результатах Astra в 97,6% на FrontierMath Tier 4 v2, 74,1% на DeepSWE v1.1, 95,9% на BenchCAD, 96% на GPQA Diamond и 100% на ExploitBench.

Во время внутреннего тестирования Astra обнаружил две ранее неизвестные zero-day уязвимости. Они были раскрыты их разработчикам.

Помимо рекорда на ARC-AGI-3, GPT-6 Astra установил рекорд в 95,0% на ARC-AGI-2 при стоимости $1,12 за задачу и сравнялся с рекордом Fable 5 — 98,5% — при стоимости $0,28 за задачу.

⚠ Оговорка: сравнение не такое простое
OpenAI запускала Astra через Responses API harness, сохраняющий рассуждения между ходами и использующий компакцию для управления длинными контекстами. Ранее компания уже показывала, что подобные системные настройки способны существенно повышать результаты на ARC-AGI-3 без каких-либо изменений в самой модели — то есть бенчмарк измеряет совместную работу Astra и агентных систем OpenAI.

Доступность и цены

GPT-6 Astra сначала доступна выбранным организациям; пользователи ChatGPT Plus, Pro, Business и Enterprise получат доступ в течение ближайших дней. В API модель доступна под именем gpt-6-astra по стандартной цене $10 за миллион входных токенов.


Значение для отрасли

Когда в марте 2026 года ARC-AGI-3 показал разрыв между людьми и ИИ в сотни раз — это казалось непреодолимым. Спустя полгода Astra вплотную приблизился к человеческому уровню. Вопрос теперь не в том, возможно ли это технически, а в том, что именно мы считаем AGI.

ARC-AGI превратился в один из самых пристально отслеживаемых инструментов для измерения того, способны ли ИИ-системы обобщать знания на незнакомые задачи, а не просто воспроизводить навыки, усвоенные при обучении.

OpenAI официально запустила GPT-6 Astra, а президент компании Грег Брокман заявил журналистам: «Добро пожаловать в эпоху AGI» — утверждая, что Astra не хуже или лучше человека в достаточном количестве сложных задач, чтобы считаться искусственным общим интеллектом.

📝 Что говорит эффективность действий
ARC Prize измеряла не только процент пройденных уровней, но и RHAE (Relative Human Action Efficiency — относительная эффективность действий по сравнению с человеком). На Provider Adapter harness с максимальными усилиями Astra использовал меньше действий, чем человеческий baseline, на 96% уровней — в среднем на 51,7% меньше действий за уровень. Это значит, что модель решает задачи не просто правильно, но и быстрее среднестатистического человека.

Остаётся открытым вопрос о сопоставимости тестовых условий: другие модели оценивались в иных конфигурациях, и прямое сравнение требует осторожности. Тем не менее прогресс за шесть месяцев — от долей процента до почти стопроцентного результата — трудно назвать иначе, чем качественным скачком.