GPT-6 Astra покорил ARC-AGI-3: 99,9% и эффективнее людей
OpenAI GPT-6 Astra набрал 99,9% на сложнейшем бенчмарке ARC-AGI-3 и превзошёл людей по эффективности действий на 96% уровней.
GPT-6 Astra штурмует ARC-AGI-3: рекорд 99,9% и эффективность выше человеческой
OpenAI официально представила GPT-6 Astra — свою новейшую флагманскую модель — и сразу подтвердила её возможности на одном из самых жёстких тестов для ИИ. GPT-6 Astra набрал 62,7% на ARC-AGI-3 Semi-Private со стандартным режимом (Standard harness) за $26 тысяч, и 99,9% за $19 тысяч с использованием Provider Adapter harness. Оба результата — лучшие среди всех моделей на сегодняшний день. Кроме того, Astra превзошёл человеческий базовый уровень по эффективности действий: модель использовала меньше действий, чем медианный участник-человек, на 96% уровней.
Что такое ARC-AGI-3
ARC-AGI-3 — первый полностью интерактивный бенчмарк в серии ARC-AGI. Он включает сотни оригинальных пошаговых сред, созданных вручную командой дизайнеров игр. Никаких инструкций, правил или целей нет — агент должен самостоятельно исследовать каждую среду, понять, как она работает, найти условие победы и переносить накопленные знания на всё более сложные уровни.
ARC-AGI-3 — это первый интерактивный бенчмарк на рассуждение: в отличие от статических задач, ИИ-агенты должны эффективно исследовать, адаптироваться и действовать в динамических средах.
Два режима — два результата
ARC Prize тестировала Astra в двух конфигурациях, которые принципиально отличаются по архитектуре запуска:
| Режим | Описание | Результат | Стоимость |
|---|---|---|---|
| Standard harness | Модель сама решает, какие заметки сохранять между шагами | 62,7% | ~$26 000 |
| Provider Adapter harness | Сохраняет скрытое состояние рассуждений между запросами, использует компакцию для длинных диалогов | 99,9% | ~$19 000 |
| Человеческий baseline | ~500 участников из общей аудитории | 100% (RHAE) | ~$115/сессия |
Более высокие уровни рассуждений в итоге обходятся дешевле: Astra решает задачи за меньшее число действий, сокращая общее количество вызовов модели и токенов.
Прогресс за полгода
timeline
title Прогресс на ARC-AGI-3
Март 2026 : Все frontier-модели < 1%
: Люди — 100%
Июль 2026 : GPT-5.6 Sol — 7,8% (Standard harness)
: GPT-5.6 Sol — 38,3% (с retained reasoning)
Сентябрь 2026 : Claude Opus 5 — 30,2%
: GPT-6 Astra — 62,7% (Standard)
: GPT-6 Astra — 99,9% (Provider Adapter)
OpenAI сообщает, что GPT-6 Astra набрал 98,6% на ARC-AGI-3, тогда как шесть месяцев назад его предшественник показывал лишь 7,8%. Скачок огромный — особенно на фоне того, что весной 2026 года задачи бенчмарка казались непреодолимыми для любой языковой модели.
Другие результаты Astra
ARC-AGI-3 — не единственный фронт. OpenAI сообщает о результатах Astra в 97,6% на FrontierMath Tier 4 v2, 74,1% на DeepSWE v1.1, 95,9% на BenchCAD, 96% на GPQA Diamond и 100% на ExploitBench.
Во время внутреннего тестирования Astra обнаружил две ранее неизвестные zero-day уязвимости. Они были раскрыты их разработчикам.
Помимо рекорда на ARC-AGI-3, GPT-6 Astra установил рекорд в 95,0% на ARC-AGI-2 при стоимости $1,12 за задачу и сравнялся с рекордом Fable 5 — 98,5% — при стоимости $0,28 за задачу.
Доступность и цены
GPT-6 Astra сначала доступна выбранным организациям; пользователи ChatGPT Plus, Pro, Business и Enterprise получат доступ в течение ближайших дней. В API модель доступна под именем gpt-6-astra по стандартной цене $10 за миллион входных токенов.
Значение для отрасли
Когда в марте 2026 года ARC-AGI-3 показал разрыв между людьми и ИИ в сотни раз — это казалось непреодолимым. Спустя полгода Astra вплотную приблизился к человеческому уровню. Вопрос теперь не в том, возможно ли это технически, а в том, что именно мы считаем AGI.
ARC-AGI превратился в один из самых пристально отслеживаемых инструментов для измерения того, способны ли ИИ-системы обобщать знания на незнакомые задачи, а не просто воспроизводить навыки, усвоенные при обучении.
OpenAI официально запустила GPT-6 Astra, а президент компании Грег Брокман заявил журналистам: «Добро пожаловать в эпоху AGI» — утверждая, что Astra не хуже или лучше человека в достаточном количестве сложных задач, чтобы считаться искусственным общим интеллектом.
Остаётся открытым вопрос о сопоставимости тестовых условий: другие модели оценивались в иных конфигурациях, и прямое сравнение требует осторожности. Тем не менее прогресс за шесть месяцев — от долей процента до почти стопроцентного результата — трудно назвать иначе, чем качественным скачком.