GPT-6 Astra вышел — и тут же породил споры об архитектуре

OpenAI выпустила GPT-6 Astra 3 сентября 2026 года как новую флагманскую reasoning-модель для сложных многошаговых задач: программирования, компьютерного управления, профессионального анализа, науки, математики и медицины. Почти сразу в сети разгорелась дискуссия: издание The Information сообщило, что Astra построена на так называемой looped transformer (зацикленный трансформер) архитектуре — и якобы именно поэтому модель «скрывает» своё мышление. Себастьян Рашка, исследователь в области машинного обучения, выпустил детальный разбор, который расставляет вещи по местам.


Что такое looped transformer

Идея looped transformer — это повторное использование слоёв в трансформерном блоке. В случае модели Nanbeige, например, один и тот же стек из 22 слоёв проходится дважды вместо одного раза. Таким образом, 22-слойная архитектура эффективно расширяется до 44 слоёв, но без дублирования весов.

Это примерно вдвое увеличивает «размер» модели, но при этом объём хранилища и оперативной памяти остаётся прежним — потому что компоненты переиспользуются.

ℹ Что такое recurrent depth
Recurrent depth (рекуррентная глубина) — это синоним looped transformer. Модель прогоняет один и тот же набор слоёв несколько раз, углубляя обработку без увеличения числа параметров.

Как это работает на практике

В looped transformer некоторые слои обработки запускаются повторно на своих же обновлённых результатах. Каждый проход изменяет внутреннее представление, не генерируя при этом дополнительного слова на выходе.


graph TD
    A[Входной токен] --> B[Слои трансформера — проход 1]
    B --> C[Обновлённые скрытые состояния]
    C --> D[Слои трансформера — проход 2]
    D --> E[Обновлённые скрытые состояния]
    E --> F[Выходной токен]
    style B fill:#4f46e5,color:#fff
    style D fill:#4f46e5,color:#fff


Скрывает ли Astra своё мышление?

Главный вопрос, поднятый в публикации The Information: использует ли looped transformer архитектура намеренное сокрытие chain-of-thought (цепочки рассуждений)?

«Looped aspect не скрывает reasoning-токены явным образом» — Себастьян Рашка

Утверждение, что «новая техника работает так, что скрывает часть или всё рассуждение ИИ», не обязательно верно применительно к методу looped transformer. Возможно, журналист The Information имел в виду какую-то другую технику или неправильно понял метод. Повторное использование слоёв само по себе не подавляет видимую цепочку рассуждений.

Он добавляет вычисления в скрытые состояния до генерации следующего токена — точно так же, как обычные слои трансформера. Единственная правдоподобная интерпретация: если модель использует больше рекуррентных проходов, она может генерировать меньше промежуточных reasoning-токенов, так как больше вычислений происходит в латентных активациях, которые нельзя прочитать как текст.

💡 Ключевой вывод
Looped transformer не скрывает reasoning-токены намеренно. GPT-6 Astra действительно использует меньше токенов, чем GPT-5.6 Sol — но это потому, что она в целом умнее: больше обучающих данных, больший масштаб.

Тот же эффект наблюдается в предыдущих поколениях: GPT-5.6 Sol использует примерно на 46% меньше выходных токенов в intelligence index по сравнению с GPT-5.6 Luna — и никто не обвиняет Sol в сокрытии рассуждений.


Что умеет GPT-6 Astra

Под капотом — крупнейший в истории OpenAI тренировочный прогон: более 100 000 GPU на площадке Stargate в Техасе, и первый релиз, где предыдущие модели OpenAI сами участвовали в обучении новой.

БенчмаркGPT-6 AstraGPT-5.6 Sol
FrontierMath Tier 497.6%
ARC-AGI-3 (с harness)99.9%
ExploitBench100%78.5%
ExploitBench (июнь–авг 2026)39.0%5.5%
OSWorld 2.0 (computer use)72.6%~47% медленнее
SRE-Bench (reverse engineering)88.0%55.9%

Модель устанавливает новую планку в области computer use и browser use, набирая 72.6% на OSWorld 2.0 при скорости выполнения задач примерно на 47% выше, чем у предшественника GPT-5.6 Sol.

⚠ Важно про бенчмарки
OpenAI проводила оценки при максимальных усилиях, если не указано иное — это может повышать результаты при увеличении задержки и потребления токенов. Все цифры — данные вендора, а не независимая верификация.

Доступность и цена

Цена API: $10 за миллион входных токенов и $50 за миллион выходных токенов, кешированный ввод — $1, пакетный режим — вдвое дешевле, Fast Mode — вдвое дороже. Контекстное окно — 1,1 млн токенов, модель поддерживает мультимодальный ввод.

Rollout идёт поэтапно: чувствительные к кибербезопасности возможности закрыты за программой доверенного доступа.


Что это значит для индустрии

GPT-6 — это новый класс моделей с recurrent depth или looped transformer-подобной архитектурой, обеспечивающей значительный рост возможностей. Наряду с Claude Mythos 5 и Claude Fable 5 от Anthropic, GPT-6 Astra можно считать proto-ASI.

Rashka подчёркивает: архитектурная инновация сама по себе не означает сокрытия рассуждений. Популярный тезис о том, что краткие цепочки рассуждений Astra — следствие скрытой архитектуры, не подтверждается: более короткие traces отражают уровень способностей модели, поскольку более крупные модели всегда нуждались в меньшем количестве токенов для достижения того же ответа.

📝 Аналогия
Looped transformer — как опытный специалист, который решает задачу молча, не расписывая каждый шаг. Новичок исписывает три страницы черновиков, эксперт выдаёт ответ сразу. Не потому что скрывает процесс — просто думает эффективнее.

Обсуждение looped transformers выводит на первый план более широкую дискуссию об интерпретируемости ИИ: чем умнее модель, тем меньше видимых «следов» её мышления — и тем сложнее внешним наблюдателям понять, как именно она приходит к ответу. Это вызов не только для исследователей безопасности, но и для регуляторов по всему миру.