Мышление GPT и Claude читают без взлома самих моделей

Исследователи из ELLIS Institute Tübingen и Max Planck Institute опубликовали работу, которая бьёт по одному из главных защитных механизмов крупных AI-компаний. Ведущие провайдеры LLM скрывают пошаговое рассуждение своих моделей — так называемый chain-of-thought (цепочка мыслей) — чтобы защитить интеллектуальную собственность и ограничить утечку информации. Оказалось, защита дырявая: чтобы прочитать скрытое рассуждение флагманской модели, не нужно её взламывать — достаточно взять зашифрованный блок рассуждений сильной модели, передать его более слабой и менее защищённой модели того же провайдера и попросить декодировать. Она выведет трейс дословно.

⚠ Затронутые провайдеры
Уязвимость подтверждена для API Anthropic, OpenAI и Google. По состоянию на июль 2026 года ни один из провайдеров не устранил проблему.

Как работает атака

Вместо того чтобы хранить трейсы рассуждений на сервере, провайдеры возвращают их клиенту в виде блоков зашифрованного текста, которые клиент передаёт обратно при каждом следующем запросе. Именно это архитектурное решение и стало уязвимостью.

Исследователи обнаружили, что зашифрованные блоки полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и моделями внутри экосистемы одного провайдера.


graph LR
    A["Запрос к Claude Opus 4.8"] --> B["Зашифрованный reasoning-блок"]
    B --> C["Атакующий перехватывает блок"]
    C --> D["Вставка в Claude Haiku 4.5"]
    D --> E["Haiku декодирует трейс в plaintext"]
    E --> F["Скрытые рассуждения раскрыты"]

Уязвимость кроется в фундаментальной асимметрии безопасности внутри семейств моделей. Флагманские модели — такие как Claude Opus 4.8 или GPT-5.6 Sol — имеют мощные механизмы защиты против раскрытия внутренних цепочек мыслей. Более дешёвые и быстрые «сиблинги» — например, Claude Haiku 4.5 или GPT-5.6 Luna — оптимизированы под скорость и стоимость, и лишены этих строгих защит.

«Haiku 4.5 может читать мысли Opus 4.8» — именно так авторы описывают суть атаки в самой статье.

Четыре вектора атаки

Уязвимость открывает четыре самостоятельных вектора атаки.

ВекторОписаниеПоследствие
Кража IPИзвлечение reasoning-трейса флагманской моделиОбход anti-distillation защиты
Утечка приватных данныхДекодирование публично доступных блоковPII, пароли, API-ключи
Опасная информацияМодель рассуждает о вредном, выдаёт безопасный ответТрейс содержит вредоносный контент
Невидимые инъекцииВредоносный payload скрыт внутри зашифрованного блокаОтравление агентных пайплайнов

Реальные утечки уже произошли

Исследователи проанализировали 6 708 публично доступных датасетов с траекториями агентов и восстановили 315 320 reasoning-блоков, обнаружив 704 отдельных приватных артефакта: 62 API-ключа, 33 пароля и 24 токена доступа — причём 64 артефакта содержались исключительно внутри reasoning-блоков, никогда не показываемых конечному пользователю.

ℹ Масштаб публичной утечки
При сканировании публичных репозиториев и логов в зашифрованных reasoning-блоках обнаружено 182 учётных записи и 367 PII-артефактов (персональных данных). Разработчики публиковали логи, не подозревая, что внутри зашифрованных блоков скрыта чувствительная информация.

Невидимые prompt injection

Четвёртый вектор позволяет атакующим выполнять невидимые prompt injection (внедрение вредоносных инструкций), встраивая вредоносные payload целиком внутрь зашифрованных блоков — для отравления публичных агентных пайплайнов.

Атакующий может побудить модель рассуждать на вредоносную тему, оставляя при этом видимый ответ безвредным — обходя таким образом фильтры вывода. После этого он может извлечь опасную информацию из полученного reasoning-трейса.

Почему защита не работала

По состоянию на июль 2026 года ни один из провайдеров LLM не предоставлял детального описания используемого криптографического механизма.

Называть эти трейсы «зашифрованными» — большое преувеличение. Если один и тот же блок расшифровывается в разных сессиях и у разных пользователей, он ни к чему не привязан — это обфускация с общим ключом, а не настоящая криптография.

💡 Что делать разработчикам прямо сейчас
  • Не публикуйте логи API-сессий — даже если reasoning-блоки выглядят как бессмысленный зашифрованный текст.
  • Проверяйте входящий JSON: если ваше приложение передаёт пользовательский контент в LLM API, злоумышленник может внедрить собственные reasoning-блоки через инъекцию в conversation stream.
  • Считайте chain-of-thought читаемым до тех пор, пока провайдер не привяжет блоки к конкретной сессии и пользователю.

Контекст и значение для отрасли

Скрытие reasoning — более слабая защита интеллектуальной собственности, чем казалось. Если сокрытие chain-of-thought является частью вашей конкурентной стратегии, эта статья существенно её ослабляет.

Вендоры были уведомлены в конце 2025 и начале 2026 года, однако ни одна из уязвимостей до сих пор не устранена.

После ответственного раскрытия исследователи предлагают конкретные криптографические и системные меры для защиты клиентской стороны при хранении reasoning-блоков.

Все разработчики, строящие агентов на базе проприетарных API, должны исходить из того, что chain-of-thought читаем — пока провайдер фактически не привяжет блок к сессии и пользователю.

Полная статья опубликована на arXiv: 2608.09867, сайт проекта: stolen-thoughts.com.