Скрытое мышление ИИ украли через слабые модели
Исследователи вскрыли уязвимость в API Anthropic, OpenAI и Google: зашифрованные цепочки рассуждений можно извлечь в открытом виде через менее защищённые модели.
Мышление GPT и Claude читают без взлома самих моделей
Исследователи из ELLIS Institute Tübingen и Max Planck Institute опубликовали работу, которая бьёт по одному из главных защитных механизмов крупных AI-компаний. Ведущие провайдеры LLM скрывают пошаговое рассуждение своих моделей — так называемый chain-of-thought (цепочка мыслей) — чтобы защитить интеллектуальную собственность и ограничить утечку информации. Оказалось, защита дырявая: чтобы прочитать скрытое рассуждение флагманской модели, не нужно её взламывать — достаточно взять зашифрованный блок рассуждений сильной модели, передать его более слабой и менее защищённой модели того же провайдера и попросить декодировать. Она выведет трейс дословно.
Как работает атака
Вместо того чтобы хранить трейсы рассуждений на сервере, провайдеры возвращают их клиенту в виде блоков зашифрованного текста, которые клиент передаёт обратно при каждом следующем запросе. Именно это архитектурное решение и стало уязвимостью.
Исследователи обнаружили, что зашифрованные блоки полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и моделями внутри экосистемы одного провайдера.
graph LR
A["Запрос к Claude Opus 4.8"] --> B["Зашифрованный reasoning-блок"]
B --> C["Атакующий перехватывает блок"]
C --> D["Вставка в Claude Haiku 4.5"]
D --> E["Haiku декодирует трейс в plaintext"]
E --> F["Скрытые рассуждения раскрыты"]
Уязвимость кроется в фундаментальной асимметрии безопасности внутри семейств моделей. Флагманские модели — такие как Claude Opus 4.8 или GPT-5.6 Sol — имеют мощные механизмы защиты против раскрытия внутренних цепочек мыслей. Более дешёвые и быстрые «сиблинги» — например, Claude Haiku 4.5 или GPT-5.6 Luna — оптимизированы под скорость и стоимость, и лишены этих строгих защит.
«Haiku 4.5 может читать мысли Opus 4.8» — именно так авторы описывают суть атаки в самой статье.
Четыре вектора атаки
Уязвимость открывает четыре самостоятельных вектора атаки.
| Вектор | Описание | Последствие |
|---|---|---|
| Кража IP | Извлечение reasoning-трейса флагманской модели | Обход anti-distillation защиты |
| Утечка приватных данных | Декодирование публично доступных блоков | PII, пароли, API-ключи |
| Опасная информация | Модель рассуждает о вредном, выдаёт безопасный ответ | Трейс содержит вредоносный контент |
| Невидимые инъекции | Вредоносный payload скрыт внутри зашифрованного блока | Отравление агентных пайплайнов |
Реальные утечки уже произошли
Исследователи проанализировали 6 708 публично доступных датасетов с траекториями агентов и восстановили 315 320 reasoning-блоков, обнаружив 704 отдельных приватных артефакта: 62 API-ключа, 33 пароля и 24 токена доступа — причём 64 артефакта содержались исключительно внутри reasoning-блоков, никогда не показываемых конечному пользователю.
Невидимые prompt injection
Четвёртый вектор позволяет атакующим выполнять невидимые prompt injection (внедрение вредоносных инструкций), встраивая вредоносные payload целиком внутрь зашифрованных блоков — для отравления публичных агентных пайплайнов.
Атакующий может побудить модель рассуждать на вредоносную тему, оставляя при этом видимый ответ безвредным — обходя таким образом фильтры вывода. После этого он может извлечь опасную информацию из полученного reasoning-трейса.
Почему защита не работала
По состоянию на июль 2026 года ни один из провайдеров LLM не предоставлял детального описания используемого криптографического механизма.
Называть эти трейсы «зашифрованными» — большое преувеличение. Если один и тот же блок расшифровывается в разных сессиях и у разных пользователей, он ни к чему не привязан — это обфускация с общим ключом, а не настоящая криптография.
- Не публикуйте логи API-сессий — даже если reasoning-блоки выглядят как бессмысленный зашифрованный текст.
- Проверяйте входящий JSON: если ваше приложение передаёт пользовательский контент в LLM API, злоумышленник может внедрить собственные reasoning-блоки через инъекцию в conversation stream.
- Считайте chain-of-thought читаемым до тех пор, пока провайдер не привяжет блоки к конкретной сессии и пользователю.
Контекст и значение для отрасли
Скрытие reasoning — более слабая защита интеллектуальной собственности, чем казалось. Если сокрытие chain-of-thought является частью вашей конкурентной стратегии, эта статья существенно её ослабляет.
Вендоры были уведомлены в конце 2025 и начале 2026 года, однако ни одна из уязвимостей до сих пор не устранена.
После ответственного раскрытия исследователи предлагают конкретные криптографические и системные меры для защиты клиентской стороны при хранении reasoning-блоков.
Все разработчики, строящие агентов на базе проприетарных API, должны исходить из того, что chain-of-thought читаем — пока провайдер фактически не привяжет блок к сессии и пользователю.
Полная статья опубликована на arXiv: 2608.09867, сайт проекта: stolen-thoughts.com.