Как ChatGPT учится у мира и защищает вашу приватность
Как ChatGPT использует данные для обучения, какие технологии защищают вашу приватность и как вы управляете своими данными.
Как ChatGPT учится у мира и защищает вашу приватность
Каждый раз, когда вы пишете сообщение в ChatGPT — просите помочь с кодом, обсуждаете рабочий проект или просто болтаете — возникает закономерный вопрос: а что происходит с этими данными? Используются ли они для обучения модели? Видит ли их кто-то ещё? Можно ли этим управлять?
OpenAI опубликовала подробное объяснение того, как ChatGPT совершенствуется благодаря обучению на данных — и одновременно как компания защищает приватность пользователей. Разберём всё по порядку.
Почему ChatGPT вообще обучается на данных?
ChatGPT становится всё более мощным инструментом, помогая людям решать сложные задачи: писать код, проводить исследования, анализировать данные и выполнять многошаговые задания. Этот рост возможностей достигается за счёт обучения на самых разнообразных данных — так модель формирует широкое представление о мире и учится применять знания в новых ситуациях.
Простыми словами: чтобы ChatGPT хорошо понимал вопросы о медицине, праве, программировании, кулинарии и тысячах других тем, он должен был «прочитать» огромное количество текстов. Без этого модель была бы бесполезной.
Что именно попадает в обучение?
По мере того как OpenAI разрабатывает новые frontier-модели (модели переднего края), компания прилагает значительные усилия, чтобы процесс обучения уважал приватность. Для этого разработаны технологии, помогающие моделям усваивать полезные общие паттерны, а не личную информацию об отдельных людях — и введён ряд пользовательских настроек и политик.
Ключевой принцип OpenAI звучит так: модели должны учиться у мира, а не у частных лиц. Компания не занимается целенаправленным сбором персональных данных, не строит профили на основе публичной информации и стремится удалять персональные идентификаторы из обучающих наборов везде, где это возможно.
Кроме того, модели специально обучают отказывать в предоставлении частной информации о реальных людях — например, адресов или контактных данных.
Какие данные собираются при использовании ChatGPT?
Главное, что собирает ChatGPT, — это журналы чатов: всё, что вы вводите в текстовое поле. Если вы сообщили свой адрес, религиозные убеждения или имя близкого человека — эта информация сохраняется. Если вы загрузили файл, например резюме, которое обычно содержит много личных данных, — оно тоже сохраняется.
Помимо содержания чатов, OpenAI собирает адрес электронной почты при регистрации аккаунта. При каждом использовании сервиса фиксируются IP-адрес, информация об устройстве (включая уникальные идентификаторы), данные cookies и геолокация.
Privacy Filter: технология защиты персональных данных
Одним из ключевых инструментов защиты является OpenAI Privacy Filter — система автоматического выявления и маскирования персональной информации в текстах.
Privacy Filter идентифицирует и скрывает персональные данные в текстах. По оценкам OpenAI, этот инструмент эффективнее удаляет личную информацию, чем любой другой аналогичный инструмент. Внутренняя версия Privacy Filter применяется на нескольких этапах процесса обучения — в том числе к публичным датасетам (наборам данных) и к переписке пользователей, которые включили опцию «Улучшать модель для всех».
Примечательно, что OpenAI сделала Privacy Filter бесплатно доступным для других разработчиков — чтобы содействовать защите приватности в масштабах всей индустрии.
Как данные проходят через систему: схема процесса
graph TD
A[Пользователь пишет сообщение] --> B{Включена опция\n'Улучшать модель'?}
B -- Да --> C[Разговор попадает\nв обучающую выборку]
B -- Нет --> D[Разговор хранится\nтолько для истории]
C --> E[Privacy Filter\nмаскирует личные данные]
E --> F[Обезличенные паттерны\nиспользуются для обучения]
D --> G[Хранение 30 дней\nпосле удаления]
F --> H[Модель улучшается]
Как управлять своими данными: практическое руководство
Отключить обучение на ваших разговорах
Пользователи могут сами решать, будут ли их разговоры с ChatGPT использоваться для обучения будущих моделей. Для этого нужно перейти в Настройки → Управление данными и отключить опцию «Улучшать модель для всех». После отключения новые разговоры по-прежнему будут отображаться в истории чатов, но не будут использоваться для обучения ChatGPT.
Временные чаты
Функция временных чатов (Temporary Chats) позволяет вести разговоры, которые автоматически удаляются через 30 дней — если только они не были помечены как подозрительные.
Экспорт и удаление данных
ChatGPT предоставляет функцию экспорта данных: вы можете скачать всё, что система хранит о вас. Перейдите в Настройки → Управление данными → Экспорт данных. В течение нескольких дней OpenAI пришлёт вам на почту полный архив — все разговоры, данные аккаунта и прочее.
Для более детальных запросов существует Privacy Portal (портал конфиденциальности): через него можно скачать свои данные, запретить обучение на вашем контенте, удалить аккаунт или потребовать удаления личных данных.
Что происходит после отключения обучения?
Даже при включённой истории чатов можно запретить OpenAI использовать ваши переписки для улучшения модели. Эта настройка тоже находится в разделе «Управление данными». Когда она отключена, чаты хранятся 30 дней для целей модерации, а затем удаляются — в будущие версии GPT они не попадают.
Сравнение уровней приватности по типам аккаунтов
| Тип аккаунта | Обучение по умолчанию | Управление данными | Гарантии |
|---|---|---|---|
| Бесплатный | Включено | Можно отключить вручную | Базовые |
| ChatGPT Plus | Включено | Можно отключить вручную | Базовые |
| ChatGPT Team / Enterprise | Отключено | Полный контроль администратора | Договорные |
| API (без истории чатов) | Отключено | N/A | Высокие |
Важно понимать: даже если вы платите $20 в месяц за ChatGPT Plus, ваши данные по умолчанию всё равно могут использоваться для обучения модели. Повышение тарифа покупает вам доступ к более мощным функциям — но не автоматическую приватность.
Регуляторный контекст: GDPR и штрафы
Vопрос приватности ChatGPT активно изучают регуляторы по всему миру.
Итальянский регулятор в сфере защиты данных (Garante) стал первым крупным органом, предпринявшим действия против OpenAI. В 2024 году он оштрафовал компанию на €15 миллионов за нарушение правил GDPR — в частности, за отсутствие верификации возраста, недостаточную прозрачность обработки данных и отсутствие правового основания для сбора персональной информации.
Аудит ЕС 2024 года выявил, что 63% пользовательских данных ChatGPT содержат персонально идентифицируемую информацию (PII), при этом лишь 22% пользователей знают о возможности отказаться от обучения.
«Большинство пользователей понятия не имеют, что происходит с их перепиской после нажатия кнопки отправки» — и это остаётся главной проблемой приватности в эпоху генеративного ИИ.
Проблему обостряет и техническая особенность больших языковых моделей: как подчёркивает Нидерландский регулятор по защите данных, LLM-модели не могут легко «забыть» конкретный факт без полного переобучения. Это создаёт конфликт с правом на исправление данных, предусмотренным GDPR.
Практические советы для защиты приватности
- Откройте Настройки → Управление данными в ChatGPT
- Отключите «Улучшать модель для всех», если не хотите участвовать в обучении
- Используйте Временные чаты для чувствительных разговоров
- Не вводите в ChatGPT реальные паспортные данные, банковские реквизиты или медицинские сведения в связном виде
- Экспортируйте свои данные, чтобы понять, что хранится
Анонимизация перед отправкой
Если вам нужна помощь с документом, содержащим личные данные, — замените их на заглушки. Например:
Оригинал: «Иван Петров, ИНН 123456789, живёт по адресу ул. Ленина, 5»
Для ChatGPT: «[Имя клиента], ИНН [XXXXXXXXX], живёт по адресу [адрес]»
Таким образом вы получаете помощь с задачей, не передавая реальные персональные данные.
Итог: баланс между пользой и приватностью
OpenAI строит ChatGPT на принципе: защита приватности встраивается в модели и каждую функцию — от проектирования до запуска и последующего мониторинга. Модели созданы, чтобы учиться у мира — а не у частных лиц.
Но реальность такова, что ChatGPT не является приватным по умолчанию. Если вы используете бесплатный аккаунт или даже платный личный план, ваши переписки могут использоваться для обучения AI — а значит, сотрудники OpenAI теоретически могут их прочитать.
Хорошая новость: возможность что-то с этим сделать есть. OpenAI предоставляет инструменты контроля над данными — они просто не всегда заметны, и большинство пользователей ими не пользуется. Теперь вы знаете, где они находятся и как ими воспользоваться.
Хотите участвовать в улучшении ChatGPT? Оставьте настройки по умолчанию.
Хотите максимальной приватности? Отключите «Улучшать модель», используйте временные чаты и рассмотрите Enterprise-план для рабочих задач.