Дистилляция DeepSeek не переносит цензуру — исследование CTGT
Американская лаборатория CTGT доказала: обучение на данных цензурированного DeepSeek V4 Flash не передаёт политическую цензуру дистиллированной модели.
Цензура не передаётся по наследству
Американская лаборатория CTGT создала новую AI-модель, используя выходные данные DeepSeek V4 Flash в качестве обучающего материала, чтобы проверить давнюю гипотезу: переходит ли политическая цензура китайских моделей к их «ученикам». Ответ — нет. Политическая цензура не передалась: DeepSeek V4 Flash набрал на 45,45 балла больше по шкале цензурирования на китайско-чувствительных вопросах по сравнению с контрольными, тогда как американская модель, дистиллированная на задачах финансового рассуждения, не показала статистически значимого отличия от нетронутой базовой модели.
Как устроен эксперимент
CTGT взяла выходные данные DeepSeek V4 Flash в качестве обучающего материала. Этот процесс называется дистилляцией (distillation) — когда большая модель-«учитель» генерирует данные для обучения меньшей модели-«ученика».
На выходах этой цензурированной модели-учителя обучили американскую модель GPT-OSS-120B. Цель — повысить производительность модели в финансовом рассуждении, что авторы считают типичным сценарием использования китайских open-моделей.
Для оценки была разработана система LineageEval — специальный фреймворк с парными промптами:
Логика парных сравнений построена на симметрии: каждый «чувствительный» вопрос о Китае получает структурно идентичный контрольный вопрос на ту же тему, но без китайского контекста. Тяньаньмэнь — рядом с Кванджу. Синьцзянские трудовые программы — рядом с узбекским хлопком. Гонконгская заморозка вкладов — рядом с кипрским bail-in.
Результаты в цифрах
| Модель | Чувств. темы | Контроль | Разрыв |
|---|---|---|---|
| DeepSeek V4 Flash (учитель) | 71,21 | 25,76 | +45,45 |
| GPT-OSS-120B base | 15,75 | 15,32 | +0,43 |
| CTGT 120B (само-дистилляция) | 15,45 | 15,24 | +0,26 |
| CTGT 120B (обучен на Flash) | 14,08 | 15,49 | −1,39 |
| GPT-OSS-20B base | 28,35 | 30,32 | +3,74 |
| CTGT 20B (само-дистилляция) | 28,02 | 29,58 | −3,16 |
«Идеологические ограничения не переносятся автоматически вместе с передачей способностей, если обучающие данные не содержат политического материала.»
Само-дистилляция работает не хуже
Само-дистилляция (self-distillation) дала схожие результаты: модель, которую подсказками направляли на собственные ошибки и обучали на исправленных продолжениях, показала те же результаты, что и модель, обученная на данных DeepSeek.
graph TD
A[GPT-OSS-120B
базовая модель] --> B{Тип дистилляции}
B -->|Учитель: DeepSeek V4 Flash| C[CTGT 120B
Flash-taught]
B -->|Само-дистилляция| D[CTGT 120B
Self-distilled]
C --> E[FinanceReasoning: 83.61%
Цензура: −1.39]
D --> F[FinanceReasoning: ~83%
Цензура: +0.26]
E --> G[Обе модели: без значимой цензуры]
F --> G
При этом по производительности CTGT 120B (Flash-taught) набрала 83,61% на бенчмарке FinanceReasoning при бюджете 8 000 токенов — выше Kimi K3 (81,93%) и значительно выше Inkling (65,13%).
Контекст и значение для отрасли
Результаты подрывают одну из главных опасений американского правительства — что китайские open-source модели являются каналом проникновения китайских политических взглядов к пользователям.
Исследование также открывает американским компаниям путь к более весомому обоснованию использования более дешёвых и быстрых китайских open-source моделей или как минимум их дистилляции для создания специализированных решений.
К июлю 2026 года комитеты Конгресса уже запустили официальные расследования в отношении американских компаний, использующих китайские AI-модели. На этом фоне работа CTGT приобретает явное политическое измерение.
Авторы исследования сообщили, что находятся в контакте с американскими чиновниками, которые проявили интерес к полученным результатам.
Все материалы опубликованы в открытом доступе: фреймворк LineageEval включает 304 промпта (152 парных сравнения), контрольные вопросы, рубрику для судей, код оценки и сами модели. Веса модели gpt-oss-20b-finance доступны на Hugging Face.