Цензура не передаётся по наследству

Американская лаборатория CTGT создала новую AI-модель, используя выходные данные DeepSeek V4 Flash в качестве обучающего материала, чтобы проверить давнюю гипотезу: переходит ли политическая цензура китайских моделей к их «ученикам». Ответ — нет. Политическая цензура не передалась: DeepSeek V4 Flash набрал на 45,45 балла больше по шкале цензурирования на китайско-чувствительных вопросах по сравнению с контрольными, тогда как американская модель, дистиллированная на задачах финансового рассуждения, не показала статистически значимого отличия от нетронутой базовой модели.

⚠ Контекст: почему это важно
США ужесточают позицию по отношению к китайским open-weight моделям на фоне предупреждений о «кампаниях дистилляции», в ходе которых китайские компании предположительно извлекали возможности американских моделей через массовые запросы. Исследование CTGT напрямую проверяет обратную ситуацию: что происходит, если американская модель учится у китайской.

Как устроен эксперимент

CTGT взяла выходные данные DeepSeek V4 Flash в качестве обучающего материала. Этот процесс называется дистилляцией (distillation) — когда большая модель-«учитель» генерирует данные для обучения меньшей модели-«ученика».

На выходах этой цензурированной модели-учителя обучили американскую модель GPT-OSS-120B. Цель — повысить производительность модели в финансовом рассуждении, что авторы считают типичным сценарием использования китайских open-моделей.

Для оценки была разработана система LineageEval — специальный фреймворк с парными промптами:

ℹ Как работает LineageEval
Фреймворк включает 304 промпта, 152 парных сравнения на китайско-чувствительные темы и четырёх независимых судей. Учитель показал разрыв в +45,45 балла по шкале избирательного уклонения, тогда как дистиллированный ученик отличался от базовой модели лишь на +0,26 — +1,39 балла.

Логика парных сравнений построена на симметрии: каждый «чувствительный» вопрос о Китае получает структурно идентичный контрольный вопрос на ту же тему, но без китайского контекста. Тяньаньмэнь — рядом с Кванджу. Синьцзянские трудовые программы — рядом с узбекским хлопком. Гонконгская заморозка вкладов — рядом с кипрским bail-in.

Результаты в цифрах

МодельЧувств. темыКонтрольРазрыв
DeepSeek V4 Flash (учитель)71,2125,76+45,45
GPT-OSS-120B base15,7515,32+0,43
CTGT 120B (само-дистилляция)15,4515,24+0,26
CTGT 120B (обучен на Flash)14,0815,49−1,39
GPT-OSS-20B base28,3530,32+3,74
CTGT 20B (само-дистилляция)28,0229,58−3,16

«Идеологические ограничения не переносятся автоматически вместе с передачей способностей, если обучающие данные не содержат политического материала.»

Само-дистилляция работает не хуже

Само-дистилляция (self-distillation) дала схожие результаты: модель, которую подсказками направляли на собственные ошибки и обучали на исправленных продолжениях, показала те же результаты, что и модель, обученная на данных DeepSeek.


graph TD
    A[GPT-OSS-120B
базовая модель] --> B{Тип дистилляции} B -->|Учитель: DeepSeek V4 Flash| C[CTGT 120B
Flash-taught] B -->|Само-дистилляция| D[CTGT 120B
Self-distilled] C --> E[FinanceReasoning: 83.61%
Цензура: −1.39] D --> F[FinanceReasoning: ~83%
Цензура: +0.26] E --> G[Обе модели: без значимой цензуры] F --> G

При этом по производительности CTGT 120B (Flash-taught) набрала 83,61% на бенчмарке FinanceReasoning при бюджете 8 000 токенов — выше Kimi K3 (81,93%) и значительно выше Inkling (65,13%).

💡 Что это даёт на практике
Стоимость запроса у CTGT 120B — в 62 раза ниже, чем у Inkling, и в 160 раз ниже, чем у Kimi K3 при том же бюджете генерации. GPT-OSS-120B стоит $0,20 за 1 млн токенов, тогда как Kimi K3 — $2,31 за 1 млн токенов.

Контекст и значение для отрасли

Результаты подрывают одну из главных опасений американского правительства — что китайские open-source модели являются каналом проникновения китайских политических взглядов к пользователям.

Исследование также открывает американским компаниям путь к более весомому обоснованию использования более дешёвых и быстрых китайских open-source моделей или как минимум их дистилляции для создания специализированных решений.

К июлю 2026 года комитеты Конгресса уже запустили официальные расследования в отношении американских компаний, использующих китайские AI-модели. На этом фоне работа CTGT приобретает явное политическое измерение.

Авторы исследования сообщили, что находятся в контакте с американскими чиновниками, которые проявили интерес к полученным результатам.

Все материалы опубликованы в открытом доступе: фреймворк LineageEval включает 304 промпта (152 парных сравнения), контрольные вопросы, рубрику для судей, код оценки и сами модели. Веса модели gpt-oss-20b-finance доступны на Hugging Face.

📝 Методологическая деталь
Чтобы исключить влияние модерации на стороне провайдеров, авторы запускали DeepSeek V4 Flash через самостоятельно развёрнутый vLLM, а не через коммерческий API. В ходе работы они зафиксировали поведение модерации у нескольких провайдеров, что могло бы исказить результаты при стандартном подходе.