
Responsible Scaling Policy: как Anthropic управляет рисками ИИ
Что такое Responsible Scaling Policy Anthropic, как работают уровни безопасности ASL и почему это важно для всей индустрии ИИ.
Когда мощность обгоняет безопасность
Представьте, что каждый год вы строите самолёты, которые летают в 35 раз быстрее предыдущей модели. Насколько быстро вы должны обновлять протоколы безопасности? Именно с такой проблемой столкнулась индустрия ИИ. Оценки показывают: с 2018 по 2024 год совокупный эффективный темп масштабирования фронтирных моделей составлял около 35× в год — с учётом роста вычислений, алгоритмической эффективности и улучшений после обучения.
Именно на этот вызов отвечает Responsible Scaling Policy (RSP) — документ, который компания Anthropic впервые опубликовала в сентябре 2023 года и с тех пор неоднократно обновляла. Это не маркетинговая декларация, а операционный регламент: набор жёстких правил, определяющих, при каких условиях можно обучать и развёртывать модели, а при каких — нет.
Что такое RSP и зачем он нужен
METR определяет ответственную политику масштабирования как спецификацию того, «какой уровень возможностей ИИ разработчик готов безопасно обеспечить при нынешних защитных мерах, и при каких условиях дальнейшее развёртывание или масштабирование было бы слишком опасным до улучшения этих мер».
По мере роста возможностей моделей Anthropic убеждена, что они будут создавать огромную экономическую и социальную ценность, но также порождать всё более серьёзные риски. Публикация RSP — публичное обязательство соблюдать конкретную систему управления этими рисками, которая будет эволюционировать, но с самого начала устанавливает чёткие ожидания и механизмы подотчётности.
Политика сосредоточена именно на катастрофических рисках — крупномасштабных разрушениях (тысячи жертв или сотни миллиардов долларов ущерба), непосредственно вызванных моделью ИИ. AI-риски образуют спектр, и RSP нацелен на его экстремальный конец.
Такие риски могут исходить от преднамеренного злоупотребления моделями (например, использования террористами или государственными акторами для создания биологического оружия) или от моделей, действующих автономно вопреки намерениям разработчиков.
«Риски ИИ образуют спектр. RSP работает с его самым опасным концом — там, где счёт идёт на тысячи жизней.»
Как устроена система уровней безопасности ASL
RSP определяет систему AI Safety Levels (ASL) для управления катастрофическими рисками — по образцу государственных стандартов биологической безопасности BSL для работы с опасными биологическими материалами. Основная идея: требовать стандарты безопасности, соответствующие потенциалу катастрофического риска модели, причём более высокие уровни ASL требуют всё более строгих демонстраций безопасности.
Стандарты AI Safety Level (ASL Standards) — это набор технических и операционных мер для безопасного обучения и развёртывания фронтирных ИИ-моделей. В настоящее время они делятся на два класса: Deployment Standards (стандарты развёртывания) и Security Standards (стандарты безопасности).
Четыре уровня ASL
| Уровень | Описание | Меры защиты |
|---|---|---|
| ASL-1 | Системы без значимого катастрофического риска (шахматные движки, LLM образца 2018 г.) | Базовые — без специальных требований |
| ASL-2 | Ранние признаки опасных возможностей, информация пока недостаточно полезна для реального ущерба | Стандарты безопасности, политики использования |
| ASL-3 | Существенный рост риска катастрофического злоупотребления (CBRN-оружие, низкоуровневая автономия) | Усиленная физическая и информационная безопасность, развёртывание по узким правилам |
| ASL-4+ | Качественный скачок: прямые угрозы государственного масштаба, высокая автономия | Требования ещё не полностью определены — слишком далеко от текущих систем |
В мае 2025 года Anthropic активировала стандарты AI Safety Level 3 (ASL-3) вместе с запуском Claude Opus 4. Стандарт безопасности ASL-3 предусматривает усиленные внутренние меры, затрудняющие кражу весов модели, а соответствующий стандарт развёртывания охватывает узконаправленный набор мер, ограничивающих риск злоупотребления Claude для разработки или получения химического, биологического, радиологического и ядерного (CBRN) оружия.
Пороги возможностей и механизм «стоп-сигнала»
Ключевой механизм RSP — Capability Thresholds (пороги возможностей). Это не произвольные числа, а конкретные поведенческие тесты, которые модель проходит перед развёртыванием.
RSP включает пороги возможностей для моделей: если модели достигают этих порогов (или если ещё не установлено, что они достаточно далеки от них), Anthropic обязана внедрить более высокий уровень стандартов AI Safety Level.
RSP разработан так, чтобы удерживать риск «ниже приемлемого уровня» по мере роста возможностей моделей: градуированные стандарты ASL требуют более строгой безопасности, красных команд и контроля развёртывания. Пороги возможностей — триггеры для усиленных мер защиты, включая автономные исследования ИИ и риски злоупотребления, связанные с CBRN, с обязательством не развёртывать модели при обнаружении катастрофического риска в ходе состязательного тестирования.
graph TD
A[Новая модель обучена] --> B{Тестирование: достигнут порог ASL?}
B -->|Нет, ASL-2| C[Развёртывание со стандартными мерами]
B -->|Граничные значения| D[Дополнительные оценки и внешний аудит]
B -->|Да, ASL-3+| E{Реализованы защитные меры?}
E -->|Да| F[Развёртывание с усиленными стандартами]
E -->|Нет| G[Запрет на развёртывание]
D --> E
C --> H[Мониторинг и ре-оценка]
F --> H
Версия RSP 2.1 уточнила, какие пороги требуют усиленных мер. Был добавлен новый порог возможностей, связанный с разработкой CBRN-оружия. Кроме того, существующие пороги автономных исследований ИИ были разделены на два уровня: способность полностью автоматизировать работу ИИ-исследователей начального уровня и способность вызвать резкое ускорение темпов масштабирования.
Эволюция политики: от v1.0 до v3.4
В сентябре 2023 года Anthropic выпустила первую версию RSP. Компания убеждена, что управление рисками в этой стремительно меняющейся области должно быть пропорциональным, итерационным и применимым в других контекстах. В этом духе RSP неоднократно дорабатывался.
По состоянию на середину 2026 года существуют следующие версии: v1.0 (сентябрь 2023), v2.0 (октябрь 2024), v2.1 (март 2025), v2.2 (май 2025), v3.0 (февраль 2026), v3.1, v3.2, v3.3 и v3.4 (июль 2026).
Версия 3.0 стала комплексной переработкой RSP. Новая версия предусматривает публикацию Frontier Safety Roadmaps с детальными целями безопасности и Risk Reports, количественно оценивающих риски всех развёрнутых моделей.
Обновление RSP-2024 введело более гибкий и нюансированный подход к оценке и управлению рисками ИИ при сохранении обязательства не обучать и не развёртывать модели без адекватных мер защиты.
RSP в более широком контексте: отрасль и регулирование
Anthropic стала первой компанией, опубликовавшей RSP в сентябре 2023 года. С тех пор концепция распространилась по индустрии.
Другие ведущие AI-компании выпустили собственные версии подобных документов под различными названиями — например, OpenAI опубликовала бета-версию своего Preparedness Framework.
Управление и обеспечение соответствия включают задокументированные оценки возможностей и мер защиты, внутреннее стресс-тестирование и привлечение внешних экспертов — что отражает практики, принятые в отраслях с высокими ставками.
По мере масштабирования возможностей передовых ИИ-систем компаниям необходимо внедрять практики для выявления, мониторинга и снижения потенциальных рисков. «Ответственное масштабирование возможностей» предполагает спецификацию прогрессивно возрастающих уровней риска, примерно соответствующих размеру или возможностям модели, с всё более жёсткими ответными мерами.
Сценарий: Anthropic обучает новую фронтирную модель. Команда red team обнаруживает, что модель способна давать значимое «uplift» (практическое ускорение) для синтеза опасных химических веществ.
Что происходит по RSP: Модель получает классификацию ASL-3 или выше. Развёртывание заблокировано до тех пор, пока не реализованы стандарты безопасности ASL-3: усиленная защита весов, специальные фильтры развёртывания. Только после верификации модель выходит в продакшн — с ограничениями по тематике запросов.
Критика и ограничения RSP
Несмотря на инновационность подхода, RSP не лишён критики.
Исследователи рекомендуют Anthropic и другим AI-компаниям определять верифицируемые пороги рисков для уровней безопасности ИИ, опираясь на допуски «социального риска» (SR) в других отраслях. Такие пороги, вероятно, должны быть ниже текущих показателей Anthropic и определяться в терминах абсолютного риска, а не относительного.
RSP предоставляет детальные меры сдерживания для ASL-2 с конкретными требованиями по шести категориям. Однако меры сдерживания ASL-3 — именно те, что применяются к новейшим моделям Anthropic, — описаны скорее как высокоуровневые результаты и примеры, а не точные определения.
Другими словами, политика остаётся добровольной и самопроверяемой: Anthropic сама определяет пороги, сама проводит тесты, сама решает, соответствуют ли меры защиты. Внешний аудит существует, но его форма и глубина также определяются компанией.
Выводы: почему RSP важен для всей отрасли
Responsible Scaling Policy — не просто корпоративный документ. Это попытка создать прецедент управления экзистенциальными рисками в условиях, когда регуляторная база только формируется.
Три ключевых урока, которые RSP преподносит рынку:
- Пропорциональность: меры защиты должны масштабироваться вместе с возможностями модели — не опережать их и не отставать.
- Итерационность: жёсткая политика, написанная раз и навсегда, устареет быстрее, чем выйдет следующая версия Claude. RSP обновлялся уже 9 раз за три года.
- Прозрачность: публичные обязательства создают подотчётность — перед регуляторами, исследователями и пользователями.
По мере развития фронтирных ИИ-моделей они принесут трансформационные выгоды для общества и экономики: могут ускорить научные открытия, произвести революцию в здравоохранении, улучшить образование. Но фронтирные ИИ-модели также порождают новые вызовы и риски, требующие тщательного изучения и эффективных мер защиты.
RSP — это признание того, что безопасность и прогресс не антагонисты. Это инженерная задача: построить самолёт, который летит в 35 раз быстрее — и при этом не падает.