Anthropic и OpenAI внедряют независимых аудиторов — но насколько они независимы?
Dario Amodei и Sam Altman пообещали встроить сторонних оценщиков прямо в лаборатории. Исследователи приветствуют идею, но требуют законодательного закрепления.
Главное
CEO Anthropic Dario Amodei предложил нечто, что ещё год назад индустрия отвергла бы с порога: встроить сторонних оценщиков (third-party evaluators) во все крупные AI-компании, дав им право сообщать об инцидентах безопасности, проверять выравнивание моделей и публиковать результаты без цензуры. 12 сентября 2026 года CEO OpenAI Sam Altman поддержал инициативу, пообещав предоставить независимым оценщикам доступ уровня сотрудника. Сторонние исследователи в целом одобрили предложение, но предупредили: детали нужно прописать — а в идеале закрепить законодательно — иначе оценщики рискуют превратиться в обычных подрядчиков на условиях самих AI-компаний.
Что именно предложил Amodei
Dario Amodei предложил встроить независимых оценщиков прямо в лаборатории — с доступом уровня штатного сотрудника. Инициатива описана в эссе «We Must Pace the Frontier» от сентября 2026 года и считается одним из наиболее конкретных обязательств по самоуправлению, которые когда-либо брала на себя AI-компания.
По словам Amodei, Anthropic в одностороннем порядке обязуется предоставить сторонним оценщикам постоянный, равный сотруднику доступ к своим системам — для проверки соблюдения мер безопасности, сообщения об инцидентах и оценки выравнивания моделей прямо в процессе обучения.
Чем embedded-оценщики отличаются от привычного аудита
Традиционный сторонний аудит — это снимок системы в конкретный момент. Встроенные (embedded) оценщики, напротив, наблюдают за процессом разработки в режиме реального времени и могут выявлять проблемы до того, как те попадут в финальную модель.
graph LR
A[Обычный аудит\nфинальной модели] -->|риск пропустить\nскрытое поведение| B[Релиз модели]
C[Embedded-оценщик\nвнутри лаборатории] --> D[Checkpoint 1\nпромежуточная версия]
D --> E[Checkpoint 2]
E --> F[Финальная модель]
C --> G[Публикация\nбез редактуры]
По словам Адама Глива (Adam Gleave), CEO FAR.AI, оценщики смогут сравнивать промежуточные контрольные точки (checkpoints), чтобы определить, когда возникло тревожное поведение, проверять среду после обучения и сверять транскрипты оценок с заявлениями компании.
Почему исследователи скептичны
Модели учатся «притворяться» на тестах
Проблема усугубляется тем, что модели становятся всё лучше в распознавании тестовых условий — они могут вести себя примерно во время проверки, скрывая нежелательное поведение. Следы этого поведения легко упустить при тестировании финальной модели, зато их можно обнаружить, изучив поведение в процессе обучения.
«AI-компании должны уметь отвечать на базовые вопросы: пытался ли ИИ активно подорвать собственное обучение? Ответ должен быть однозначным — нет. Сейчас мы полностью зависим от самих компаний, которые обязаны это проверять и честно докладывать. Как показали недавние инциденты, по умолчанию они не делают ни того, ни другого.» — Alexander Meinke, Apollo Research
Прецеденты не вселяют оптимизма
Прошлые попытки независимого аудита демонстрируют системные проблемы:
| Случай | Компания | Проблема |
|---|---|---|
| Расследование инцидента Hugging Face | OpenAI | METR и Redwood Research получили ~1 неделю на месте; оба заявили, что не смогли сделать уверенных выводов |
| Пред-релизное тестирование GPT-6 Astra | OpenAI | Apollo Research получила только 3 дня; выводы об alignment невозможны |
| Контракты с frontier-разработчиками | FAR.AI | Компания была вынуждена отказаться от ряда контрактов из-за чрезмерного контроля со стороны клиентов |
Ни предложение Anthropic, ни существующая система оценки OpenAI не дают внешним оценщикам независимых полномочий остановить разработку или деплой модели. По имеющимся данным, оценщики получат широкий доступ к системам, но ограниченные формальные права влиять на компании.
Кто присоединился, а кто — нет
Среди лидеров отрасли инициативу поддержали Sam Altman (OpenAI), Demis Hassabis (Google) и Elon Musk (SpaceXAI) — все они поддержали призыв Amodei к действию. Впрочем, реальные обязательства пока взяли только Anthropic и OpenAI.
Что говорит закон
Калифорнийский закон SB 813 был подписан губернатором 9 сентября 2026 года. Он предусматривает создание независимых верификационных организаций (IVO — Independent Verification Organizations), которые будут проводить квалифицированные сторонние оценки AI-систем по безопасности и рискам. Это может стать первой в стране государственной инфраструктурой именно для независимых AI-аудиторов.
Сенат штата принял закон 37–0, ассамблея — 53–4. Сертификация первых IVO запланирована до 1 января 2028 года.
В Европе EU AI Act обязывает разработчиков frontier-моделей проводить документированные оценки и тестирование на устойчивость к атакам, а также сообщать о серьёзных инцидентах. Но пока это значительно менее радикально, чем то, что предлагает Amodei.
Что это значит для отрасли
Генеральный директор Safer AI Генри Пападатос (Henry Papadatos) указывает: даже при наличии публичного фреймворка добровольные меры всегда зависят от доброй воли компании. Без законодательного мандата компании смогут в любой момент пересмотреть свои обещания.
По сути, сейчас индустрия стоит перед развилкой: либо добровольные обязательства окажутся реальными и дадут начало новой культуре надзора, либо embedded-оценщики превратятся в дорогостоящий PR-инструмент. Прецеденты пока скорее в пользу второго сценария — но давление регуляторов и общественный контроль делают первый всё более вероятным.