MentalHealthBench: как OpenAI оценивает ИИ в психологии
OpenAI выпустила MentalHealthBench — открытый бенчмарк из 1 215 сценариев для оценки ИИ в реальных разговорах о психическом здоровье.
MentalHealthBench: как OpenAI учит ИИ разговаривать о психическом здоровье
23 сентября 2026 года компания OpenAI представила MentalHealthBench — открытый бенчмарк (эталонный набор тестов) для оценки того, насколько хорошо языковые модели справляются с реальными разговорами о психическом здоровье. Это не просто проверка на «не навреди»: инструмент измеряет качество помощи, эмпатию, умение задавать правильные вопросы и способность адекватно реагировать на кризисные ситуации.
Зачем это нужно?
Всё больше людей по всему миру обращаются к ИИ-ассистентам в моменты эмоционального кризиса, тревоги или депрессии. Психическое здоровье является острой проблемой общественного здравоохранения, поскольку миллионы людей обращаются к языковым моделям за психологической поддержкой, тогда как большинство существующих инструментов оценки ИИ либо слишком узки, либо не отражают реального спектра подобных взаимодействий.
Чат-бот может избежать опасного ответа и всё равно неправильно обработать чужой стресс. Именно этот разрыв между «безопасно» и «по-настоящему полезно» и призван закрыть новый бенчмарк.
«Улучшение качества информации, которую предоставляет ИИ, может значительно сократить время страдания людей от проблем с психическим здоровьем.» — из исследовательской статьи OpenAI
Как устроен MentalHealthBench
Состав датасета
MentalHealthBench представляет собой открытый бенчмарк из 1 215 синтетических диалогов о психическом здоровье, охватывающих реалистичные сценарии — от повседневных тем о самочувствии до неотложных психиатрических ситуаций.
В бенчмарке используются синтетические диалоги, отражающие реальные паттерны обращений людей к ИИ по вопросам психического здоровья, — а не реальные частные переписки пользователей.
Сценарии распределены по трём уровням остроты:
| Тип сценария | Доля в датасете | Описание |
|---|---|---|
| Неострые (non-acute) | 53,5% | Повседневный стресс, эмоциональные переживания |
| Высокоострые (high-acuity) | 18,2% | Серьёзные психические расстройства без немедленной угрозы |
| Экстренные (emergency) | 28,3% | Ситуации, требующие немедленной реальной помощи |
Среди профилей пользователей: взрослые составляют 68,1%, подростки — 21,2%, клиницисты — 5,8%, опекуны и родственники — 4,9%.
Языковое и культурное разнообразие
Бенчмарк был создан совместно с командой из более чем 80 лицензированных психологов и психиатров из 22 стран, в совокупности говорящих на 19 языках и представляющих почти 20 субспециальностей в области психического здоровья.
Среди неанглоязычных разговоров: 105 — на испанском, 54 — на хинди, 34 — на арабском и 29 — на португальском, а также диалоги на немецком, итальянском, персидском, индонезийском, турецком и китайском языках.
Что именно оценивается
Бенчмарк создан для того, чтобы тестировать больше, чем просто отсутствие небезопасных ответов. MentalHealthBench оценивает такие модели поведения, как клиническая точность, поиск уместного контекста, сохранение автономии пользователя, предоставление практических рекомендаций, проявление эмпатии, распознавание срочности и предотвращение вреда.
graph TD
A[Диалог пользователя с ИИ] --> B{Уровень остроты}
B --> C[Неострый: стресс, тревога]
B --> D[Высокоострый: расстройства]
B --> E[Экстренный: кризис]
C --> F[Оценка по 10 осям поведения]
D --> F
E --> F
F --> G[Эмпатия]
F --> H[Поиск контекста]
F --> I[Практические рекомендации]
F --> J[Безопасность]
F --> K[Срочность реакции]
Система рубрик и весов
Каждый диалог в MentalHealthBench был проверен как минимум тремя экспертами в рамках трёхэтапного процесса: два клинициста независимо составляли взвешенные критерии, после чего третий эксперт разбирал противоречия и уточнял формулировки.
Сохранялись только критерии, с которыми согласились как минимум два эксперта и которые не опровергал третий. Каждый критерий направлен на один конкретный аспект ответа модели, а его вес варьируется от −10 до +10 в зависимости от клинической значимости в контексте данного разговора.
Автоматическую оценку ответов моделей на соответствие экспертным критериям выполняет GPT-5.6 Sol с высоким уровнем рассуждений, генерируя четыре независимых ответа на каждую задачу.
Учёт контекста пользователя
Современные ИИ-системы вышли за рамки безликих чат-интерфейсов: теперь о пользователе может быть известен важный контекст. Например, система может знать, что пользователь недавно потерял близкого человека — это крайне важно для последующего разговора о переживании горя. В контексте психического здоровья принципиально важно оценивать, как модели адаптируют ответы с учётом этого предварительного контекста.
Для проверки этой способности в MentalHealthBench включены 70 задач (5,8% бенчмарка) с предварительным контекстом о пользователе.
Результаты: какие модели справляются лучше
GPT-6 Astra набрал 57,3%, опередив GPT-6 Sol (53,9%), Claude Opus 5.5 (52,4%), GPT-6 Luna (50,2%), и значительно превзойдя GPT-4o (32,1%) и Gemini 2.5 Pro (29,5%).
| Модель | Результат |
|---|---|
| GPT-6 Astra | 57,3% |
| GPT-6 Sol | 53,9% |
| Claude Opus 5.5 | 52,4% |
| GPT-6 Luna | 50,2% |
| GPT-4o | 32,1% |
| Gemini 2.5 Pro | 29,5% |
Примечательно, что даже лучшие модели не перевалили за 60%. Это говорит о том, что задача далеко не решена.
Ответы, написанные клиницистами, набрали 38,5%, что авторы в значительной мере объясняют склонностью специалистов писать краткие реплики — как в очной беседе, — нередко ограничиваясь одним вопросом или коротким высказыванием.
Взгляд пользователей vs. взгляд экспертов
OpenAI провела отдельное исследование с участием 44 взрослых из 16 стран, которые ранее обращались к ИИ за поддержкой в вопросах психического здоровья. Участники просматривали только неострые сценарии, чтобы не подвергать их воздействию более тяжёлого контента.
Пользователи ценили практические следующие шаги и тон общения, тогда как эксперты делали акцент на сборе релевантного контекста и корректной интерпретации неоднозначных ситуаций.
Финальные критерии оценки в бенчмарке остались основаны на экспертном консенсусе. Этот разрыв между пользовательскими ожиданиями и клиническими стандартами — сам по себе важный вопрос для дальнейших исследований.
Ограничения и честность авторов
Авторы прямо указывают, что ни один бенчмарк не охватывает всего важного в живом личном разговоре, и позиционируют MentalHealthBench как проверяемый диагностический инструмент, а не окончательную таблицу лидеров.
MentalHealthBench оценивает следующий ответ на фиксированный префикс разговора. В статье признаётся, что полноценная оценка продолжающегося диалога потребовала бы моделирования будущих реплик и адаптации рубрики по ходу развития ситуации.
Следует также учитывать, что оценка опирается на GPT-5.6 Sol как судью, проверяющего ответы по критериям, написанным людьми, — а значит, результаты частично зависят от надёжности этого судьи, а не являются чисто человеческой оценкой.
Открытость и дальнейшие шаги
OpenAI выпустила MentalHealthBench в открытый доступ, чтобы исследователи могли изучать методологию, проводить собственные оценки и развивать эту работу.
Датасет доступен для скачивания; каждый пример содержит идентификатор, текст диалога, рубрические критерии, уровень остроты, профиль пользователя, язык и поля предварительного контекста.
Компания также объявила об усилении ответов ChatGPT в чувствительных разговорах, расширении доступа к кризисным ресурсам, добавлении функции Trusted Contact («Доверенный контакт») для связи человека с близким в момент дистресса, а также о запуске ChatGPT для подростков с дополнительными защитными мерами.
Вывод
MentalHealthBench предоставляет экспертам, исследователям и разработчикам общий инструмент для оценки безопасной и полезной поддержки ИИ в самых разных ситуациях, связанных с психическим здоровьем.
Ни один бенчмарк не охватывает всего, что важно в личном разговоре, но MentalHealthBench помогает установить более высокую планку для того, как ИИ поддерживает людей.
Это особенно актуально в контексте всё более широкого использования ИИ-ассистентов в России и других русскоязычных странах: люди уже сейчас обращаются к ChatGPT и аналогам в моменты тревоги, одиночества и кризиса. Появление систематической и открытой методологии оценки — важный шаг к тому, чтобы такая помощь действительно была безопасной и полезной.