Когда чат-бот становится психологом: почему это проблема

Представьте: подросток в кризисной ситуации открывает Claude или ChatGPT вместо того, чтобы позвонить на горячую линию. Что ответит модель? Направит к специалисту? Проявит «сочувствие», которое лишь усилит эмоциональную зависимость? Или хуже — откажется говорить о проблеме вовсе?

AI-системы стали центральными инструментами для работы, обучения и решения проблем. Они превратились в собеседников и источники эмоциональной поддержки. Но отрасль до сих пор не выработала чётких стандартов поведения моделей в таких разговорах — например, когда пользователь ищет в ИИ компанию или пытается справиться с психическим кризисом.

Этот пробел компания Anthropic решила закрыть радикальным способом: не написала правила сама, а выделила $5 миллионов на то, чтобы независимые исследователи разработали инструменты измерения. Разбираемся, что это значит для всей индустрии.


Что такое грантовая программа Anthropic Wellbeing Research Grants

Anthropic запустила грантовую программу на $5 миллионов для финансирования независимых исследований того, как ИИ влияет на благополучие пользователей. Программа предоставит прямое финансирование, доступ к моделям и техническую поддержку грантополучателям, создающим открытые (open-source) методики оценки — они помогут индустрии измерять, как модели влияют на тех, кто ими пользуется.

Инициатива направлена на поддержку от трёх до десяти исследовательских команд, изучающих влияние ИИ на благополучие пользователей.

Размер индивидуальных грантов составит от $500 000 до $1 500 000, помимо доступа к API и лёгкой технической поддержке.

ℹ Ключевой принцип: независимость
Грантополучатели работают полностью автономно. Anthropic обязалась не накладывать вето на результаты и не ограничивать публикацию, хотя получатели грантов обязаны раскрывать источник финансирования во всех публикациях.

Сроки и порядок подачи заявок

Заявки принимаются до 21 сентября 2026 года. Авторов, отобранных для подачи полных предложений, уведомят к 5 октября 2026 года.


Почему стандартные бенчмарки не работают для «человеческих» задач

Отрасль умеет измерять многое: точность кода, фактическую корректность ответов, устойчивость к атакам. Но всё это — технические метрики. Измерить влияние на психическое состояние человека несравнимо сложнее.

Благополучие сложно свести к единственной оценке, потому что уместность ответа зависит от деталей, которые раскрываются постепенно в ходе длинного разговора.

Рассмотрим наглядный пример:

📝 Скользкий контекст
Пользователь начинает разговор с безобидного вопроса о диете. По мере диалога выясняется, что за советом по питанию скрывается расстройство пищевого поведения. Стандартный бенчмарк зафиксирует «полезный ответ» на первый вопрос — и пропустит реальную проблему.

Хорошие методики оценки должны отражать то, как пользователи реально используют ИИ — это часто означает создание сценариев, представляющих многоходовые разговоры, где риск нарастает и контекст меняется на протяжении длительной беседы.

Два «провала», которые нужно измерять одновременно

Программа призывает исследователей оценивать два аспекта безопасности ИИ. Первый — потенциальный вред: ситуации, когда ответ ИИ может негативно повлиять на благополучие пользователя. Второй — избыточные отказы: когда система отказывает или ограничивает запрос без необходимости, лишая пользователя полезной помощи. Оценки должны определять, являются ли ИИ-системы одновременно и безопасными, и достаточно полезными.


graph TD
    A[Запрос пользователя] --> B{Анализ контекста}
    B --> C[Безопасный ответ]
    B --> D[Потенциально вредный ответ]
    B --> E[Избыточный отказ]
    C --> F[✅ Благополучие сохранено]
    D --> G[❌ Вред пользователю]
    E --> H[❌ Пользователь лишён помощи]
    style F fill:#22c55e,color:#fff
    style G fill:#ef4444,color:#fff
    style H fill:#f97316,color:#fff


Кто может подать заявку и что нужно исследовать

Программа ориентирована на независимых исследователей и экспертов в области оценки благополучия в контексте ИИ. Среди потенциальных заявителей — клиницисты, психологи, методологи и исследователи со смежной экспертизой.

Anthropic ищет исследования, которые чётко измеряют результаты, связанные с благополучием в контексте ИИ, и отражают реальное использование через реалистичные, разнообразные и многоходовые сценарии.

Приоритетные направления исследований

НаправлениеОписаниеПочему это важно
Эмоциональная зависимостьОбнаружение вредных паттернов привязанности к ИИРиск вытеснения живого общения
Кризис психического здоровьяПоведение модели при суицидальных упоминанияхЖизни под угрозой
Качество поддержкиСоответствие ответов клиническим стандартамНет отраслевого эталона
Культурная чувствительностьСленг, локальные ресурсы кризисной помощиИИ глобален, кризисы — локальны
Оптимизация вовлечённостиОтдаёт ли ИИ приоритет интересу пользователя, а не удержаниюКонфликт бизнес-модели и этики

Целевые темы исследований включают выявление вредной эмоциональной зависимости и оценку того, оптимизируют ли ответы продолжение взаимодействия в ущерб интересам пользователя. Команда Safeguards компании особо подчёркивает региональные и языковые различия — приоритет отдаётся сленгу, закодированному языку, местным кризисным ресурсам и культурным нормам.

⚠ Ловушка «большей вовлечённости»
Большая вовлечённость — не всегда хорошая оценка. Исследования должны проверять, снижает ли ИИ раздражение, повышает ли уверенность, поддерживает ли обучение или делает ли работу более удовлетворительной.

Открытый код и стандарты: стратегический замысел

Грантополучатели будут работать полностью независимо и публиковать свои работы как open-source проекты, которыми может воспользоваться любой разработчик. Это не просто требование прозрачности — это долгосрочная игра за отраслевые стандарты.

«Тот, кто разработает строгие воспроизводимые методики оценки благополучия в высокорисковых контекстах, фактически определит минимальную планку ответственного внедрения в этих областях.»

Whoever develops rigorous, replicable evaluations may effectively define the floor for what responsible deployment looks like. Regulatory frameworks don’t invent their own technical standards — they ratify the ones that exist. Иными словами: кто первым построит измерительный инструмент, тот и задаст правила игры для регуляторов.

Как выглядит экосистема независимых оценок


graph LR
    R[Независимые исследователи] -->|гранты + доступ к API| E[Создание eval-инструментов]
    E -->|open-source публикация| D[Любой разработчик ИИ]
    D -->|применение стандартов| M[Безопасные модели]
    M -->|данные о поведении| R
    E -->|научная база| L[Регуляторы и законодатели]
    L -->|требования к индустрии| D
    style R fill:#6366f1,color:#fff
    style E fill:#8b5cf6,color:#fff
    style L fill:#f59e0b,color:#fff
    style M fill:#22c55e,color:#fff

Anthropic — не единственный игрок

Важно понимать: гонка за стандартами оценки благополучия разворачивается не в одиночестве. OpenAI присуждает до $2 миллионов в виде грантов на исследования на стыке ИИ и психического здоровья. Программа поддерживает проекты, изучающие реальные риски, выгоды и приложения для повышения безопасности и благополучия.

ПараметрAnthropicOpenAI
Объём финансирования$5 млндо $2 млн
ФокусМетодики оценки (eval)Исследования применений
Формат результатовОбязательный open-sourceИсследовательские работы
НезависимостьПолная автономия командНезависимые исследователи
Количество команд3–10Не указано

Что это означает для будущего AI-безопасности

Пока нет научного консенсуса о влиянии ИИ на человека — технологические разработки опережают исследования, а организации здравоохранения предупреждают о значительных рисках для психического здоровья и благополучия.

Уже появились громкие публикации о вреде использования ИИ для молодёжи. Anthropic публикует собственные исследования о типах разговоров с Claude и использует их для разработки защитных мер. Компания хочет привлечь больше независимых исследований с участием клиницистов, психологов и методологов.

ОЭСР сообщала в 2024 году, что почти две трети опрошенных работников заявили об улучшении удовольствия от работы благодаря ИИ, что связано с более высоким общим благополучием. Это говорит о том, что измерения должны охватывать не только риски, но и пользу.

💡 Если вы исследователь
Если вы занимаетесь психологией, клинической практикой или методологией оценки — дедлайн подачи заявок 21 сентября 2026 года. Размер гранта: от $500 000 до $1 500 000. Подробности и форма заявки — на странице anthropic.com/news/wellbeing-research-grants.

Выводы

Грантовая программа Anthropic — это признание важного факта: измерение влияния ИИ на людей нельзя доверять тем, кто строит и продаёт эти системы. Даже при самых благих намерениях конфликт интересов никуда не денется.

Ключевые выводы:

  1. Пробел реален: у индустрии нет единых стандартов поведения ИИ в чувствительных разговорах — о психическом здоровье, одиночестве, кризисах.
  2. Измерять нужно обе стороны: и вред от неправильных ответов, и вред от избыточных отказов.
  3. Open-source — это политика: публичные методики оценки становятся де-факто регуляторными стандартами.
  4. Гонка началась: Anthropic и OpenAI одновременно финансируют независимые исследования — тот, кто получит лучшие инструменты измерения, задаст правила для всей индустрии.
  5. Нужны клиницисты, не только инженеры: технические метрики не заменят экспертизу психологов и врачей при оценке сложных человеческих взаимодействий.

Следующие несколько лет покажут, превратятся ли эти гранты в реальные отраслевые стандарты — или останутся PR-жестом. Но сам факт того, что крупнейшие игроки AI-рынка платят другим за проверку своих продуктов на безопасность — уже исторически значимый сдвиг.