
Anthropic выделяет $5 млн на оценку влияния ИИ на здоровье
Anthropic запустила грантовую программу на $5 млн для независимых исследований влияния ИИ на психическое благополучие пользователей.
Когда чат-бот становится психологом: почему это проблема
Представьте: подросток в кризисной ситуации открывает Claude или ChatGPT вместо того, чтобы позвонить на горячую линию. Что ответит модель? Направит к специалисту? Проявит «сочувствие», которое лишь усилит эмоциональную зависимость? Или хуже — откажется говорить о проблеме вовсе?
AI-системы стали центральными инструментами для работы, обучения и решения проблем. Они превратились в собеседников и источники эмоциональной поддержки. Но отрасль до сих пор не выработала чётких стандартов поведения моделей в таких разговорах — например, когда пользователь ищет в ИИ компанию или пытается справиться с психическим кризисом.
Этот пробел компания Anthropic решила закрыть радикальным способом: не написала правила сама, а выделила $5 миллионов на то, чтобы независимые исследователи разработали инструменты измерения. Разбираемся, что это значит для всей индустрии.
Что такое грантовая программа Anthropic Wellbeing Research Grants
Anthropic запустила грантовую программу на $5 миллионов для финансирования независимых исследований того, как ИИ влияет на благополучие пользователей. Программа предоставит прямое финансирование, доступ к моделям и техническую поддержку грантополучателям, создающим открытые (open-source) методики оценки — они помогут индустрии измерять, как модели влияют на тех, кто ими пользуется.
Инициатива направлена на поддержку от трёх до десяти исследовательских команд, изучающих влияние ИИ на благополучие пользователей.
Размер индивидуальных грантов составит от $500 000 до $1 500 000, помимо доступа к API и лёгкой технической поддержке.
Сроки и порядок подачи заявок
Заявки принимаются до 21 сентября 2026 года. Авторов, отобранных для подачи полных предложений, уведомят к 5 октября 2026 года.
Почему стандартные бенчмарки не работают для «человеческих» задач
Отрасль умеет измерять многое: точность кода, фактическую корректность ответов, устойчивость к атакам. Но всё это — технические метрики. Измерить влияние на психическое состояние человека несравнимо сложнее.
Благополучие сложно свести к единственной оценке, потому что уместность ответа зависит от деталей, которые раскрываются постепенно в ходе длинного разговора.
Рассмотрим наглядный пример:
Хорошие методики оценки должны отражать то, как пользователи реально используют ИИ — это часто означает создание сценариев, представляющих многоходовые разговоры, где риск нарастает и контекст меняется на протяжении длительной беседы.
Два «провала», которые нужно измерять одновременно
Программа призывает исследователей оценивать два аспекта безопасности ИИ. Первый — потенциальный вред: ситуации, когда ответ ИИ может негативно повлиять на благополучие пользователя. Второй — избыточные отказы: когда система отказывает или ограничивает запрос без необходимости, лишая пользователя полезной помощи. Оценки должны определять, являются ли ИИ-системы одновременно и безопасными, и достаточно полезными.
graph TD
A[Запрос пользователя] --> B{Анализ контекста}
B --> C[Безопасный ответ]
B --> D[Потенциально вредный ответ]
B --> E[Избыточный отказ]
C --> F[✅ Благополучие сохранено]
D --> G[❌ Вред пользователю]
E --> H[❌ Пользователь лишён помощи]
style F fill:#22c55e,color:#fff
style G fill:#ef4444,color:#fff
style H fill:#f97316,color:#fff
Кто может подать заявку и что нужно исследовать
Программа ориентирована на независимых исследователей и экспертов в области оценки благополучия в контексте ИИ. Среди потенциальных заявителей — клиницисты, психологи, методологи и исследователи со смежной экспертизой.
Anthropic ищет исследования, которые чётко измеряют результаты, связанные с благополучием в контексте ИИ, и отражают реальное использование через реалистичные, разнообразные и многоходовые сценарии.
Приоритетные направления исследований
| Направление | Описание | Почему это важно |
|---|---|---|
| Эмоциональная зависимость | Обнаружение вредных паттернов привязанности к ИИ | Риск вытеснения живого общения |
| Кризис психического здоровья | Поведение модели при суицидальных упоминаниях | Жизни под угрозой |
| Качество поддержки | Соответствие ответов клиническим стандартам | Нет отраслевого эталона |
| Культурная чувствительность | Сленг, локальные ресурсы кризисной помощи | ИИ глобален, кризисы — локальны |
| Оптимизация вовлечённости | Отдаёт ли ИИ приоритет интересу пользователя, а не удержанию | Конфликт бизнес-модели и этики |
Целевые темы исследований включают выявление вредной эмоциональной зависимости и оценку того, оптимизируют ли ответы продолжение взаимодействия в ущерб интересам пользователя. Команда Safeguards компании особо подчёркивает региональные и языковые различия — приоритет отдаётся сленгу, закодированному языку, местным кризисным ресурсам и культурным нормам.
Открытый код и стандарты: стратегический замысел
Грантополучатели будут работать полностью независимо и публиковать свои работы как open-source проекты, которыми может воспользоваться любой разработчик. Это не просто требование прозрачности — это долгосрочная игра за отраслевые стандарты.
«Тот, кто разработает строгие воспроизводимые методики оценки благополучия в высокорисковых контекстах, фактически определит минимальную планку ответственного внедрения в этих областях.»
Whoever develops rigorous, replicable evaluations may effectively define the floor for what responsible deployment looks like. Regulatory frameworks don’t invent their own technical standards — they ratify the ones that exist. Иными словами: кто первым построит измерительный инструмент, тот и задаст правила игры для регуляторов.
Как выглядит экосистема независимых оценок
graph LR
R[Независимые исследователи] -->|гранты + доступ к API| E[Создание eval-инструментов]
E -->|open-source публикация| D[Любой разработчик ИИ]
D -->|применение стандартов| M[Безопасные модели]
M -->|данные о поведении| R
E -->|научная база| L[Регуляторы и законодатели]
L -->|требования к индустрии| D
style R fill:#6366f1,color:#fff
style E fill:#8b5cf6,color:#fff
style L fill:#f59e0b,color:#fff
style M fill:#22c55e,color:#fff
Anthropic — не единственный игрок
Важно понимать: гонка за стандартами оценки благополучия разворачивается не в одиночестве. OpenAI присуждает до $2 миллионов в виде грантов на исследования на стыке ИИ и психического здоровья. Программа поддерживает проекты, изучающие реальные риски, выгоды и приложения для повышения безопасности и благополучия.
| Параметр | Anthropic | OpenAI |
|---|---|---|
| Объём финансирования | $5 млн | до $2 млн |
| Фокус | Методики оценки (eval) | Исследования применений |
| Формат результатов | Обязательный open-source | Исследовательские работы |
| Независимость | Полная автономия команд | Независимые исследователи |
| Количество команд | 3–10 | Не указано |
Что это означает для будущего AI-безопасности
Пока нет научного консенсуса о влиянии ИИ на человека — технологические разработки опережают исследования, а организации здравоохранения предупреждают о значительных рисках для психического здоровья и благополучия.
Уже появились громкие публикации о вреде использования ИИ для молодёжи. Anthropic публикует собственные исследования о типах разговоров с Claude и использует их для разработки защитных мер. Компания хочет привлечь больше независимых исследований с участием клиницистов, психологов и методологов.
ОЭСР сообщала в 2024 году, что почти две трети опрошенных работников заявили об улучшении удовольствия от работы благодаря ИИ, что связано с более высоким общим благополучием. Это говорит о том, что измерения должны охватывать не только риски, но и пользу.
Выводы
Грантовая программа Anthropic — это признание важного факта: измерение влияния ИИ на людей нельзя доверять тем, кто строит и продаёт эти системы. Даже при самых благих намерениях конфликт интересов никуда не денется.
Ключевые выводы:
- Пробел реален: у индустрии нет единых стандартов поведения ИИ в чувствительных разговорах — о психическом здоровье, одиночестве, кризисах.
- Измерять нужно обе стороны: и вред от неправильных ответов, и вред от избыточных отказов.
- Open-source — это политика: публичные методики оценки становятся де-факто регуляторными стандартами.
- Гонка началась: Anthropic и OpenAI одновременно финансируют независимые исследования — тот, кто получит лучшие инструменты измерения, задаст правила для всей индустрии.
- Нужны клиницисты, не только инженеры: технические метрики не заменят экспертизу психологов и врачей при оценке сложных человеческих взаимодействий.
Следующие несколько лет покажут, превратятся ли эти гранты в реальные отраслевые стандарты — или останутся PR-жестом. Но сам факт того, что крупнейшие игроки AI-рынка платят другим за проверку своих продуктов на безопасность — уже исторически значимый сдвиг.