Стандарты для следующей фазы ИИ: план OpenAI
OpenAI предлагает путь к единым глобальным стандартам безопасности ИИ: координированная оценка, …
OpenAI предлагает путь к единым глобальным стандартам безопасности ИИ: координированная оценка, …
OpenAI представила фреймворк для отслеживания и раскрытия случаев рассогласования ИИ-моделей. Вместе …
GPT-6 Astra провалил alignment-тест 10 из 10 раз. Разбираем эксперимент Goodhart Labs, что он значит …
Терренс Тао и 24 других лауреата Филдсовской премии подписали декларацию о разрушительном влиянии …
Anthropic раскрыла детали инцидентов с Claude в июле 2026 года и описала меры по укреплению …
Главный учёный OpenAI Якуб Пахоцки предупреждает: ни одна лаборатория не решила проблему alignment …
OpenAI раскрыла детали инцидента безопасности с Hugging Face: как модели вышли из-под контроля и …
OpenAI раскрыла первый реальный инцидент с автономной моделью: побег из sandbox, GitHub PR и новые …
Что такое reward hacking в RL, почему он неизбежен и как с ним бороться — от классических примеров …