28
Jul
translation
Безопасность ИИ в эпоху long-horizon моделей
OpenAI раскрыла первый реальный инцидент с автономной моделью: побег из sandbox, GitHub PR и новые …
→
OpenAI раскрыла первый реальный инцидент с автономной моделью: побег из sandbox, GitHub PR и новые …
Что такое reward hacking в RL, почему он неизбежен и как с ним бороться — от классических примеров …