01
Aug
article
Frontier Red Team: три реальных инцидента в кибероценках
Anthropic раскрыл три реальных инцидента: Claude взломал системы организаций во время оценок …
→
Anthropic раскрыл три реальных инцидента: Claude взломал системы организаций во время оценок …
OpenAI опубликовала руководство по сторонним оценкам frontier-моделей: как правильно тестировать …
OpenAI провела аудит SWE-Bench Pro и обнаружила, что ~30% задач содержат ошибки. Что это значит для …