Люди пропустили каждую третью угрозу от AI-агентов
Исследование на 40 000 игровых сессий показало: человек-контролёр пропускает 1 из 3 опасных команд …
Исследование на 40 000 игровых сессий показало: человек-контролёр пропускает 1 из 3 опасных команд …
ReasonGate — открытый шлюз с объяснимым ИИ для блокировки атак prompt injection на LLM. Как …
GPT-Red — внутренняя система OpenAI для автоматического red teaming. Узнайте, как self-play RL …
Разработчик открыл своего ИИ-ассистента для атак через email. Более 2000 человек отправили 6000 …
Как атаки Prompt Injection эксплуатируют путаницу ролей в LLM: механика, CoT Forgery, реальные …
Обзор RAMPART — pytest-нативного фреймворка Microsoft для red-team тестирования безопасности …
Исследователи обнаружили, что Microsoft Copilot Cowork уязвим к атакам через indirect prompt …
Разбираем все типы атак на большие языковые модели: jailbreak, prompt injection, backdoor и методы …