Cloudflare открыла ИИ-аудитор уязвимостей для всех

Cloudflare опубликовала на GitHub инструмент security-audit-skill — навык для coding-агентов (программных ИИ-ассистентов для работы с кодом), который превращает любой совместимый агент в полноценного аудитора безопасности. Это open-source многофазный фреймворк безопасности, разработанный для ИИ-агентов — таких как GitHub Copilot или Claude Code. Инструмент стал публичной точкой входа во внутренние технологии компании: именно этот навык использовался для разработки внутреннего харнеса уязвимостей Cloudflare и был слегка доработан перед публикацией для упрощения интеграции, но по существу остался тем же.


Как это работает: шесть фаз аудита

Skill превращает агента в аудитора безопасности и управляет изолированными подагентами через разведку, охоту под управлением покрытия, валидацию кандидатов, структурированный вывод, независимую верификацию записей и нейтральную отчётность.


graph TD
    A[Phase 1: Reconnaissance
Разведка архитектуры] --> B[Phase 2: Coverage-led Hunting
Охота по покрытию] B --> C[Phase 3: Candidate Validation
Валидация кандидатов] C --> D[Phase 4: Structured Output
Структурированный вывод] D --> E[Phase 5: Independent Verification
Независимая верификация] E --> F[Phase 6: Target-neutral Reporting
Нейтральная отчётность]

Каждая фаза выполняется отдельными изолированными агентами. Принцип прост и жёсткий:

«Агент, который проверяет находку, никогда не является тем агентом, который её обнаружил.»

Это так называемая adversarial validation — состязательная проверка, при которой один агент ищет уязвимость, а другой, независимый, пытается её опровергнуть.


Три вердикта вместо бесконечных «возможно»

Система выдаёт находки в машиночитаемом формате findings.json с тремя чёткими статусами:

СтатусЧто означает
confirmedПолный след в исходниках + доказанный результат
needs_validationКонкретный неразрешённый факт, без severity
rejectedКандидат опровергнут верификатором

В отличие от традиционных SAST-инструментов (статического анализа), работающих по фиксированным правилам, этот навык использует адаптивное рассуждение на базе LLM. В отличие от разового запроса к ИИ, он соблюдает строгий протокол верификации несколькими агентами, имитируя человеческое peer review и производя проверяемые доказательства.

⚠ Важно
Статус confirmed присваивается только при наличии полного трейса в исходном коде и конкретно наблюдаемого результата. «Теоретически атакующий мог бы…» — не засчитывается.

Покрытие растёт с каждым запуском

Одна из ключевых особенностей инструмента — аддитивность запусков. Несколько запусков улучшают покрытие: в тестах один запуск находил примерно половину уязвимостей от общего числа, выявленного за несколько запусков.

Если для репозитория уже существуют предыдущие запуски, агент читает их findings.json перед началом фазы 2: пропускает известные находки, упоминает их в отчёте, но концентрирует охоту на новых областях и переключается на классы атак, которые предыдущие запуски не охватывали.

💡 Совет
Запускайте аудит несколько раз подряд на одном репозитории — каждый новый прогон целится в пробелы предыдущего и существенно увеличивает суммарное покрытие.

Классы атак из коробки

Инструмент поставляется с готовыми файлами охоты под разные типы целей:

ФайлДля чего
AI-AND-LLM.mdPrompt injection, agent/tool атаки, LLM-backed цели
WEB-PROTOCOL-AND-AUTH.mdHTTP framing, cache, аутентификация
MEMORY-SAFETY-AND-BINARY.mdMemory safety, binary, ядро
CLIENT-SIDE.mdDOM injection, prototype pollution, UI redress
SUPPLY-CHAIN-AND-RELEASE.mdЗависимости, CI/CD, подписи релизов
CLOUD-AND-DEPLOYMENT.mdIAM, IaC, контейнеры, serverless

Требования и установка

Для работы нужны: coding-агент с моделью, поддерживающей вызов инструментов и параллельные подагенты, а также Node.js для валидации схемы находок.

Установка — одной командой через Skills CLI:

npx skills add https://github.com/cloudflare/security-audit-skill \
  --skill security-audit

После установки достаточно попросить агента:

security audit this codebase
find security vulnerabilities in ./src

Навык активируется автоматически, когда запрос совпадает с его триггерами — «security audit», «find vulnerabilities», «pen-test the code» и т.д.

ℹ Sandbox обязателен
Для полноценной работы требуется изолированная песочница с отключённой внешней сетью, ограничениями ресурсов и доступом на запись только к выделенным путям. Без этого агент оставляет лиды в статусе needs_validation и не выполняет код цели.

Контекст: от внутреннего харнеса к open source

Корпоративный харнес Cloudflare вырос до уровня, где нужно отслеживать уязвимости поверх межрепозиторных зависимостей, фильтруя тысячи сырых кандидатов до надёжной очереди на исправление. Публикуемый skill — модель-агностичный слой, фокусирующийся на управлении состоянием, устранении ложных срабатываний и координации тriage.

Инструмент решает критическую проблему несогласованных и непроверяемых ревью безопасности, автоматизируя строгий процесс на основе доказательств. Ручные пентесты медленны, дороги и плохо вписываются в быстрые циклы разработки.

Каждый баг, выявленный внутренним харнесом Cloudflare, поставлялся с работающим тест-кейсом и черновиком патча. Команды безопасности систематически обрабатывают отчёты, а продукты компании уже активно защищаются от этих векторов атак.

Репозиторий доступен по лицензии MIT на GitHub. Вопросы и обмен опытом по ИИ-инструментам безопасности: security-ai-research@cloudflare.com.