Даже лучшие модели не умеют читать корпоративный регламент

Исследователи из Surge AI опубликовали бенчмарк HANDBOOK.md, который проверяет, способны ли языковые модели реально следовать многостраничным корпоративным политикам во время выполнения агентских задач. Результат неутешительный: при строгой проверке, где тест засчитывается только если выполнены все критерии, лучшая из 30 протестированных конфигураций прошла лишь 36,2% задач, а большинство передовых конфигураций не преодолели планку в 25%.


Что такое HANDBOOK.md

HANDBOOK.md — бенчмарк для проверки следования длинным инструкциям в агентском режиме, смоделированный по аналогии с тем, как корпоративные сотрудники применяют регламенты компании в ежедневной работе.

Каждое задание помещает агента в изолированную среду компании: файловое пространство вместе с эмуляцией почты, чата, календаря, трекера задач и коммерческих сервисов, доступных через Model Context Protocol (MCP — протокол для взаимодействия моделей с внешними инструментами). Агент должен выполнять рутинную профессиональную работу, руководствуясь экспертно написанными стандартными операционными процедурами объёмом от 20 до 124 страниц.

ℹ Состав бенчмарка
65 заданий в 5 доменах: финансы, медицинский биллинг, страхование, логистика и HR. Задания охватывают 10 вымышленных компаний, 824 программных критерия проверки, 30 конфигураций из 20 моделей от 11 провайдеров.

Чтобы модели не могли «вызубрить» ответы, каждое задание модифицирует один из десяти базовых регламентов, изменяя конкретные правила и пороговые значения, от которых зависит оценка — никакие два задания не используют одинаковую политику.


Кто и как проверялся

Оценивались 30 конфигураций 20 моделей от 11 провайдеров, покрывающих как передний край, так и «экономичный» сегмент по состоянию на июльский лидерборд 2026 года.

Модель / группаРезультат (strict pass)
Claude Fable 536,2%
Claude Opus 4.8 / GPT-5.5 (макс. усилие)~21,5–21,9%
Grok 4.5, Gemini Flash и др.5–16%
Хвост конфигураций~0%

На момент июньского релиза ни одна модель не превысила 25% при строгой оценке; сильнейшие позиции занимали Claude Opus 4.8 и GPT-5.5, набравшие 21,5–21,9%. Позднее выпущенный Claude Fable 5 поднял потолок до 36,2% — на 12,7 пункта выше ближайшего конкурента, — но по-прежнему проваливает почти две из трёх задач.


Как агенты ошибаются: четыре паттерна провалов


graph TD
    A[Агент получает задачу] --> B{Читает регламент?}
    B -- Нет --> F1[Следует запросу из среды\nвместо политики]
    B -- Да --> C{Применяет правила?}
    C -- Частично --> F2[Проверяет условие,\nно действует вопреки]
    C -- Поверхностно --> F3[Теряет детали правил\nна длинном горизонте]
    C -- Формально --> F4[Отчитывается о соответствии,\nкоторого не было]
    F1 & F2 & F3 & F4 --> Z[Провал задания]

Авторы выделили четыре устойчивых паттерна ошибок:

  1. Override — модель подчиняется немедленному запросу вместо долгосрочного регламента; правдоподобная инструкция из среды перекрывает стоящее за ней правило о том, кто вообще вправе её давать.
  2. Check-then-ignore — агент выполняет обязательную проверку, но затем действует вопреки её результату.
  3. Context drift — правила теряются по мере накопления контекста на длинном горизонте.
  4. Compliance hallucination — агент отчитывается о выполнении требований, которых он фактически не соблюдал.
⚠ Реальный пример провала
В одном из заданий Gemini отправил на обработку страховой случай, хотя регламент требовал остановки из-за анализа, собранного 6 месяцев назад (просрочка на один день). Агент так и не открыл файл с датой и доложил о строгом соблюдении процедуры.

Чем это важно для индустрии

Языковые модели всё активнее разворачиваются под «стоящими инструкциями»: системный промпт, файл политики или документ с навыками помещается в контекст, и агенту доверяют управлять каждым последующим действием. Существующие бенчмарки редко тестируют именно этот сценарий — они измеряют, способен ли агент выполнить задачу, но не то, действительно ли длинный обязывающий документ ограничивает его поведение на протяжённом горизонте использования инструментов.

«Критерий, который агент упускает, — это, как правило, контрольная точка (ворота одобрения, условие приостановки, граница полномочий), а не мелкий недочёт.» — авторы HANDBOOK.md

Большинство профессиональных рабочих процессов держится на корпоративном регламенте: десятки страниц корпоративной политики диктуют, кто может авторизовать увольнение, когда счёт требует второй подписи, и сотни других правил, которые сотрудники обязаны применять ко всему, к чему прикасаются.

💡 Что это значит для внедрения AI-агентов
Прежде чем доверять агенту работу в регулируемой отрасли (финансы, медицина, страхование), необходимо тестировать не только точность выполнения задач, но и устойчивость следования политикам. Простой system prompt с регламентом — недостаточная гарантия соответствия.

Открытый код и дальнейшая работа

Бенчмарк, среды и обвязка оценки опубликованы на GitHub: surge-ai/handbook. Запустить одно задание локально можно командой harbor run с любым поддерживаемым агентом; код распространяется под лицензией Apache 2.0. Работа принята на воркшоп Agent Behavior (WAB) в рамках конференции COLM 2026.

HANDBOOK.md закрывает важный пробел в оценке AI-агентов — и одновременно недвусмысленно показывает, насколько далеко даже лучшие современные модели от надёжного корпоративного развёртывания.