Что случилось

10 сентября 2026 года компания Cognition — создатель автономного AI-агента Devin — выпустила SWE-2, новую модель для кодинга, которая, по заявлению компании, приближается по качеству к сегодняшним frontier-моделям, при этом обходясь значительно дешевле. Это самая мощная кодинг-модель Cognition на сегодняшний день, и она уже доступна пользователям Devin.

«SWE-2 двигает Pareto-фронтир возможностей и стоимости» — Cognition


Производительность и бенчмарки

Cognition сообщает, что SWE-2 набирает 50,0% на FrontierCode 1.1 Main — собственном бенчмарке компании для оценки того, будут ли pull request’ы, написанные ИИ, приняты живым мейнтейнером.

Показатель 50,0% на FrontierCode — это на один пункт ниже Claude Fable 5.1 (50,9%) и на 3,3 пункта ниже GPT-6 Astra (53,3%), но при этом SWE-2 стоит на 64% дешевле Fable 5.1 и вчетверо дешевле Astra.

ℹ Что такое FrontierCode?
FrontierCode 1.1 Main — это бенчмарк Cognition для реалистичной оценки качества кода. В отличие от SWE-Bench, он проверяет не только функциональность, но и то, ожидает ли агент от модели самостоятельно вывести намерение мейнтейнера из контекста, как это делает живой контрибьютор.

Помимо FrontierCode, на других бенчмарках SWE-2 набирает: DeepSWE 1.1 — 73,0%, Terminal-Bench 2.1 — 92,8%, Terminal-Bench 4.0 — 27,3%.

Слабое место — Terminal-Bench 4.0: показатель 27,3% существенно отстаёт от Fable 5.1 (55,8%) и GPT-6 Astra (57,9%), и именно в долгосрочных агентных задачах разрыв с frontier-моделями пока остаётся ощутимым.

Сравнительная таблица моделей

МодельFrontierCode 1.1DeepSWE 1.1Terminal-Bench 4.0Стоимость vs SWE-2
SWE-250,0%73,0%27,3%— (базовая)
Claude Fable 5.150,9%~70%55,8%+64% дороже
GPT-6 Astra53,3%57,9%~×4 дороже
SWE-1.7 (пред.)~44%+81% дороже

Как устроена модель

SWE-2 построена на базе Kimi K3 — открытой модели от Moonshot AI с 2,8 триллиона параметров, которая уже прошла обширное обучение с подкреплением (RL) для агентного кодинга.

Это продолжение подхода SWE-1.7: вместо обучения фундаментальной модели с нуля Cognition берёт мощную открытую базу и накладывает поверх собственный масштабный RL-тренинг, специализируя модель под реальные задачи разработки внутри Devin.

💡 Ключевое новшество RL
С SWE-2 Cognition впервые масштабировала RL до режима мульти-триллионных параметров. Главное нововведение — алгоритм RL, который тренирует все уровни reasoning-effort (уровни усилий при рассуждении) в одном прогоне, двигая весь фронтир «цена–производительность».

graph TD
    A[Kimi K3 base\n2.8T параметров] --> B[RL post-training\nот Cognition]
    B --> C[SWE-2\nFrontierCode: 50.0%]
    C --> D[Devin Desktop / CLI]
    C --> E[Devin Web / Fusion\n— в процессе роллаута]
    style A fill:#6c63ff,color:#fff
    style C fill:#00b894,color:#fff
    style D fill:#0984e3,color:#fff
    style E fill:#fdcb6e,color:#000


Эффективность: меньше шагов — меньше денег

SWE-2 medium при равном или лучшем результате на FrontierCode 1.1 Main делает на 58% меньше шагов и стоит в среднем на 81% меньше, чем SWE-1.7. Cognition объясняет это более точным исследованием кодовой базы: SWE-2 medium делает первое реальное редактирование кода после медианы в 18 шагов, тогда как у SWE-1.7 этот показатель составлял 48 шагов.

📝 Пример экономии
Cognition указывает стоимость только в относительных цифрах: 64% дешевле Fable 5.1 при равном результате на FrontierCode, вчетверо дешевле GPT-6 Astra при результате на несколько пунктов ниже, и на 81% ниже средняя стоимость по сравнению с SWE-1.7 на том же бенчмарке.

Где доступна и чего нет

SWE-2 доступна в Devin Desktop и Devin CLI с момента выпуска и постепенно выходит на Devin Web и Devin Fusion. При этом Cognition не публиковала веса SWE-2 — скачать модель и запустить локально не получится. В анонсе не упоминается открытый API или отдельный endpoint вне продуктов Devin.

⚠ Важный нюанс
Все приведённые цифры — собственные данные Cognition, которые ожидают независимой проверки. Воспринимайте бенчмарки как отправную точку, а не окончательный вердикт.

Контекст и значение для отрасли

Cognition последовательно строит нишу специализированных кодинг-моделей, которые не гонятся за первым местом в каждом бенчмарке, но предлагают лучшее соотношение цена/качество. Компания делает ставку на то, что будущее AI-кодинга — не просто самая умная модель, а самая быстрая и дешёвая, встроенная прямо в рабочий процесс.

Эта стратегия имеет смысл: Anthropic выпустила Claude Fable 5.1 1 сентября 2026 года, а два дня спустя OpenAI представила GPT-6 Astra — первую модель поколения GPT-6. На фоне гонки за флагманскими позициями SWE-2 метит в другую нишу — массовые, повседневные задачи разработки, где важна цена.

Вместе с результатами производительности Cognition опубликовала данные внутренних оценок надёжности модели: тесты на поведение в ситуациях пропаганды/цензуры и уязвимости в генерируемом коде, проведённые на SWE-2 и пяти других моделях, включая Kimi K3, GLM 5.3, GPT-5.6, Fable 5.1 и Opus 5.

Пока frontier-модели за $10+ за задачу занимают верхушку лидербордов, SWE-2 прокладывает путь для организаций, которым нужен высокий объём качественного кода без пробивания бюджета.