Cognition выпустила SWE-2: почти как Fable 5.1, но дешевле
Cognition представила SWE-2 — новую модель для автономного кодинга, которая вплотную приближается к Fable 5.1 и GPT-6 Astra, стоя при этом в разы дешевле.
Что случилось
10 сентября 2026 года компания Cognition — создатель автономного AI-агента Devin — выпустила SWE-2, новую модель для кодинга, которая, по заявлению компании, приближается по качеству к сегодняшним frontier-моделям, при этом обходясь значительно дешевле. Это самая мощная кодинг-модель Cognition на сегодняшний день, и она уже доступна пользователям Devin.
«SWE-2 двигает Pareto-фронтир возможностей и стоимости» — Cognition
Производительность и бенчмарки
Cognition сообщает, что SWE-2 набирает 50,0% на FrontierCode 1.1 Main — собственном бенчмарке компании для оценки того, будут ли pull request’ы, написанные ИИ, приняты живым мейнтейнером.
Показатель 50,0% на FrontierCode — это на один пункт ниже Claude Fable 5.1 (50,9%) и на 3,3 пункта ниже GPT-6 Astra (53,3%), но при этом SWE-2 стоит на 64% дешевле Fable 5.1 и вчетверо дешевле Astra.
Помимо FrontierCode, на других бенчмарках SWE-2 набирает: DeepSWE 1.1 — 73,0%, Terminal-Bench 2.1 — 92,8%, Terminal-Bench 4.0 — 27,3%.
Слабое место — Terminal-Bench 4.0: показатель 27,3% существенно отстаёт от Fable 5.1 (55,8%) и GPT-6 Astra (57,9%), и именно в долгосрочных агентных задачах разрыв с frontier-моделями пока остаётся ощутимым.
Сравнительная таблица моделей
| Модель | FrontierCode 1.1 | DeepSWE 1.1 | Terminal-Bench 4.0 | Стоимость vs SWE-2 |
|---|---|---|---|---|
| SWE-2 | 50,0% | 73,0% | 27,3% | — (базовая) |
| Claude Fable 5.1 | 50,9% | ~70% | 55,8% | +64% дороже |
| GPT-6 Astra | 53,3% | — | 57,9% | ~×4 дороже |
| SWE-1.7 (пред.) | ~44% | — | — | +81% дороже |
Как устроена модель
SWE-2 построена на базе Kimi K3 — открытой модели от Moonshot AI с 2,8 триллиона параметров, которая уже прошла обширное обучение с подкреплением (RL) для агентного кодинга.
Это продолжение подхода SWE-1.7: вместо обучения фундаментальной модели с нуля Cognition берёт мощную открытую базу и накладывает поверх собственный масштабный RL-тренинг, специализируя модель под реальные задачи разработки внутри Devin.
graph TD
A[Kimi K3 base\n2.8T параметров] --> B[RL post-training\nот Cognition]
B --> C[SWE-2\nFrontierCode: 50.0%]
C --> D[Devin Desktop / CLI]
C --> E[Devin Web / Fusion\n— в процессе роллаута]
style A fill:#6c63ff,color:#fff
style C fill:#00b894,color:#fff
style D fill:#0984e3,color:#fff
style E fill:#fdcb6e,color:#000
Эффективность: меньше шагов — меньше денег
SWE-2 medium при равном или лучшем результате на FrontierCode 1.1 Main делает на 58% меньше шагов и стоит в среднем на 81% меньше, чем SWE-1.7. Cognition объясняет это более точным исследованием кодовой базы: SWE-2 medium делает первое реальное редактирование кода после медианы в 18 шагов, тогда как у SWE-1.7 этот показатель составлял 48 шагов.
Где доступна и чего нет
SWE-2 доступна в Devin Desktop и Devin CLI с момента выпуска и постепенно выходит на Devin Web и Devin Fusion. При этом Cognition не публиковала веса SWE-2 — скачать модель и запустить локально не получится. В анонсе не упоминается открытый API или отдельный endpoint вне продуктов Devin.
Контекст и значение для отрасли
Cognition последовательно строит нишу специализированных кодинг-моделей, которые не гонятся за первым местом в каждом бенчмарке, но предлагают лучшее соотношение цена/качество. Компания делает ставку на то, что будущее AI-кодинга — не просто самая умная модель, а самая быстрая и дешёвая, встроенная прямо в рабочий процесс.
Эта стратегия имеет смысл: Anthropic выпустила Claude Fable 5.1 1 сентября 2026 года, а два дня спустя OpenAI представила GPT-6 Astra — первую модель поколения GPT-6. На фоне гонки за флагманскими позициями SWE-2 метит в другую нишу — массовые, повседневные задачи разработки, где важна цена.
Вместе с результатами производительности Cognition опубликовала данные внутренних оценок надёжности модели: тесты на поведение в ситуациях пропаганды/цензуры и уязвимости в генерируемом коде, проведённые на SWE-2 и пяти других моделях, включая Kimi K3, GLM 5.3, GPT-5.6, Fable 5.1 и Opus 5.
Пока frontier-модели за $10+ за задачу занимают верхушку лидербордов, SWE-2 прокладывает путь для организаций, которым нужен высокий объём качественного кода без пробивания бюджета.