Qwen3.8 Max возглавил Agentic Index от Artificial Analysis
Модель Alibaba набрала 56 баллов в Intelligence Index v4.1.1 и обошла Google, Meta и xAI, уступив лишь Anthropic, OpenAI и Kimi.
Лид
Artificial Analysis обновил свой Intelligence Index до версии v4.1.1 — и главной сенсацией стал Qwen3.8 Max от Alibaba. Модель набрала 56 баллов в Artificial Analysis Intelligence Index, что значительно выше среднего среди сопоставимых моделей (медиана: 32). Этот результат ставит Qwen3.8 Max на один уровень с Claude Opus 4.8 (max) и выше любой модели от Google, Meta и xAI.
Что такое Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index — это сводная метрика для оценки интеллекта моделей и отслеживания прогресса ИИ. Версия v4.1.1 включает 9 независимых оценок:
| Бенчмарк | Вес |
|---|---|
| GDPval-AA v2 | 20% |
| Terminal-Bench v2.1 | 16% |
| τ³-Bench Banking | 14% |
| Humanity’s Last Exam (HLE) | 12% |
| AA-Omniscience Accuracy | 8% |
| SciCode | 8% |
| GPQA Diamond | 6% |
| AA-LCR | 6% |
| CritPt | 6% |
Почему Qwen3.8 Max вырвался вперёд
Рост показателей объясняется не только улучшением базовых способностей модели — главная причина в изменении стратегии работы.
Qwen3.8 Max в среднем делает 64 хода на агентном бенчмарке GDPval-AA против 14 ходов у предшественника Qwen3.7 Max. Потребление входных токенов на той же оценке выросло примерно в 15 раз, а выходных — на 45% до 145 млн. Модель просто делает больше работы за задачу, и этот дополнительный «труд» напрямую отражается в итоговом балле.
Улучшения не ограничиваются агентными задачами: Terminal-Bench v2.1 вырос на 6 пунктов, CritPt — на 7, SciCode — на 4, HLE — на 3.
Позиция в общем рейтинге
graph TD
A["🥇 Claude Opus 5
~60 баллов"] --> B["🥈 Claude Fable 5
~59 баллов"]
B --> C["🥉 GPT-5.6 Sol
~58 баллов"]
C --> D["4️⃣ Kimi K3
выше 56"]
D --> E["5️⃣ Qwen3.8 Max
56 баллов"]
E --> F["Claude Opus 4.8 Max
~56 баллов"]
style E fill:#ff6b35,color:#fff
Выше Qwen3.8 Max на момент публикации находятся только топовые модели Anthropic и OpenAI, а также Kimi K3 от Moonshot AI.
Стоимость: дешевле по токенам, но дороже по задаче
Модель стоит $2,00 за млн входных токенов и $6,00 за млн выходных через API Alibaba Cloud — это дешевле, чем Qwen3.7 Max ($2,50/$7,50). Но реальная картина иная:
Из-за резко возросшего числа ходов Qwen3.8 Max обходится в $1,14 за задачу Intelligence Index — более чем вдвое дороже Qwen3.7 Max ($0,53) и в 1,3 раза дороже Kimi K3 max ($0,86).
| Модель | Стоимость за задачу |
|---|---|
| Claude Opus 5 max | ~$2,03 |
| Qwen3.8 Max | $1,14 |
| Kimi K3 max | $0,86 |
| GLM-5.2 max | $0,57 |
| Qwen3.7 Max | $0,53 |
Агентные возможности и позиционирование
Alibaba позиционирует Qwen3.8 Max как автономного «коллегу», способного выполнять проекты длительностью более 10 дней, воспроизводить исследовательские статьи с тысячами строк кода и итеративно оптимизировать чип-дизайн.
По данным самой Alibaba, Qwen3.8 Max набирает 86,1 балла на бенчмарке OSWorld-Verified (оценка управления ОС и приложениями), опережая GPT-5.6 Sol Max (83,2) и Fable 5 (85,0).
Китайский open-weight фронтир теперь напрямую конкурирует с лучшими западными закрытыми моделями в сфере кодирования, агентных workflow и мультимодальных задач.
Qwen3.8 Max — наиболее мощная модель серии Qwen на сегодняшний день. Она масштабируется до 2,4 триллиона параметров и обеспечивает улучшения в кодировании, реальных рабочих задачах, долгосрочных задачах и мультимодальных агентах.
Контекст: куда движется индустрия
Всё заметнее тренд: frontier-модели всё активнее конкурируют не по качеству ответа на отдельный промпт, а по способности завершать целые рабочие процессы. Artificial Analysis учёл это в методологии v4.1, сделав агентные задачи центром оценки.
Релиз Qwen3.8 Max — часть более широкой тенденции: многие наблюдатели расценивают его как свидетельство того, что китайский open-weight фронтир теперь напрямую конкурирует с лучшими западными закрытыми моделями в кодировании, агентных workflow и мультимодальных задачах.