Лид

Artificial Analysis обновил свой Intelligence Index до версии v4.1.1 — и главной сенсацией стал Qwen3.8 Max от Alibaba. Модель набрала 56 баллов в Artificial Analysis Intelligence Index, что значительно выше среднего среди сопоставимых моделей (медиана: 32). Этот результат ставит Qwen3.8 Max на один уровень с Claude Opus 4.8 (max) и выше любой модели от Google, Meta и xAI.


Что такое Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index — это сводная метрика для оценки интеллекта моделей и отслеживания прогресса ИИ. Версия v4.1.1 включает 9 независимых оценок:

БенчмаркВес
GDPval-AA v220%
Terminal-Bench v2.116%
τ³-Bench Banking14%
Humanity’s Last Exam (HLE)12%
AA-Omniscience Accuracy8%
SciCode8%
GPQA Diamond6%
AA-LCR6%
CritPt6%
ℹ Что измеряет индекс
v4.1 сместил акцент в сторону агентных задач (agentic workloads): модели оцениваются по способности автономно выполнять многошаговые задачи, а не просто отвечать на вопросы.

Почему Qwen3.8 Max вырвался вперёд

Рост показателей объясняется не только улучшением базовых способностей модели — главная причина в изменении стратегии работы.

Qwen3.8 Max в среднем делает 64 хода на агентном бенчмарке GDPval-AA против 14 ходов у предшественника Qwen3.7 Max. Потребление входных токенов на той же оценке выросло примерно в 15 раз, а выходных — на 45% до 145 млн. Модель просто делает больше работы за задачу, и этот дополнительный «труд» напрямую отражается в итоговом балле.

Улучшения не ограничиваются агентными задачами: Terminal-Bench v2.1 вырос на 6 пунктов, CritPt — на 7, SciCode — на 4, HLE — на 3.

⚠ Слабое место: галлюцинации
AA-Omniscience упал на 10 пунктов — коэффициент галлюцинаций вырос с 23% до 40%. Точность при этом осталась на прежнем уровне (~31%): модель стала отвечать на вопросы, которые раньше отклоняла, и ошибаться значительно чаще.

Позиция в общем рейтинге


graph TD
    A["🥇 Claude Opus 5
~60 баллов"] --> B["🥈 Claude Fable 5
~59 баллов"] B --> C["🥉 GPT-5.6 Sol
~58 баллов"] C --> D["4️⃣ Kimi K3
выше 56"] D --> E["5️⃣ Qwen3.8 Max
56 баллов"] E --> F["Claude Opus 4.8 Max
~56 баллов"] style E fill:#ff6b35,color:#fff

Выше Qwen3.8 Max на момент публикации находятся только топовые модели Anthropic и OpenAI, а также Kimi K3 от Moonshot AI.


Стоимость: дешевле по токенам, но дороже по задаче

Модель стоит $2,00 за млн входных токенов и $6,00 за млн выходных через API Alibaba Cloud — это дешевле, чем Qwen3.7 Max ($2,50/$7,50). Но реальная картина иная:

Из-за резко возросшего числа ходов Qwen3.8 Max обходится в $1,14 за задачу Intelligence Index — более чем вдвое дороже Qwen3.7 Max ($0,53) и в 1,3 раза дороже Kimi K3 max ($0,86).

МодельСтоимость за задачу
Claude Opus 5 max~$2,03
Qwen3.8 Max$1,14
Kimi K3 max$0,86
GLM-5.2 max$0,57
Qwen3.7 Max$0,53
💡 Вывод по соотношению цена/качество
Если вам нужна топовая агентная производительность без бюджета Claude Opus 5, Qwen3.8 Max — реалистичный выбор. Но учитывайте: низкая цена токена не равна низкой цене задачи.

Агентные возможности и позиционирование

Alibaba позиционирует Qwen3.8 Max как автономного «коллегу», способного выполнять проекты длительностью более 10 дней, воспроизводить исследовательские статьи с тысячами строк кода и итеративно оптимизировать чип-дизайн.

По данным самой Alibaba, Qwen3.8 Max набирает 86,1 балла на бенчмарке OSWorld-Verified (оценка управления ОС и приложениями), опережая GPT-5.6 Sol Max (83,2) и Fable 5 (85,0).

Китайский open-weight фронтир теперь напрямую конкурирует с лучшими западными закрытыми моделями в сфере кодирования, агентных workflow и мультимодальных задач.

Qwen3.8 Max — наиболее мощная модель серии Qwen на сегодняшний день. Она масштабируется до 2,4 триллиона параметров и обеспечивает улучшения в кодировании, реальных рабочих задачах, долгосрочных задачах и мультимодальных агентах.


Контекст: куда движется индустрия

Всё заметнее тренд: frontier-модели всё активнее конкурируют не по качеству ответа на отдельный промпт, а по способности завершать целые рабочие процессы. Artificial Analysis учёл это в методологии v4.1, сделав агентные задачи центром оценки.

Релиз Qwen3.8 Max — часть более широкой тенденции: многие наблюдатели расценивают его как свидетельство того, что китайский open-weight фронтир теперь напрямую конкурирует с лучшими западными закрытыми моделями в кодировании, агентных workflow и мультимодальных задачах.

📝 Как попробовать
Qwen3.8 Max доступен через API у одного провайдера — Alibaba Cloud. Актуальные цены и сравнение с другими моделями можно найти на artificialanalysis.ai.