DeepSeek V4 Flash 0731: мощный агент за копейки
DeepSeek выпустил официальную версию V4 Flash 0731: 89% на ARC-AGI-1, агентский рейтинг выше GPT-5.6 Luna — и всё это дешевле конкурентов на 60%.
DeepSeek V4 Flash 0731: официальный релиз с прорывом в агентных задачах
31 июля 2026 года DeepSeek официально выпустил модель DeepSeek V4 Flash 0731 — обновлённую версию своего флагманского «лёгкого» решения. Архитектура осталась прежней, но новое post-training существенно подняло планку: модель набирает 89% на ARC-AGI-1 и обходит сопоставимые по стоимости модели от OpenAI при цене в 60% ниже. Это официальный релиз, который окончательно вытесняет preview-версию.
Что изменилось
DeepSeek V4 Flash 0731 — это официальный релиз DeepSeek V4 Flash, заменяющий preview-версию и обладающий существенно улучшенными агентными возможностями. При этом архитектура и размер модели не изменились — все улучшения получены за счёт повторного post-training, а не нового дизайна.
DeepSeek V4 Flash 0731 — это разреженная mixture-of-experts модель с 13B активными параметрами из 284B общих. Чекпоинт поставляется с модулем спекулятивного декодирования DSpark. Hugging Face сообщает о 304B параметрах в репозитории, включая этот draft-модуль поверх базовых 284B.
Результаты на ARC-AGI
При максимальных усилиях DeepSeek V4 Flash 0731 набирает 89.0% на ARC-AGI-1 Semi-Private при стоимости $0.02 за задачу и 61.4% на ARC-AGI-2 Semi-Private при $0.04 за задачу.
ARC-AGI (Abstraction and Reasoning Corpus) — один из самых сложных тестов на «общий интеллект» для языковых моделей. Результат 89% на первой версии теста — это уровень, при котором модель демонстрирует близкое к человеческому абстрактное мышление в задачах, которые она никогда не видела.
Intelligence Index и сравнение с конкурентами
DeepSeek V4 Flash 0731 набирает 50 баллов в Artificial Analysis Intelligence Index — это на 10 пунктов выше, чем у предыдущего DeepSeek V4 Flash (апрель 2026), и на 6 пунктов выше, чем у DeepSeek V4 Pro.
Модель отстаёт от GPT-5.6 Luna (max, 51) всего на один балл Intelligence Index. При этом даже после снижения цен OpenAI на 80% для GPT-5.6 Luna, стоимость задачи у DeepSeek V4 Flash 0731 через первичный API оказывается примерно на 60% ниже, чем у GPT-5.6 Luna (max) — модели с сопоставимым интеллектом.
«DeepSeek V4 Flash 0731 входит в число лидеров по интеллекту и хорошо оценён по сравнению с другими open-weight моделями схожего размера.»
Агентные задачи: главный прорыв
DeepSeek V4 Flash 0731 достигает рейтинга Elo 1559 на GDPval-AA v2 — оценке, ориентированной на реальные агентные рабочие задачи, по сравнению с 1189 у предыдущего DeepSeek V4 Flash.
После публикации весов это будет второй по величине результат среди open-weight моделей — после Kimi K3 (max, 1687) и впереди GLM-5.2 (max, 1510).
Улучшения в AA-Omniscience обусловлены снижением галлюцинаций, а не ростом точности: DeepSeek V4 Flash 0731 достигает AA-Omniscience Index −16 (+7 к предшественнику). Это улучшение полностью обусловлено снижением частоты галлюцинаций при неизменной общей точности.
Сравнение характеристик
| Параметр | DeepSeek V4 Flash 0731 | DeepSeek V4 Flash (апрель 2026) | GPT-5.6 Luna (max) |
|---|---|---|---|
| Intelligence Index | 50–52 | 40 | 51 |
| ARC-AGI-1 | 89.0% | — | — |
| ARC-AGI-2 | 61.4% | — | — |
| Агентский Elo (GDPval-AA v2) | 1559 | 1189 | — |
| Активные параметры | 13B | 13B | — |
| Всего параметров | 284B | 284B | — |
| Контекстное окно | 1M токенов | 1M токенов | — |
| Цена (input, cache miss) | $0.14/1M | $0.14/1M | выше на ~60% |
| Скорость генерации | ~102 t/s | — | — |
Архитектура и доступность
Модель поддерживает текстовый ввод, выводит текст и имеет контекстное окно в 1M токенов. На стороне API deepseek-v4-flash теперь нативно поддерживает формат Responses API и адаптирован для Codex.
DeepSeek опубликовал DeepSeek-V4-Flash-0731 на Hugging Face и перевёл официальный API V4-Flash в публичную бету 31 июля 2026 года.
DeepSeek V4 Flash 0731 генерирует вывод со скоростью 102.4 токена в секунду через API DeepSeek — значительно выше среднего для open-weight моделей схожего размера (медиана: 62.8 t/s).
graph TD
A[DeepSeek V4 Flash\nапрель 2026\nIndex: 40] -->|re-post-training| B[DeepSeek V4 Flash 0731\nИюль 2026\nIndex: 50–52]
B --> C[ARC-AGI-1: 89%]
B --> D[ARC-AGI-2: 61.4%]
B --> E[Агент Elo: 1559]
B --> F[Скорость: 102 t/s]
B --> G[Цена: $0.14/1M токенов]
Значение для отрасли
Это вписывается в более широкий тренд 2026 года: лаборатории всё чаще рассматривают агентные нагрузки — высокообъёмные, с вызовами инструментов, параллельные — как основной продукт и маршрутизируют их к небольшим моделям, где качество post-training важнее числа параметров.
DeepSeek V4 Flash 0731 превосходит DeepSeek V4 Pro (Preview) на перечисленных бенчмарках, несмотря на значительно меньшее число активных параметров, и в целом конкурентоспособен с сильнейшими проприетарными моделями.