DwarfStar: локальный движок для DeepSeek V4 Flash и PRO
Сальваторе Санфилиппо выпустил DwarfStar — нативный inference-движок для запуска DeepSeek V4 Flash и PRO прямо на Mac, DGX Spark или ROCm-системах.
Запуск frontier-модели без облака — теперь на вашем MacBook
Сальваторе Санфилиппо (antirez) — итальянский разработчик и автор Redis — тихо выпустил написанный с нуля на C inference-движок, который запускает DeepSeek V4 локально и умеет работать с Claude Code. Проект называется DwarfStar и оптимизирован прежде всего под DeepSeek V4 Flash, а на машинах с очень большим объёмом памяти поддерживает и DeepSeek V4 PRO, а также GLM 5.2. Движок написан на C, GPU-бэкенды реализованы на Objective-C (Metal), CUDA и HIP/ROCm.
Что такое DeepSeek V4 Flash и PRO?
DeepSeek V4 — это семейство моделей типа MoE (Mixture-of-Experts): V4 Flash насчитывает 284 млрд параметров (13 млрд активных), а V4 PRO — 1,6 трлн параметров (49 млрд активных), оба с контекстным окном в 1 миллион токенов. Модели вышли 24 апреля 2026 года и распространяются под лицензией MIT.
Ключевые особенности DwarfStar
Не просто GGUF-загрузчик
DwarfStar — самодостаточный, специализированный под конкретные модели движок. Это не универсальный GGUF-раннер: загрузка модели, рендеринг промптов, вызовы инструментов (tool calls), управление KV-кешем, HTTP-сервер и встроенный агент для программирования — всё реализовано и протестировано вместе как единая система.
DwarfStar содержит нативный coding agent (агент для написания кода), который работает иначе, чем большинство аналогов: инференс управляется изнутри самого агента, без границ socket/API, а сессия представлена KV-кешем на диске.
Поддерживаемые бэкенды
Основная цель — Metal на Mac с 96 ГБ и более (меньшие машины могут использовать SSD-стриминг), NVIDIA CUDA включая мульти-GPU-системы и DGX Spark, а также ROCm на системах Strix Halo, например Framework Desktop.
SSD-стриминг для машин с нехваткой RAM
Когда RAM не хватает для полной модели, режим SSD-стриминга подгружает веса экспертов прямо с локального накопителя во время инференса — это медленнее, но делает запуск доступным.
Производительность на реальном железе
| Конфигурация | Результат |
|---|---|
| Mac Studio M3 Ultra, 32k ctx | 138 t/s prefill, 9.56 t/s генерация |
| 8× NVIDIA L40S (мульти-GPU) | 120 t/s агрегированная генерация, 2000 t/s prefill |
| RTX PRO 6000 Blackwell 96 ГБ | 43 t/s генерация (Q2-imatrix) |
Первые официальные бенчмарки на Mac Studio M3 Ultra с DeepSeek V4 PRO при контексте 32k показали 138,82 t/s prefill и 9,56 t/s генерации.
На RTX PRO 6000 Blackwell 96 ГБ движок работает достаточно быстро для реальных задач кодинг-агента: даже при контексте 50k токенов скорость генерации при вызове инструментов не опускалась ниже 31 t/s.
Схема работы DwarfStar
graph TD
A[Пользователь / CLI / HTTP API] --> B[ds4-server]
B --> C{Тип запроса}
C -->|Чат / промпт| D[Движок ds4.c]
C -->|Кодинг-агент| E[Встроенный агент]
D --> F{Бэкенд}
F -->|Apple Mac| G[Metal / Objective-C]
F -->|NVIDIA| H[CUDA]
F -->|AMD ROCm| I[HIP/ROCm]
D --> J[KV-кеш RAM / SSD-стриминг]
E --> D
Квантование: качество без потерь
Асимметричное квантование направлено именно на маршрутизированных экспертов (routed experts) с сохранением критических путей в исходной точности. Только веса routed MoE-экспертов квантуются до 2 бит (IQ2_XXS / Q2_K), тогда как shared experts, проекции и routing-слои остаются нетронутыми.
Варианты загрузки модели
# 96/128 ГБ RAM, imatrix-версия q2
./download_model.sh q2-imatrix
# 96/128 ГБ RAM, смешанный q2+q4
./download_model.sh q2-q4-imatrix
# >= 256 ГБ RAM, imatrix-версия q4
./download_model.sh q4-imatrix
# 512 ГБ RAM — полный PRO q2
./download_model.sh pro-q2-imatrix
q2-imatrix — наилучший баланс между скоростью и качеством. Если у вас ≥256 ГБ, берите q4-imatrix для заметно лучшего качества генерации.Tensor Parallelism и распределённый запуск
Antirez опубликовал материал «Distributing LLM inference in DwarfStar» с тремя стратегиями параллелизма вычислений: разбивка слоёв между машинами (layer split), параллелизм по экспертам через Apple RDMA и ensemble.
Это означает, что два MacBook M5 Max или M3 Ultra, соединённые по Thunderbolt/RDMA, могут совместно запускать 4-битный DeepSeek Flash с tensor parallelism, суммируя свою RAM.
Честность об ИИ-ассистентах в разработке
«Этот софт разработан с активной помощью GPT 5.5, 5.6, Claude Fable — при этом люди руководят идеями, тестированием и отладкой. Мы говорим об этом открыто, потому что это повлияло на то, как проект был построен.» — antirez
Такая прозрачность всё ещё редкость для open-source проектов и задаёт важный прецедент в сообществе.
Почему это важно для отрасли
Такой подход — специализированный движок вместо универсального раннера — позволяет тщательнее валидировать качество: от logit-проверки до long-context верификации и интеграции с агентами.
DwarfStar распространяется под лицензией MIT, включает встроенный coding agent, SSD-стриминг, бэкенды Metal/CUDA/ROCm и возможность разделить модель между двумя Mac через Thunderbolt. Фактически это означает, что frontier-модель уровня DeepSeek V4 теперь можно запустить без подписки и без передачи данных в облако — прямо на личном железе.