Запуск frontier-модели без облака — теперь на вашем MacBook

Сальваторе Санфилиппо (antirez) — итальянский разработчик и автор Redis — тихо выпустил написанный с нуля на C inference-движок, который запускает DeepSeek V4 локально и умеет работать с Claude Code. Проект называется DwarfStar и оптимизирован прежде всего под DeepSeek V4 Flash, а на машинах с очень большим объёмом памяти поддерживает и DeepSeek V4 PRO, а также GLM 5.2. Движок написан на C, GPU-бэкенды реализованы на Objective-C (Metal), CUDA и HIP/ROCm.


Что такое DeepSeek V4 Flash и PRO?

DeepSeek V4 — это семейство моделей типа MoE (Mixture-of-Experts): V4 Flash насчитывает 284 млрд параметров (13 млрд активных), а V4 PRO — 1,6 трлн параметров (49 млрд активных), оба с контекстным окном в 1 миллион токенов. Модели вышли 24 апреля 2026 года и распространяются под лицензией MIT.

ℹ Масштаб задачи
DeepSeek V4 Flash в своём «сыром» виде весит около 76 ГБ весовых файлов. DwarfStar умеет запускать его с агрессивным квантованием до 2 бит — и при этом сохранять качество генерации.

Ключевые особенности DwarfStar

Не просто GGUF-загрузчик

DwarfStar — самодостаточный, специализированный под конкретные модели движок. Это не универсальный GGUF-раннер: загрузка модели, рендеринг промптов, вызовы инструментов (tool calls), управление KV-кешем, HTTP-сервер и встроенный агент для программирования — всё реализовано и протестировано вместе как единая система.

DwarfStar содержит нативный coding agent (агент для написания кода), который работает иначе, чем большинство аналогов: инференс управляется изнутри самого агента, без границ socket/API, а сессия представлена KV-кешем на диске.

Поддерживаемые бэкенды

Основная цель — Metal на Mac с 96 ГБ и более (меньшие машины могут использовать SSD-стриминг), NVIDIA CUDA включая мульти-GPU-системы и DGX Spark, а также ROCm на системах Strix Halo, например Framework Desktop.

SSD-стриминг для машин с нехваткой RAM

Когда RAM не хватает для полной модели, режим SSD-стриминга подгружает веса экспертов прямо с локального накопителя во время инференса — это медленнее, но делает запуск доступным.


Производительность на реальном железе

КонфигурацияРезультат
Mac Studio M3 Ultra, 32k ctx138 t/s prefill, 9.56 t/s генерация
8× NVIDIA L40S (мульти-GPU)120 t/s агрегированная генерация, 2000 t/s prefill
RTX PRO 6000 Blackwell 96 ГБ43 t/s генерация (Q2-imatrix)

Первые официальные бенчмарки на Mac Studio M3 Ultra с DeepSeek V4 PRO при контексте 32k показали 138,82 t/s prefill и 9,56 t/s генерации.

На RTX PRO 6000 Blackwell 96 ГБ движок работает достаточно быстро для реальных задач кодинг-агента: даже при контексте 50k токенов скорость генерации при вызове инструментов не опускалась ниже 31 t/s.


Схема работы DwarfStar


graph TD
    A[Пользователь / CLI / HTTP API] --> B[ds4-server]
    B --> C{Тип запроса}
    C -->|Чат / промпт| D[Движок ds4.c]
    C -->|Кодинг-агент| E[Встроенный агент]
    D --> F{Бэкенд}
    F -->|Apple Mac| G[Metal / Objective-C]
    F -->|NVIDIA| H[CUDA]
    F -->|AMD ROCm| I[HIP/ROCm]
    D --> J[KV-кеш RAM / SSD-стриминг]
    E --> D


Квантование: качество без потерь

Асимметричное квантование направлено именно на маршрутизированных экспертов (routed experts) с сохранением критических путей в исходной точности. Только веса routed MoE-экспертов квантуются до 2 бит (IQ2_XXS / Q2_K), тогда как shared experts, проекции и routing-слои остаются нетронутыми.

Варианты загрузки модели

# 96/128 ГБ RAM, imatrix-версия q2
./download_model.sh q2-imatrix

# 96/128 ГБ RAM, смешанный q2+q4
./download_model.sh q2-q4-imatrix

# >= 256 ГБ RAM, imatrix-версия q4
./download_model.sh q4-imatrix

# 512 ГБ RAM — полный PRO q2
./download_model.sh pro-q2-imatrix
💡 Совет по выбору кванта
Для MacBook с 96–128 ГБ оптимален вариант q2-imatrix — наилучший баланс между скоростью и качеством. Если у вас ≥256 ГБ, берите q4-imatrix для заметно лучшего качества генерации.

Tensor Parallelism и распределённый запуск

Antirez опубликовал материал «Distributing LLM inference in DwarfStar» с тремя стратегиями параллелизма вычислений: разбивка слоёв между машинами (layer split), параллелизм по экспертам через Apple RDMA и ensemble.

Это означает, что два MacBook M5 Max или M3 Ultra, соединённые по Thunderbolt/RDMA, могут совместно запускать 4-битный DeepSeek Flash с tensor parallelism, суммируя свою RAM.

⚠ Статус проекта
DwarfStar находится в стадии бета. Перед каждым релизом проводится масштабное QA-тестирование, однако возможны нестабильности. Не используйте в production без собственного тестирования.

Честность об ИИ-ассистентах в разработке

«Этот софт разработан с активной помощью GPT 5.5, 5.6, Claude Fable — при этом люди руководят идеями, тестированием и отладкой. Мы говорим об этом открыто, потому что это повлияло на то, как проект был построен.» — antirez

Такая прозрачность всё ещё редкость для open-source проектов и задаёт важный прецедент в сообществе.


Почему это важно для отрасли

Такой подход — специализированный движок вместо универсального раннера — позволяет тщательнее валидировать качество: от logit-проверки до long-context верификации и интеграции с агентами.

DwarfStar распространяется под лицензией MIT, включает встроенный coding agent, SSD-стриминг, бэкенды Metal/CUDA/ROCm и возможность разделить модель между двумя Mac через Thunderbolt. Фактически это означает, что frontier-модель уровня DeepSeek V4 теперь можно запустить без подписки и без передачи данных в облако — прямо на личном железе.