Введение: 26 миллиардов параметров в кармане

Представьте: вы открываете MacBook Air с базовыми 8 ГБ памяти — и запускаете языковую модель с 26 миллиардами параметров. Без облака, без подписки, без GPU за $5000. Именно это стало реальностью благодаря проекту TurboFieldfare — специализированному движку для инференса, появившемуся на Hacker News и мгновенно привлёкшему внимание разработчиков.

Автор собрал специализированный движок для запуска 4-bit Gemma 4 26B-A4B-IT на любом Mac с чипом M-серии, используя около 2 ГБ оперативной памяти. Это звучит почти невозможно — ведь стандартный 4-bit вариант модели занимает 14–18 ГБ. Как это работает и почему это важно — разбираемся в этой статье.


Что такое Gemma 4 26B-A4B и почему она особенная

Gemma 4 вышла в апреле 2026 года как свободная и открытая версия серии. Она доступна в четырёх размерах: Effective 2B (E2B), Effective 4B (E4B), 26B Mixture of Experts (MoE) и 31B Dense.

Модель 26B-A4B — особый случай. Аббревиатура A4B означает «4B активных параметров». Модель 26B A4B использует архитектуру Mixture of Experts (MoE): при обработке каждого токена активируется только около 4 миллиардов параметров — именно поэтому она работает со скоростью, сопоставимой с моделью на 4B.

Но есть ключевой нюанс: все 26 миллиардов параметров должны находиться в памяти постоянно, потому что маршрутизатор (router) должен мгновенно обращаться к каждому эксперту, чтобы решить, какие из них активировать. Так что 26B A4B работает как маленькая модель, но загружается как большая.

Именно этот парадокс и решает TurboFieldfare — радикально новым способом.

ℹ Архитектурный факт
Gemma 4 поддерживает мультимодальный ввод (текст, изображения, видео), гибридный механизм внимания с чередованием локального скользящего и глобального attention, а также более 140 языков и контекст до 256K токенов.

TurboFieldfare: принцип «потоковой загрузки экспертов»

Движок называется TurboFieldfare и написан на Swift и Metal. Его автор — Андрей Михайлов, iOS- и Metal-инженер. Ключевая идея проекта переворачивает традиционный подход к инференсу с ног на голову.

Как работает обычный подход

При стандартном запуске (через Ollama или llama.cpp) вся модель загружается в оперативную память целиком. Для 4-bit версии 26B-A4B это требует 14–18 ГБ. При работе через Ollama модель 26B показывает около 2 токенов/с с использованием swap-памяти. Это медленно и требует много RAM.

Революционный подход TurboFieldfare

TurboFieldfare запускает инструктивную версию Gemma 4 26B-A4B, не загружая всю модель 14,3 ГБ в память. Движок держит в памяти только общее ядро размером 1,35 ГБ и KV-кеш в FP16, а затем потоково подгружает с SSD только те эксперты, которые нужны для каждого токена. Именно это позволяет запускать модель на Mac с 8 ГБ RAM.


graph TD
    A[Запрос пользователя] --> B[Токенизатор Swift]
    B --> C[Маршрутизатор MoE]
    C --> D{Какие эксперты нужны?}
    D --> E[Ядро 1.35 ГБ в RAM]
    D --> F[Эксперты на SSD 14.3 ГБ]
    F --> G[Потоковая подгрузка нужных экспертов]
    E --> H[Metal GPU Kernels]
    G --> H
    H --> I[Сгенерированный токен]
    I --> B

Среда выполнения, потоковый установщик, CLI и нативное приложение для Mac написаны на Swift и Metal. TurboFieldfare — модель-специфичный движок, а не обёртка вокруг MLX или llama.cpp.

Предзаполнение промпта (prefill) использует чанки до 128 токенов, чтобы один загруженный эксперт мог обслужить несколько строк. Генерация повторяет цикл маршрутизированных слоёв по одному токену за раз.

💡 Почему SSD справляется
Apple Silicon Mac оснащён одним из самых быстрых NVMe-накопителей среди потребительских устройств. Технология унифицированной памяти и быстрый SSD создают условия, при которых потоковая подгрузка весов модели становится реальной альтернативой хранению всего в RAM.

Технические детали: Metal, Swift и кастомные ядра

TurboFieldfare — не просто «обёртка»: это полностью самописный стек.

Движок использует 4-bit MLX аффинное эмбеддинг, attention, shared-expert и routed-expert веса с 8-bit маршрутизатором, кастомные Metal-ядра для квантизованного GEMV, attention, MoE, нормализации, RoPE, сэмплинга и production-слияний, а также SSD-backed потоковую загрузку routed-экспертов с ограниченным кешем.

Архив экспериментов содержит 103 измеренных результата по ядрам, кешированию, I/O, prefill и decode.

Архитектурно система разбита на три фазы обработки каждого слоя:

  • cb1 — загрузка и подготовка данных
  • io — обращение к SSD за нужными экспертами
  • cb2 — выполнение вычислений на GPU через Metal

Это позволяет перекрывать I/O и вычисления, минимизируя простои.

Формат хранения весов .gturbo

Установщик применяет то же правило ограниченной памяти: он перепаковывает удалённые диапазоны напрямую в формат .gturbo, не создавая промежуточных полных шардов или тензоров. Это означает, что даже загрузка весов с Hugging Face происходит без пикового потребления памяти.

⚠ Текущие ограничения
Текущая область применения — только текстовый инференс с фиксированного чекпоинта Gemma 4 26B-A4B на Mac с Apple Silicon, имеющем не менее 8 ГБ RAM. Мультимодальность (изображения, видео) в текущей версии не поддерживается. Среди планов — сборка приложений для iPhone и iPad, а также более широкое бенчмаркирование.

Сравнение: TurboFieldfare vs стандартные подходы

Давайте честно сравним TurboFieldfare с альтернативными способами запуска Gemma 4 26B на Mac.

ПараметрTurboFieldfareOllama (llama.cpp)MLX (Unsloth)
Минимум RAM для запуска8 ГБ16–18 ГБ16 ГБ
Потребление RAM в работе~2 ГБ14–18 ГБ~16 ГБ
Хранение весовSSD (14.3 ГБ)RAMRAM
Технологический стекSwift + Metal (нативный)C++ + MetalPython + MLX
Мультимодальность❌ (только текст)
ЛицензияApache 2.0MITApache 2.0
Зрелость проектаРанняя / экспериментальнаяЗрелыйЗрелый

«Это может быть не самый практичный проект, но я собрал его с любимыми инструментами — Metal — в любимой области, on-device ML inference.» — Андрей Михайлов, автор TurboFieldfare

Стандартный 4-bit запуск через Ollama требует, чтобы вся модель помещалась в оперативную память. Благодаря Quantization-Aware Training (QAT) Google DeepMind стало возможным запускать модели вроде Gemma 4 26B-A4B локально на потребительских GPU с 16 ГБ RAM. TurboFieldfare идёт ещё дальше, опускаясь до 8 ГБ за счёт SSD-стриминга.


Как установить и запустить TurboFieldfare

Проект распространяется как открытый исходный код под лицензией Apache 2.0. Требования: Mac с чипом Apple M-серии и минимум 8 ГБ оперативной памяти.

Шаг 1: Клонирование и сборка

git clone https://github.com/drumih/turbo-fieldfare.git
cd turbo-fieldfare
swift build -c release
.build/release/TurboFieldfareMac

При первом запуске Swift Package Manager скачивает и собирает необходимые Swift-пакеты для токенизатора. Полная release-сборка включает foreground Mac-приложение и исполняемый файл decode-service.

Шаг 2: Загрузка весов модели

Веса модели не включены в репозиторий. Установщик скачивает их отдельно с закреплённого чекпоинта на Hugging Face, и веса остаются под действием условий их исходной лицензии.

Шаг 3: Запуск инференса

После установки доступны два режима работы:

  • CLI — текстовый интерфейс для быстрого тестирования
  • Нативное Mac-приложение — оконный интерфейс с поддержкой macOS
# Запуск через CLI
.build/release/TurboFieldfareMac --prompt "Объясни принцип работы трансформеров"
📝 Пример использования
TurboFieldfare особенно удобен для разработчиков с базовыми MacBook Air (8–16 ГБ), которые хотят тестировать большие модели локально — без замедления системы и без переплаты за облачный API. Идеально для: прототипирования RAG-систем, тестирования промптов, офлайн-разработки.

Почему это важно для экосистемы on-device AI

TurboFieldfare — это не просто инженерная демонстрация. Это часть большого тренда на демократизацию мощных языковых моделей.

Разрыв между «запустить» и «комфортно запустить»

Модели Mixture of Experts активируют только часть параметров при инференсе, что позволяет достигать значительно более высоких токенов/с по сравнению с плотными моделями аналогичного общего размера. Однако MoE-модели требуют значительно больше VRAM для хранения всех неактивных экспертов, что создаёт сложный компромисс между ёмкостью памяти и скоростью генерации.

TurboFieldfare разрубает этот гордиев узел, вынося неактивные эксперты на SSD. Это доказывает, что для MoE-моделей узкое место инференса смещается с «могу ли я поместить веса в память» на «достаточно ли быстро хранилище подаёт веса».

QAT как фундамент

Важно понимать, что TurboFieldfare работает с 4-bit версией модели. Gemma 4 оптимизирована с помощью Quantization-Aware Training (QAT) — это позволяет сохранить качество, близкое к bfloat16, при значительном снижении требований к памяти. 4-bit формат обеспечивает примерно 72% экономии памяти при почти исходной производительности.

Дорожная карта: iPhone и iPad

Среди следующих шагов автора — сборка приложений для iPhone и iPad с измерением скорости инференса и потребления памяти на мобильном железе, а также бенчмаркирование на большем числе Mac с Apple Silicon, включая базовый Mac mini M4 с 16 ГБ и другие модели с 8 ГБ.


Заключение

TurboFieldfare — это элегантное инженерное решение, которое бросает вызов привычным представлениям о том, что нужно для запуска большой языковой модели. Вместо того чтобы требовать всё больше RAM, проект переосмысляет саму архитектуру хранения: держать в памяти только «живую» часть модели, а остальное потоково подтягивать с быстрого SSD.

Ключевые выводы:

  • MoE-архитектура Gemma 4 26B-A4B — идеальный кандидат для SSD-стриминга: в каждый момент активно лишь ~4B из 26B параметров
  • Apple Silicon с его быстрым NVMe создаёт уникальные условия для on-device инференса крупных моделей
  • TurboFieldfare — нативный Swift+Metal движок, не зависящий от MLX или llama.cpp, с 103 задокументированными экспериментами
  • Проект открывает путь к запуску мощных LLM на iPhone и iPad — следующий рубеж в планах автора

Это не просто «запустить большую модель». Это сигнал: граница между «облачным AI» и «локальным AI» продолжает стремительно размываться — и инженеры-одиночки с любовью к Metal и птицам могут менять правила игры.