Magnitude: локальный inference-сервер, который знает ваше железо

Что это и для кого

Magnitude — это open-source inference-сервер, который запускает лучшие локальные модели для вашего оборудования и встраивается в агент, которым вы уже пользуетесь. Он профилирует машину, рекомендует подходящие модели, а затем скачивает, тонко настраивает и запускает их.

Magnitude — это полностью приватный и офлайн-агент без затрат на токены и без API-ключей. Проект полностью открытый.

Инструмент ориентирован на:

  • Разработчиков, которые хотят работать с AI-агентами без отправки кода в облако;
  • Privacy-ориентированных пользователей, которым важно, чтобы промпты, файлы и модели оставались на локальной машине;
  • Экономных пользователей — нет подписок, нет API-биллинга.
ℹ Кому подойдёт
Magnitude идеален для тех, кто уже использует агенты вроде Cline, Claude Code или OpenCode, но хочет перевести их на локальные модели без ручной возни с настройками llama.cpp или Ollama.

Ключевые возможности

1. Профилирование железа и умный подбор моделей

Ваш агент мог бы установить Ollama и скачать модель — но он угадывает. Он не знает ваше железо, какой quant подойдёт и насколько быстро всё будет работать. Magnitude предоставляет кураторский каталог с рекомендациями, вычисленными специально под вашу машину.

Инструмент бесплатен в работе (нет токен-костов, API-ключей и rate limits), полностью приватен, знает ваш чип, память и пропускную способность и рекомендует лучшие модели с оценкой tok/s.

2. Agent-first интеграция

Magnitude не заменяет агента, которого вы используете. При настройке он спрашивает, какой harness подключить, а затем сам записывает конфигурацию. Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi и Cline — все они поддерживаются; есть и встроенный harness, оптимизированный для локальных моделей.

3. Умное управление памятью (models on demand)

Модели загружаются по запросу и выгружаются при простое или нехватке памяти, поэтому длинная агентская сессия не держит в памяти веса, которые не используются.

Количество параллельных запросов напрямую влияет на доступный контекст каждого запроса. При слишком высоком concurrency на ограниченной машине это выражается как агент, забывающий, что делал десять шагов назад — а не как явная ошибка. Magnitude решает эту проблему автоматически.

4. Speculative decoding под ваше железо

Speculative decoding и параметры конкурентности настраиваются под конкретную машину, а не оставляются в виде флагов для самостоятельной настройки.

Speculative decoding работает так: небольшая быстрая модель предлагает несколько токенов вперёд, а основная модель проверяет всё предложение за один проход. Правильные угадывания дают несколько токенов примерно по цене одного. Неверные отбрасываются с небольшими потерями. Выгодность зависит от пары моделей и пропускной способности памяти — именно то суждение, для которого нужен аппаратный профиль.

5. Поддержка GGUF-моделей с Hugging Face

Можно скачать совместимые GGUF-модели с Hugging Face и использовать их в Magnitude.

6. Поддержка платформ

Magnitude поддерживает macOS и Linux. Windows поддерживается через WSL.


Как это работает: схема


graph TD
    A[Установка CLI\nnpm i -g @magnitudedev/cli] --> B[Запуск magnitude setup]
    B --> C[Профилирование железа\nчип, RAM, bandwidth]
    C --> D[Каталог рекомендованных моделей\nс оценкой tok/s]
    D --> E[Выбор модели\nи скачивание]
    E --> F{Выбор harness}
    F -->|Существующий| G[Claude Code / Cline / Codex\nOpenCode / Pi / Hermes...]
    F -->|Встроенный| H[Built-in harness Magnitude]
    G --> I[Локальный inference\nбез облака и API-ключей]
    H --> I
    I --> J[Автоматическая выгрузка\nпри простое или нехватке памяти]


Быстрый старт

Установка и настройка — одна команда:

npm install -g @magnitudedev/cli && magnitude setup

Ваш агент профилирует железо, покажет лучшие локальные модели, скачает выбранные и переключится на них.

Можно также отправить агенту такое сообщение:

Set up local models for me with the Magnitude CLI.
Install it with `npm i -g @magnitudedev/cli`,
then run `magnitude docs onboarding` and follow the instructions.
💡 Совет по запуску
Если вы используете Claude Code или Cline — просто вставьте промпт выше в чат агента. Он сам установит CLI, профилирует железо и настроит конфигурацию без ручного вмешательства.

Тарифы и цены

Magnitude полностью бесплатен: нет стоимости токенов, API-ключей и rate limits. Проект распространяется как open-source.

Промпты, файлы и модели остаются на вашей машине. После скачивания Magnitude и модели интернет-соединение не нужно.

ТарифЦенаЧто включено
Open SourceБесплатноВсё, без ограничений
ОблакоНетНе предусмотрено
API-ключиНе нужныПолностью локально

Плюсы и минусы

✅ Плюсы❌ Минусы
Полностью бесплатно и open-sourceТребует Node.js/npm для CLI
100% приватность: данные не покидают машинуWindows только через WSL
Умный подбор модели под железоНет GUI — только CLI
Автоматическая настройка speculative decodingЗависит от объёма RAM (нет фиксированного минимума)
Интеграция с популярными агентами из коробкиМолодой проект, возможны баги
Автоматическая выгрузка моделей при простоеКаталог моделей ограничен рекомендованными
Поддержка GGUF с Hugging FaceКачество локальных моделей ниже GPT-5/Claude

Сравнение с альтернативами

ПараметрMagnitudeOllamaLM Studio
ТипInference-сервер для агентовУниверсальный LLM runtimeDesktop GUI + headless
ИнтерфейсCLICLIGUI + CLI
Интеграция с агентами✅ Нативная (8+ агентов)⚠️ Через OpenAI API⚠️ Через OpenAI API
Подбор модели под железо✅ Автоматически❌ Вручную⚠️ Частично
Speculative decoding✅ Авто-настройка❌ Не поддерживается❌ Не поддерживается
Models on demand✅ Загрузка/выгрузка автоматически⚠️ Базовая поддержка⚠️ Базовая поддержка
Open-source✅ Полностью✅ MIT❌ Закрытый
ПлатформыmacOS, Linux, WSLmacOS, Linux, WindowsmacOS, Linux, Windows
ЦенаБесплатноБесплатно (есть платные облачные тиры)Бесплатно
Поддержка GGUF

Ollama — CLI-first runtime, ставший самым популярным open-source LLM-инфраструктурным проектом на GitHub. LM Studio — отполированный desktop GUI, который теперь умеет работать и в headless-режиме. Magnitude занимает отдельную нишу: он не универсальный LLM-сервер, а слой оркестрации специально для агентских воркфлоу.

⚠ Важное отличие
Ollama и LM Studio — инструменты общего назначения для запуска моделей. Magnitude — узкоспециализированный сервер, заточенный именно под агентские задачи: длинный контекст, tool calls, управление памятью под agent trajectory.

Почему агентские задачи сложнее чата

Локальные инструменты стали простыми в использовании, когда основным сценарием был чат, а чат прощает то, чего агентская работа — нет. Чат-сессия — несколько тысяч токенов. Агентская траектория накапливается за двадцать-тридцать ходов, и каждый ход добавляет вывод инструментов и содержимое файлов к тому, что держит модель. Накопленный разговор занимает RAM вместе с весами, и в длинных агентских запусках регулярно вырастает больше самих весов.

Именно эту проблему Magnitude решает системно: автоматическим управлением контекстом и памятью.


Вердикт

Magnitude закрывает реальный gap: агенты вроде Cline и Claude Code умеют многое, но «не знают» вашего железа. Magnitude добавляет этот недостающий слой — умный, автоматический и бесплатный.

Кому подойдёт:

  • Разработчикам, уже использующим Cline, OpenCode, Claude Code или Codex и желающим перейти на локальные модели;
  • Privacy-ориентированным командам, работающим с чувствительным кодом или данными;
  • Пользователям с достаточным объёмом RAM (от ~16 ГБ для практичной работы);
  • Тем, кто хочет нулевые операционные расходы на AI.

Кому не подойдёт:

  • Тем, кому нужен GUI;
  • Пользователям Windows без WSL;
  • Тем, кто ожидает качества GPT-5 или Claude Opus от локальных моделей.

Рейтинг: 8/10 — амбициозный и технически грамотный проект, который решает реальную боль. Молодость экосистемы и отсутствие GUI — пока единственные серьёзные ограничения.