Magnitude: локальный inference-сервер для AI-агентов
Обзор Magnitude — open-source inference-сервера, который профилирует железо, подбирает модели и подключается к вашему AI-агенту. Бесплатно, приватно, офлайн.
Magnitude: локальный inference-сервер, который знает ваше железо
Что это и для кого
Magnitude — это open-source inference-сервер, который запускает лучшие локальные модели для вашего оборудования и встраивается в агент, которым вы уже пользуетесь. Он профилирует машину, рекомендует подходящие модели, а затем скачивает, тонко настраивает и запускает их.
Magnitude — это полностью приватный и офлайн-агент без затрат на токены и без API-ключей. Проект полностью открытый.
Инструмент ориентирован на:
- Разработчиков, которые хотят работать с AI-агентами без отправки кода в облако;
- Privacy-ориентированных пользователей, которым важно, чтобы промпты, файлы и модели оставались на локальной машине;
- Экономных пользователей — нет подписок, нет API-биллинга.
Ключевые возможности
1. Профилирование железа и умный подбор моделей
Ваш агент мог бы установить Ollama и скачать модель — но он угадывает. Он не знает ваше железо, какой quant подойдёт и насколько быстро всё будет работать. Magnitude предоставляет кураторский каталог с рекомендациями, вычисленными специально под вашу машину.
Инструмент бесплатен в работе (нет токен-костов, API-ключей и rate limits), полностью приватен, знает ваш чип, память и пропускную способность и рекомендует лучшие модели с оценкой tok/s.
2. Agent-first интеграция
Magnitude не заменяет агента, которого вы используете. При настройке он спрашивает, какой harness подключить, а затем сам записывает конфигурацию. Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi и Cline — все они поддерживаются; есть и встроенный harness, оптимизированный для локальных моделей.
3. Умное управление памятью (models on demand)
Модели загружаются по запросу и выгружаются при простое или нехватке памяти, поэтому длинная агентская сессия не держит в памяти веса, которые не используются.
Количество параллельных запросов напрямую влияет на доступный контекст каждого запроса. При слишком высоком concurrency на ограниченной машине это выражается как агент, забывающий, что делал десять шагов назад — а не как явная ошибка. Magnitude решает эту проблему автоматически.
4. Speculative decoding под ваше железо
Speculative decoding и параметры конкурентности настраиваются под конкретную машину, а не оставляются в виде флагов для самостоятельной настройки.
Speculative decoding работает так: небольшая быстрая модель предлагает несколько токенов вперёд, а основная модель проверяет всё предложение за один проход. Правильные угадывания дают несколько токенов примерно по цене одного. Неверные отбрасываются с небольшими потерями. Выгодность зависит от пары моделей и пропускной способности памяти — именно то суждение, для которого нужен аппаратный профиль.
5. Поддержка GGUF-моделей с Hugging Face
Можно скачать совместимые GGUF-модели с Hugging Face и использовать их в Magnitude.
6. Поддержка платформ
Magnitude поддерживает macOS и Linux. Windows поддерживается через WSL.
Как это работает: схема
graph TD
A[Установка CLI\nnpm i -g @magnitudedev/cli] --> B[Запуск magnitude setup]
B --> C[Профилирование железа\nчип, RAM, bandwidth]
C --> D[Каталог рекомендованных моделей\nс оценкой tok/s]
D --> E[Выбор модели\nи скачивание]
E --> F{Выбор harness}
F -->|Существующий| G[Claude Code / Cline / Codex\nOpenCode / Pi / Hermes...]
F -->|Встроенный| H[Built-in harness Magnitude]
G --> I[Локальный inference\nбез облака и API-ключей]
H --> I
I --> J[Автоматическая выгрузка\nпри простое или нехватке памяти]
Быстрый старт
Установка и настройка — одна команда:
npm install -g @magnitudedev/cli && magnitude setup
Ваш агент профилирует железо, покажет лучшие локальные модели, скачает выбранные и переключится на них.
Можно также отправить агенту такое сообщение:
Set up local models for me with the Magnitude CLI.
Install it with `npm i -g @magnitudedev/cli`,
then run `magnitude docs onboarding` and follow the instructions.
Тарифы и цены
Magnitude полностью бесплатен: нет стоимости токенов, API-ключей и rate limits. Проект распространяется как open-source.
Промпты, файлы и модели остаются на вашей машине. После скачивания Magnitude и модели интернет-соединение не нужно.
| Тариф | Цена | Что включено |
|---|---|---|
| Open Source | Бесплатно | Всё, без ограничений |
| Облако | Нет | Не предусмотрено |
| API-ключи | Не нужны | Полностью локально |
Плюсы и минусы
| ✅ Плюсы | ❌ Минусы |
|---|---|
| Полностью бесплатно и open-source | Требует Node.js/npm для CLI |
| 100% приватность: данные не покидают машину | Windows только через WSL |
| Умный подбор модели под железо | Нет GUI — только CLI |
| Автоматическая настройка speculative decoding | Зависит от объёма RAM (нет фиксированного минимума) |
| Интеграция с популярными агентами из коробки | Молодой проект, возможны баги |
| Автоматическая выгрузка моделей при простое | Каталог моделей ограничен рекомендованными |
| Поддержка GGUF с Hugging Face | Качество локальных моделей ниже GPT-5/Claude |
Сравнение с альтернативами
| Параметр | Magnitude | Ollama | LM Studio |
|---|---|---|---|
| Тип | Inference-сервер для агентов | Универсальный LLM runtime | Desktop GUI + headless |
| Интерфейс | CLI | CLI | GUI + CLI |
| Интеграция с агентами | ✅ Нативная (8+ агентов) | ⚠️ Через OpenAI API | ⚠️ Через OpenAI API |
| Подбор модели под железо | ✅ Автоматически | ❌ Вручную | ⚠️ Частично |
| Speculative decoding | ✅ Авто-настройка | ❌ Не поддерживается | ❌ Не поддерживается |
| Models on demand | ✅ Загрузка/выгрузка автоматически | ⚠️ Базовая поддержка | ⚠️ Базовая поддержка |
| Open-source | ✅ Полностью | ✅ MIT | ❌ Закрытый |
| Платформы | macOS, Linux, WSL | macOS, Linux, Windows | macOS, Linux, Windows |
| Цена | Бесплатно | Бесплатно (есть платные облачные тиры) | Бесплатно |
| Поддержка GGUF | ✅ | ✅ | ✅ |
Ollama — CLI-first runtime, ставший самым популярным open-source LLM-инфраструктурным проектом на GitHub. LM Studio — отполированный desktop GUI, который теперь умеет работать и в headless-режиме. Magnitude занимает отдельную нишу: он не универсальный LLM-сервер, а слой оркестрации специально для агентских воркфлоу.
Почему агентские задачи сложнее чата
Локальные инструменты стали простыми в использовании, когда основным сценарием был чат, а чат прощает то, чего агентская работа — нет. Чат-сессия — несколько тысяч токенов. Агентская траектория накапливается за двадцать-тридцать ходов, и каждый ход добавляет вывод инструментов и содержимое файлов к тому, что держит модель. Накопленный разговор занимает RAM вместе с весами, и в длинных агентских запусках регулярно вырастает больше самих весов.
Именно эту проблему Magnitude решает системно: автоматическим управлением контекстом и памятью.
Вердикт
Magnitude закрывает реальный gap: агенты вроде Cline и Claude Code умеют многое, но «не знают» вашего железа. Magnitude добавляет этот недостающий слой — умный, автоматический и бесплатный.
Кому подойдёт:
- Разработчикам, уже использующим Cline, OpenCode, Claude Code или Codex и желающим перейти на локальные модели;
- Privacy-ориентированным командам, работающим с чувствительным кодом или данными;
- Пользователям с достаточным объёмом RAM (от ~16 ГБ для практичной работы);
- Тем, кто хочет нулевые операционные расходы на AI.
Кому не подойдёт:
- Тем, кому нужен GUI;
- Пользователям Windows без WSL;
- Тем, кто ожидает качества GPT-5 или Claude Opus от локальных моделей.
Рейтинг: 8/10 — амбициозный и технически грамотный проект, который решает реальную боль. Молодость экосистемы и отсутствие GUI — пока единственные серьёзные ограничения.