Muse Glimmer: мощный агентный ИИ от Meta на вашем PC
Meta выпустила Muse Glimmer — 30-миллиардную модель под Apache 2.0 для локальных ИИ-агентов. Работает на одной потребительской GPU без интернета.
Meta открывает эпоху локальных ИИ-агентов
10 августа 2026 года Meta Superintelligence Labs выпустила Muse Glimmer — открытую модель под лицензией Apache 2.0, доступную на Hugging Face. Это 30-миллиардная (30B) open-weight модель, спроектированная для запуска автономных ИИ-агентов прямо на потребительском железе — без облака, без подписки, без постоянного интернета. Это первый полностью открытый релиз Meta после перехода к проприетарному Muse Spark, причём с более либеральной лицензией, чем когда-либо носила серия Llama.
Что такое Muse Glimmer
Muse Glimmer — это плотная мультимодальная модель, созданная для автономного запуска на потребительском железе. Она умещается на одной потребительской GPU и доступна с весами под Apache 2.0. Модель дистиллирована из гораздо более крупного «учителя»:
«Muse Glimmer distilled from Muse Spark — the much larger closed teacher model behind Meta’s consumer AI stack» — именно эта передача знаний позволила сохранить агентные способности при кардинальном уменьшении размера.
Архитектурно — это плотный каузальный трансформер с отдельным энкодером восприятия (~1.8B параметров, ViT-G/14), принимающим до 4096 визуальных токенов на изображение. Контекст — 131 072+ токенов, словарь — 202 048 токенов.
Как обучали модель
Обучение проходило в три фазы:
graph TD
A[Pre-Training\nЛогит-дистилляция из Muse Spark] --> B[Mid-Training\nДлинный контекст + агентные данные + reasoning traces]
B --> C[Post-Training\nSFT + on-policy дистилляция + Reinforcement Learning]
C --> D[Muse Glimmer 30B]
На этапе предобучения использовалась логит-дистилляция на выходах Muse Spark. Средний этап добавил длинноконтекстные агентные данные с подробными reasoning traces. Пост-обучение объединило SFT (supervised fine-tuning) с on-policy дистилляцией и reinforcement learning по доменам: reasoning, coding, agentic.
Ключевые возможности
Модель интегрирует многошаговое рассуждение, надёжный вызов инструментов, мультимодальное понимание и восстановление после сбоев в единой системе, работающей локально без облака.
- End-to-end Agentic Task Completion — высокие показатели на бенчмарках DeepSearch QA, MCP-Atlas, τ-Bench и SWE-Bench
- Reliable Tool Use (надёжный вызов инструментов) — точные вызовы функций с корректными схемами в длинных воркфлоу
- Failure Recovery (восстановление после сбоев) — если вызов инструмента завершился ошибкой, модель диагностирует её и повторяет попытку, а не останавливается
- Multimodal Input — через выделенный энкодер восприятия принимаются чередующиеся текст и изображения: скриншоты, графики, документы
- Controllable Effort — поддерживаются уровни reasoning: low / medium / high / xhigh
- Multilingual — обучена на данных более чем на 100 языках
Reasoning strength: high или xhigh в системном промпте — это существенно повышает качество результатов.Производительность: как вмещается на GPU
Ключевая проблема любой 30B-модели — память. При полной точности модель требует около 55 ГБ RAM. Инженеры Meta сократили это до менее чем 20 ГБ с помощью оптимизаций, что позволяет запускать её на PC и Mac с одной потребительской GPU.
Применив 4-bit quantization (квантизацию), Meta сжала требования к памяти с 55 ГБ до 18–20 ГБ — так что модель, KV-кеш, энкодер восприятия и черновик для speculative decoding умещаются в 24 или 32 ГБ VRAM.
Второе ключевое ускорение — speculative decoding (спекулятивное декодирование) на базе DFlash: квантизованная версия укладывается в 24 ГБ VRAM и декодирует в 3.1× быстрее стандартной генерации токен-за-токеном.
Сравнение с конкурентами
Muse Glimmer выходит на всё более конкурентный рынок локальных моделей, где уже есть Google Gemma4-31B и Alibaba Qwen3.6-27B, также нацеленные на reasoning, мультимодальность и агентные задачи.
| Бенчмарк | Muse Glimmer 30B | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|
| MCP Atlas | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 |
| GAIA2 | 43.3 | 36.4 | 40.0 |
| SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| AIME 2026 | 94.7 | — | — |
| OSWorld-Verified | 65.9 | — | 75.6 |
| TerminalBench 2.1 | 51.7 | — | 60.7 |
| SWE-Bench Verified | 76.0 | — | 77.2 |
По категории general agentic — именно той, для которой модель создавалась, — Muse Glimmer выигрывает почти в каждой строке таблицы, и разрывы далеко не минимальные. Однако на задачах, требующих устойчивой работы в терминале и управления компьютером, Qwen3.6-27B вырывается вперёд.
Как начать работу прямо сейчас
Модель уже доступна на Hugging Face. В ближайшие дни появится поддержка в популярных инструментах:
# Через Ollama (поддержка уже добавлена в ollama 0.32.7)
ollama pull muse-glimmer:30b
# Через llama.cpp (оптимизации в ближайшие дни)
./main -m muse-glimmer-30b-Q4_K_M.gguf -c 8192
С поддержкой Ollama, LM Studio и vLLM, запускаемой на этой неделе, Glimmer позиционируется как практичная альтернатива для разработчиков, которым нужны агентные возможности без отправки чувствительных данных на удалённые серверы.
Также доступны:
- Облачный деплой: Together AI, Fireworks AI, OpenRouter
- Edge-фреймворки: llama.cpp, ExecuTorch, MLX
- Серверный инференс: vLLM, SGLang
- Fine-tuning: через PyTorch TorchTitan
Контекст и значение для отрасли
Этот релиз — значимый стратегический разворот для компании: первый полностью открытый релиз с тех пор, как в апреле Meta перевела семейство Muse на проприетарные лицензии вместе с запуском Muse Spark.
Сейчас Meta ведёт два трека параллельно: закрытые хостинговые фронтирные модели (Muse Spark 1.1 через API) и открытые дистилляции для локального железа (Muse Glimmer, и скоро — Muse Spark 1.2).
Релиз — явная ставка на то, что будущее ИИ-агентов включает on-device деплой, а не только облачный инференс. Вслед за этим CEO Марк Цукерберг подтвердил планы открыть веса фронтирной модели Muse Spark 1.2 в ближайшем будущем.