Meta открывает эпоху локальных ИИ-агентов

10 августа 2026 года Meta Superintelligence Labs выпустила Muse Glimmer — открытую модель под лицензией Apache 2.0, доступную на Hugging Face. Это 30-миллиардная (30B) open-weight модель, спроектированная для запуска автономных ИИ-агентов прямо на потребительском железе — без облака, без подписки, без постоянного интернета. Это первый полностью открытый релиз Meta после перехода к проприетарному Muse Spark, причём с более либеральной лицензией, чем когда-либо носила серия Llama.


Что такое Muse Glimmer

Muse Glimmer — это плотная мультимодальная модель, созданная для автономного запуска на потребительском железе. Она умещается на одной потребительской GPU и доступна с весами под Apache 2.0. Модель дистиллирована из гораздо более крупного «учителя»:

«Muse Glimmer distilled from Muse Spark — the much larger closed teacher model behind Meta’s consumer AI stack» — именно эта передача знаний позволила сохранить агентные способности при кардинальном уменьшении размера.

Архитектурно — это плотный каузальный трансформер с отдельным энкодером восприятия (~1.8B параметров, ViT-G/14), принимающим до 4096 визуальных токенов на изображение. Контекст — 131 072+ токенов, словарь — 202 048 токенов.

ℹ Лицензия
Muse Glimmer распространяется под Apache 2.0 — это означает свободное коммерческое использование, модификацию и распространение без согласования с Meta.

Как обучали модель

Обучение проходило в три фазы:


graph TD
    A[Pre-Training\nЛогит-дистилляция из Muse Spark] --> B[Mid-Training\nДлинный контекст + агентные данные + reasoning traces]
    B --> C[Post-Training\nSFT + on-policy дистилляция + Reinforcement Learning]
    C --> D[Muse Glimmer 30B]

На этапе предобучения использовалась логит-дистилляция на выходах Muse Spark. Средний этап добавил длинноконтекстные агентные данные с подробными reasoning traces. Пост-обучение объединило SFT (supervised fine-tuning) с on-policy дистилляцией и reinforcement learning по доменам: reasoning, coding, agentic.


Ключевые возможности

Модель интегрирует многошаговое рассуждение, надёжный вызов инструментов, мультимодальное понимание и восстановление после сбоев в единой системе, работающей локально без облака.

  • End-to-end Agentic Task Completion — высокие показатели на бенчмарках DeepSearch QA, MCP-Atlas, τ-Bench и SWE-Bench
  • Reliable Tool Use (надёжный вызов инструментов) — точные вызовы функций с корректными схемами в длинных воркфлоу
  • Failure Recovery (восстановление после сбоев) — если вызов инструмента завершился ошибкой, модель диагностирует её и повторяет попытку, а не останавливается
  • Multimodal Input — через выделенный энкодер восприятия принимаются чередующиеся текст и изображения: скриншоты, графики, документы
  • Controllable Effort — поддерживаются уровни reasoning: low / medium / high / xhigh
  • Multilingual — обучена на данных более чем на 100 языках
💡 Совет разработчику
Для сложных задач кодирования и агентных воркфлоу используйте режим Reasoning strength: high или xhigh в системном промпте — это существенно повышает качество результатов.

Производительность: как вмещается на GPU

Ключевая проблема любой 30B-модели — память. При полной точности модель требует около 55 ГБ RAM. Инженеры Meta сократили это до менее чем 20 ГБ с помощью оптимизаций, что позволяет запускать её на PC и Mac с одной потребительской GPU.

Применив 4-bit quantization (квантизацию), Meta сжала требования к памяти с 55 ГБ до 18–20 ГБ — так что модель, KV-кеш, энкодер восприятия и черновик для speculative decoding умещаются в 24 или 32 ГБ VRAM.

Второе ключевое ускорение — speculative decoding (спекулятивное декодирование) на базе DFlash: квантизованная версия укладывается в 24 ГБ VRAM и декодирует в 3.1× быстрее стандартной генерации токен-за-токеном.


Сравнение с конкурентами

Muse Glimmer выходит на всё более конкурентный рынок локальных моделей, где уже есть Google Gemma4-31B и Alibaba Qwen3.6-27B, также нацеленные на reasoning, мультимодальность и агентные задачи.

БенчмаркMuse Glimmer 30BGemma4-31BQwen3.6-27B
MCP Atlas75.554.262.5
DeepSearch QA74.661.771.1
GAIA243.336.440.0
SWE-Bench Pro51.236.950.2
AIME 202694.7
OSWorld-Verified65.975.6
TerminalBench 2.151.760.7
SWE-Bench Verified76.077.2

По категории general agentic — именно той, для которой модель создавалась, — Muse Glimmer выигрывает почти в каждой строке таблицы, и разрывы далеко не минимальные. Однако на задачах, требующих устойчивой работы в терминале и управления компьютером, Qwen3.6-27B вырывается вперёд.

⚠ Важно про безопасность
Предоставление локальной модели доступа к инструментам создаёт иные угрозы безопасности, чем обычный чат-бот. На тесте Siren AgentDojo (атаки типа prompt injection) Muse Glimmer показывает 28.4% успешных атак — чуть хуже Gemma4-31B (25.6%), но лучше Qwen3.6-27B (40.3%). Учитывайте это при развёртывании.

Как начать работу прямо сейчас

Модель уже доступна на Hugging Face. В ближайшие дни появится поддержка в популярных инструментах:

# Через Ollama (поддержка уже добавлена в ollama 0.32.7)
ollama pull muse-glimmer:30b

# Через llama.cpp (оптимизации в ближайшие дни)
./main -m muse-glimmer-30b-Q4_K_M.gguf -c 8192

С поддержкой Ollama, LM Studio и vLLM, запускаемой на этой неделе, Glimmer позиционируется как практичная альтернатива для разработчиков, которым нужны агентные возможности без отправки чувствительных данных на удалённые серверы.

Также доступны:

  • Облачный деплой: Together AI, Fireworks AI, OpenRouter
  • Edge-фреймворки: llama.cpp, ExecuTorch, MLX
  • Серверный инференс: vLLM, SGLang
  • Fine-tuning: через PyTorch TorchTitan

Контекст и значение для отрасли

Этот релиз — значимый стратегический разворот для компании: первый полностью открытый релиз с тех пор, как в апреле Meta перевела семейство Muse на проприетарные лицензии вместе с запуском Muse Spark.

Сейчас Meta ведёт два трека параллельно: закрытые хостинговые фронтирные модели (Muse Spark 1.1 через API) и открытые дистилляции для локального железа (Muse Glimmer, и скоро — Muse Spark 1.2).

Релиз — явная ставка на то, что будущее ИИ-агентов включает on-device деплой, а не только облачный инференс. Вслед за этим CEO Марк Цукерберг подтвердил планы открыть веса фронтирной модели Muse Spark 1.2 в ближайшем будущем.