Mixture of Experts (MoE) — архитектура умных нейросетей

💡 Tip
Mixture of Experts (MoE) — это архитектура нейросети, при которой модель содержит множество специализированных «экспертов» (подсетей), но для обработки каждого входящего токена активирует лишь небольшой их набор. Специальная «маршрутизирующая» сеть (router/gating network) решает, кто из экспертов нужен прямо сейчас.

Что такое MoE и зачем он нужен?

Представьте большую клинику. Вместо одного врача-терапевта, который принимает всех подряд, здесь работают десятки узких специалистов — кардиолог, невролог, хирург. Когда пациент приходит с болью в сердце, его направляют именно к кардиологу, а не ко всем сразу. Именно так устроен MoE.

Обычная («плотная», dense) модель при обработке каждого токена задействует все свои параметры — это дорого и медленно. MoE-модель хранит огромный набор знаний, но на каждый шаг вычисления тратит лишь малую долю ресурсов.

«MoE genuinely lets a model carry enormous knowledge while spending a fraction of the compute cost to use it.»
— buildfastwithai.com

Именно этот принцип объясняет, почему в 2026 году MoE стал стандартом для серьёзных языковых моделей.

Как работает MoE: три ключевых компонента

1. Эксперты (Experts)

Это обычные нейросетевые блоки — чаще всего feed-forward layers (FFN). Каждый эксперт специализируется на своём «участке» знаний. В DeepSeek-V3, например, таких экспертов 256 на каждом слое.

2. Маршрутизатор (Router / Gating Network)

Это небольшой линейный слой, который «читает» входящий токен и вычисляет оценку для каждого эксперта. По результату отбираются top-k лучших — и только они обрабатывают этот токен.

3. Sparse Activation (Разреженная активация)

Только выбранные эксперты «просыпаются». Остальные в это время не потребляют вычислительных ресурсов. Именно это делает MoE таким эффективным.

Входной токен
[Router/Gating]
  /   |   \
 E1  E5  E12   ← активируются только эти (top-k)
  \   |   /
  Выходной токен

graph LR
    T(["Входной токен"]) --> R{"Router\n(Gating Network)"}
    R -->|"top-k выбор"| E1["Эксперт 1\n(кодирование)"]
    R -->|"top-k выбор"| E5["Эксперт 5\n(логика)"]
    R -->|"top-k выбор"| E12["Эксперт 12\n(язык)"]
    E1 --> OUT(["Результат"])
    E5 --> OUT
    E12 --> OUT
    style R fill:#f0a500,color:#000
    style OUT fill:#4caf50,color:#fff

Цифры, которые говорят сами за себя

Вот реальные примеры MoE-моделей — все они задействуют лишь малую долю своих параметров при инференсе:

МодельВсего параметровАктивных на токенДоля активныхЭкспертов (top-k)
Mixtral 8x7B46.7 млрд~13 млрд~28%8 (top-2)
DeepSeek-V3671 млрд37 млрд~5.5%256 (top-8)
Qwen3-235B235 млрд22 млрд~9.4%128 (top-8)
LLaMA-4 Maverick~400 млрд~17 млрд~4%
GLM-5.2744 млрд~40 млрд~5.4%256 (top-8)

Как видно из таблицы, тенденция однозначна: модели становятся всё «разреженнее» — активная доля параметров падает с ~25% (Mixtral) до 3–5% у новейших моделей.

Преимущества и ограничения MoE

✅ Преимущества

  • Эффективность: огромная ёмкость знаний при низких вычислительных затратах на инференс
  • Масштабируемость: легко увеличивать число экспертов без пропорционального роста вычислений
  • Скорость обучения: MoE-модели обучаются быстрее при том же бюджете вычислений

⚠️ Ограничения

  • Память: хотя активна лишь часть параметров, все эксперты должны находиться в памяти GPU
  • Latency при маршрутизации: дополнительный шаг роутинга создаёт небольшую задержку
  • Routing collapse: если маршрутизатор постоянно выбирает одних и тех же экспертов, остальные деградируют

Примеры использования в реальных моделях

DeepSeek-V3 — хрестоматийный пример MoE-эффективности: 671 млрд параметров, но при инференсе работает лишь 37 млрд. Обучение обошлось примерно в $5–6 млн — в десятки раз дешевле сопоставимых dense-моделей.

Mixtral 8x7B от Mistral AI открыл эпоху открытых MoE-моделей: при 46.7 млрд параметрах скорость инференса сравнима с 13-миллиардной плотной моделью, а качество — с LLaMA-2-70B.

Qwen3-235B-A22B от Alibaba — пример MoE с «гибридным мышлением»: модель может переключаться между режимом глубокого рассуждения и быстрым ответом.

LLaMA-4 Maverick от Meta — доказательство того, что крупнейшие лаборатории мира перешли на MoE как стандарт.

Почему MoE стал главной архитектурой 2025–2026 годов?

С начала 2025 года практически все ведущие frontier-модели используют MoE. По данным NVIDIA, MoE используется более чем в 60% выпусков открытых моделей. Топ-10 самых мощных open-source моделей на лидерборде Artificial Analysis — все построены на MoE: DeepSeek-R1, Kimi K2, Mistral Large 3 и другие.

Это не тренд — это новая инженерная реальность. Dense-трансформеры уходят на второй план там, где важны масштаб и стоимость.


См. также: Трансформер (Transformer), Sparse Attention, Scaling Laws, RAG (Retrieval-Augmented Generation), Инференс (Inference)