Mixture of Experts (MoE) — архитектура умных нейросетей
MoE (Mixture of Experts) — архитектура ИИ, при которой модель активирует лишь часть своих «экспертов» для каждого токена. Объяснение простыми словами.
Mixture of Experts (MoE) — архитектура умных нейросетей
Что такое MoE и зачем он нужен?
Представьте большую клинику. Вместо одного врача-терапевта, который принимает всех подряд, здесь работают десятки узких специалистов — кардиолог, невролог, хирург. Когда пациент приходит с болью в сердце, его направляют именно к кардиологу, а не ко всем сразу. Именно так устроен MoE.
Обычная («плотная», dense) модель при обработке каждого токена задействует все свои параметры — это дорого и медленно. MoE-модель хранит огромный набор знаний, но на каждый шаг вычисления тратит лишь малую долю ресурсов.
«MoE genuinely lets a model carry enormous knowledge while spending a fraction of the compute cost to use it.»
— buildfastwithai.com
Именно этот принцип объясняет, почему в 2026 году MoE стал стандартом для серьёзных языковых моделей.
Как работает MoE: три ключевых компонента
1. Эксперты (Experts)
Это обычные нейросетевые блоки — чаще всего feed-forward layers (FFN). Каждый эксперт специализируется на своём «участке» знаний. В DeepSeek-V3, например, таких экспертов 256 на каждом слое.
2. Маршрутизатор (Router / Gating Network)
Это небольшой линейный слой, который «читает» входящий токен и вычисляет оценку для каждого эксперта. По результату отбираются top-k лучших — и только они обрабатывают этот токен.
3. Sparse Activation (Разреженная активация)
Только выбранные эксперты «просыпаются». Остальные в это время не потребляют вычислительных ресурсов. Именно это делает MoE таким эффективным.
Входной токен
│
▼
[Router/Gating]
/ | \
E1 E5 E12 ← активируются только эти (top-k)
\ | /
▼
Выходной токен
graph LR
T(["Входной токен"]) --> R{"Router\n(Gating Network)"}
R -->|"top-k выбор"| E1["Эксперт 1\n(кодирование)"]
R -->|"top-k выбор"| E5["Эксперт 5\n(логика)"]
R -->|"top-k выбор"| E12["Эксперт 12\n(язык)"]
E1 --> OUT(["Результат"])
E5 --> OUT
E12 --> OUT
style R fill:#f0a500,color:#000
style OUT fill:#4caf50,color:#fff
Цифры, которые говорят сами за себя
Вот реальные примеры MoE-моделей — все они задействуют лишь малую долю своих параметров при инференсе:
| Модель | Всего параметров | Активных на токен | Доля активных | Экспертов (top-k) |
|---|---|---|---|---|
| Mixtral 8x7B | 46.7 млрд | ~13 млрд | ~28% | 8 (top-2) |
| DeepSeek-V3 | 671 млрд | 37 млрд | ~5.5% | 256 (top-8) |
| Qwen3-235B | 235 млрд | 22 млрд | ~9.4% | 128 (top-8) |
| LLaMA-4 Maverick | ~400 млрд | ~17 млрд | ~4% | — |
| GLM-5.2 | 744 млрд | ~40 млрд | ~5.4% | 256 (top-8) |
Как видно из таблицы, тенденция однозначна: модели становятся всё «разреженнее» — активная доля параметров падает с ~25% (Mixtral) до 3–5% у новейших моделей.
Преимущества и ограничения MoE
✅ Преимущества
- Эффективность: огромная ёмкость знаний при низких вычислительных затратах на инференс
- Масштабируемость: легко увеличивать число экспертов без пропорционального роста вычислений
- Скорость обучения: MoE-модели обучаются быстрее при том же бюджете вычислений
⚠️ Ограничения
- Память: хотя активна лишь часть параметров, все эксперты должны находиться в памяти GPU
- Latency при маршрутизации: дополнительный шаг роутинга создаёт небольшую задержку
- Routing collapse: если маршрутизатор постоянно выбирает одних и тех же экспертов, остальные деградируют
Примеры использования в реальных моделях
DeepSeek-V3 — хрестоматийный пример MoE-эффективности: 671 млрд параметров, но при инференсе работает лишь 37 млрд. Обучение обошлось примерно в $5–6 млн — в десятки раз дешевле сопоставимых dense-моделей.
Mixtral 8x7B от Mistral AI открыл эпоху открытых MoE-моделей: при 46.7 млрд параметрах скорость инференса сравнима с 13-миллиардной плотной моделью, а качество — с LLaMA-2-70B.
Qwen3-235B-A22B от Alibaba — пример MoE с «гибридным мышлением»: модель может переключаться между режимом глубокого рассуждения и быстрым ответом.
LLaMA-4 Maverick от Meta — доказательство того, что крупнейшие лаборатории мира перешли на MoE как стандарт.
Почему MoE стал главной архитектурой 2025–2026 годов?
С начала 2025 года практически все ведущие frontier-модели используют MoE. По данным NVIDIA, MoE используется более чем в 60% выпусков открытых моделей. Топ-10 самых мощных open-source моделей на лидерборде Artificial Analysis — все построены на MoE: DeepSeek-R1, Kimi K2, Mistral Large 3 и другие.
Это не тренд — это новая инженерная реальность. Dense-трансформеры уходят на второй план там, где важны масштаб и стоимость.
См. также: Трансформер (Transformer), Sparse Attention, Scaling Laws, RAG (Retrieval-Augmented Generation), Инференс (Inference)
Источники
- https://www.buildfastwithai.com/blogs/mixture-of-experts-moe-explained
- https://friendli.ai/blog/moe-models-comparison
- https://blogs.nvidia.com/blog/mixture-of-experts-frontier-models/
- https://www.digitalocean.com/community/tutorials/mixture-of-experts-inference-cost
- https://gurusup.com/blog/mixture-of-experts-moe-explained