Miles v0.1: RL-фреймворк для дообучения LLM на уровне предприятия
RadixArk выпустила Miles v0.1 — open-source RL-фреймворк корпоративного уровня для пост-тренинга LLM и VLM в триллион-параметрном масштабе.
Miles v0.1 вышел: корпоративный RL-фреймворк для гигантских языковых моделей
Команда RadixArk в августе 2026 года выпустила Miles v0.1 — open-source фреймворк для обучения с подкреплением (RL, Reinforcement Learning) корпоративного уровня, предназначенный для пост-тренинга (post-training — дополнительное обучение после предобучения) больших языковых и мультимодальных моделей. Проект форкнут из популярного легковесного фреймворка slime и развивается параллельно с ним, закрывая потребности, которые slime изначально не ставил целью: надёжность, масштаб и контролируемость на уровне промышленного развёртывания.
Откуда растут ноги: slime и его корпоративный наследник
Miles построен поверх slime — лёгкого RL-фреймворка, который незаметно лежит в основе многих современных пайплайнов пост-тренинга и крупных MoE-запусков, включая GLM-4.6. Пока slime доказал, что лёгкий дизайн работает, Miles делает следующий шаг: обеспечивает надёжность, масштаб и контроль, необходимые для реальных корпоративных развёртываний.
Родительский slime стоит за обучением GLM-5.3, GLM-5.2, GLM-5.1, GLM-5, GLM-4.7, GLM-4.6 и GLM-4.5 — это подтверждает, что весь пайплайн пост-тренинга работает, а не только изолированные примеры.
«Путь в тысячу миль начинается с одного роллаута.» — девиз проекта Miles
Архитектура: три столпа фреймворка
Miles — высокопроизводительный, готовый к промышленному использованию RL-фреймворк для пост-тренинга крупных моделей. Он объединяет SGLang для высокопропускного роллаута (rollout — генерация ответов моделью в процессе RL) и Megatron-LM для масштабируемого обучения, обеспечивая точность, стабильность и наблюдаемость, необходимые для RL-запусков в масштабе триллиона параметров.
Miles компонует SGLang для роллаута, NVIDIA Megatron-LM для обучения, оркестрацию через Ray и расширяемость на PyTorch — с унифицированными рецептами для низкой точности, MoE-совместимым выравниванием роллаут/трейнинг, быстрой синхронизацией весов через NCCL/RDMA, наблюдаемостью и отказоустойчивостью.
graph LR
A[Данные / Промпты] --> B[SGLang Rollout\nгенерация ответов]
B --> C[Reward / Verifier\nоценка ответов]
C --> D[Megatron-LM Training\nобновление весов]
D --> E[P2P RDMA\nбыстрая синхронизация]
E --> B
style A fill:#1e293b,color:#94a3b8
style B fill:#0f172a,color:#38bdf8
style C fill:#0f172a,color:#f472b6
style D fill:#0f172a,color:#4ade80
style E fill:#0f172a,color:#fb923c
Ключевые возможности Miles v0.1
Производительность
Роллаут и обучающие воркеры полностью разделены, с настраиваемыми on- и off-policy расписаниями, пайплайном для уменьшения пузырей (bubble — простой GPU) и кастомизируемыми асинхронными режимами роллаута и оценки.
Miles поддерживает полный стек INT4 Quantization-Aware Training (QAT): это позволяет моделям масштаба 1 ТБ помещаться в VRAM одной машины (например, NVIDIA H200), удваивая эффективность роллаута за счёт устранения межузловых узких мест при сохранении точности, эквивалентной BF16.
Корректность и устойчивость
Одна из главных проблем RL на MoE-моделях (Mixture of Experts, «смесь экспертов») — расхождение маршрутизации между роллаутом и трейнингом. Miles решает её через механизм Rollout Routing Replay (R3): маршрутизация экспертов, записанная во время роллаута, воспроизводится при прямом проходе трейнера, устраняя дестабилизирующее несоответствие.
При падении SGLang-движка Miles восстанавливает его и продолжает запуск на месте — без рестарта и без паузы.
Поддерживаемые алгоритмы и модели
Поддерживаются алгоритмы GRPO, GSPO, PPO и REINFORCE++ для RL, а также SFT и on-policy distillation (дистилляция на политике).
| Модель | Поддержка | Статус |
|---|---|---|
| DeepSeek-V4 | ✅ Day-0 | Полная |
| Kimi K3 | ✅ Day-0 | Полная |
| Kimi K2.6 | ✅ | Полная |
| Inkling (мультимодальная) | ✅ Day-0 | Полная |
| NVIDIA Nemotron 3 Ultra | ✅ Day-0 | Полная |
| Qwen3.5 | ✅ | Полная |
| GLM-5.2 | ✅ Day-0 | Полная |
Аппаратная поддержка
Мiles работает на широком спектре GPU:
| Производитель | Поддерживаемые модели |
|---|---|
| NVIDIA | GB300, GB200, B300, B200, H200, H100, A100 |
| AMD | MI300X, MI325X, MI350X, MI355X (через ROCm) |
В июле 2026 года RL-обучение DeepSeek-V4 Flash было запущено на AMD Instinct MI355X с помощью Miles.
Агентные среды и диффузионные модели
Miles позволяет обучать агентов для написания кода и управления компьютером через коннекторы к Harbor, HUD, NeMo Gym, OpenEnv, Verifiers и другим платформам — с песочницами на AgentENV, Daytona, E2B или Modal.
Для диффузионных моделей доступны Flow-GRPO, DiffusionNFT и SFT на движке sglang-diffusion и трейнере FSDP2 — в рамках Miles-diffusion.
Пример запуска FP8 GRPO-обучения для Qwen3:
python train.py \
--advantage-estimator grpo \
--model-name qwen3-30b-a3b \
--hf-checkpoint /path/to/qwen3-30b-a3b-hf \
--rollout-batch-size 512 \
--n-samples-per-prompt 8
Документация и пример быстрого старта — на radixark.mintlify.app.
Контекст: зачем это нужно отрасли
Рынок AI-платформ растёт с $109,9 млрд в 2025 году к $181,3 млрд в 2026-м при CAGR 28,7% до 2030 года, однако 45,5% лиц, принимающих решения в области ИИ, называют высокую вычислительную стоимость и инфраструктурные требования главным барьером для внедрения.
Фреймворк Miles от RadixArk устраняет этот барьер, объединяя open-source инструменты в единый стек для крупномасштабного RL post-training LLM, существенно снижая вычислительные затраты и инженерную сложность.
Miles v0.1 доступен на GitHub. Сообщество развивается в Slack-канале #miles-rl, документация — на официальном сайте radixark.mintlify.app.