Miles v0.1 вышел: корпоративный RL-фреймворк для гигантских языковых моделей

Команда RadixArk в августе 2026 года выпустила Miles v0.1 — open-source фреймворк для обучения с подкреплением (RL, Reinforcement Learning) корпоративного уровня, предназначенный для пост-тренинга (post-training — дополнительное обучение после предобучения) больших языковых и мультимодальных моделей. Проект форкнут из популярного легковесного фреймворка slime и развивается параллельно с ним, закрывая потребности, которые slime изначально не ставил целью: надёжность, масштаб и контролируемость на уровне промышленного развёртывания.

ℹ Что такое post-training?
Post-training — этап обучения уже готовой модели с помощью RL или SFT (Supervised Fine-Tuning, обучение с учителем), чтобы выровнять её поведение, улучшить качество рассуждений или приспособить к конкретным задачам. Именно так обучают модели класса DeepSeek, Kimi, GPT.

Откуда растут ноги: slime и его корпоративный наследник

Miles построен поверх slime — лёгкого RL-фреймворка, который незаметно лежит в основе многих современных пайплайнов пост-тренинга и крупных MoE-запусков, включая GLM-4.6. Пока slime доказал, что лёгкий дизайн работает, Miles делает следующий шаг: обеспечивает надёжность, масштаб и контроль, необходимые для реальных корпоративных развёртываний.

Родительский slime стоит за обучением GLM-5.3, GLM-5.2, GLM-5.1, GLM-5, GLM-4.7, GLM-4.6 и GLM-4.5 — это подтверждает, что весь пайплайн пост-тренинга работает, а не только изолированные примеры.

«Путь в тысячу миль начинается с одного роллаута.» — девиз проекта Miles


Архитектура: три столпа фреймворка

Miles — высокопроизводительный, готовый к промышленному использованию RL-фреймворк для пост-тренинга крупных моделей. Он объединяет SGLang для высокопропускного роллаута (rollout — генерация ответов моделью в процессе RL) и Megatron-LM для масштабируемого обучения, обеспечивая точность, стабильность и наблюдаемость, необходимые для RL-запусков в масштабе триллиона параметров.

Miles компонует SGLang для роллаута, NVIDIA Megatron-LM для обучения, оркестрацию через Ray и расширяемость на PyTorch — с унифицированными рецептами для низкой точности, MoE-совместимым выравниванием роллаут/трейнинг, быстрой синхронизацией весов через NCCL/RDMA, наблюдаемостью и отказоустойчивостью.


graph LR
    A[Данные / Промпты] --> B[SGLang Rollout\nгенерация ответов]
    B --> C[Reward / Verifier\nоценка ответов]
    C --> D[Megatron-LM Training\nобновление весов]
    D --> E[P2P RDMA\nбыстрая синхронизация]
    E --> B
    style A fill:#1e293b,color:#94a3b8
    style B fill:#0f172a,color:#38bdf8
    style C fill:#0f172a,color:#f472b6
    style D fill:#0f172a,color:#4ade80
    style E fill:#0f172a,color:#fb923c


Ключевые возможности Miles v0.1

Производительность

Роллаут и обучающие воркеры полностью разделены, с настраиваемыми on- и off-policy расписаниями, пайплайном для уменьшения пузырей (bubble — простой GPU) и кастомизируемыми асинхронными режимами роллаута и оценки.

Miles поддерживает полный стек INT4 Quantization-Aware Training (QAT): это позволяет моделям масштаба 1 ТБ помещаться в VRAM одной машины (например, NVIDIA H200), удваивая эффективность роллаута за счёт устранения межузловых узких мест при сохранении точности, эквивалентной BF16.

Корректность и устойчивость

Одна из главных проблем RL на MoE-моделях (Mixture of Experts, «смесь экспертов») — расхождение маршрутизации между роллаутом и трейнингом. Miles решает её через механизм Rollout Routing Replay (R3): маршрутизация экспертов, записанная во время роллаута, воспроизводится при прямом проходе трейнера, устраняя дестабилизирующее несоответствие.

При падении SGLang-движка Miles восстанавливает его и продолжает запуск на месте — без рестарта и без паузы.

Поддерживаемые алгоритмы и модели

Поддерживаются алгоритмы GRPO, GSPO, PPO и REINFORCE++ для RL, а также SFT и on-policy distillation (дистилляция на политике).

МодельПоддержкаСтатус
DeepSeek-V4✅ Day-0Полная
Kimi K3✅ Day-0Полная
Kimi K2.6Полная
Inkling (мультимодальная)✅ Day-0Полная
NVIDIA Nemotron 3 Ultra✅ Day-0Полная
Qwen3.5Полная
GLM-5.2✅ Day-0Полная

Аппаратная поддержка

Мiles работает на широком спектре GPU:

ПроизводительПоддерживаемые модели
NVIDIAGB300, GB200, B300, B200, H200, H100, A100
AMDMI300X, MI325X, MI350X, MI355X (через ROCm)

В июле 2026 года RL-обучение DeepSeek-V4 Flash было запущено на AMD Instinct MI355X с помощью Miles.


Агентные среды и диффузионные модели

Miles позволяет обучать агентов для написания кода и управления компьютером через коннекторы к Harbor, HUD, NeMo Gym, OpenEnv, Verifiers и другим платформам — с песочницами на AgentENV, Daytona, E2B или Modal.

Для диффузионных моделей доступны Flow-GRPO, DiffusionNFT и SFT на движке sglang-diffusion и трейнере FSDP2 — в рамках Miles-diffusion.

💡 Быстрый старт

Пример запуска FP8 GRPO-обучения для Qwen3:

python train.py \
  --advantage-estimator grpo \
  --model-name qwen3-30b-a3b \
  --hf-checkpoint /path/to/qwen3-30b-a3b-hf \
  --rollout-batch-size 512 \
  --n-samples-per-prompt 8

Документация и пример быстрого старта — на radixark.mintlify.app.


Контекст: зачем это нужно отрасли

Рынок AI-платформ растёт с $109,9 млрд в 2025 году к $181,3 млрд в 2026-м при CAGR 28,7% до 2030 года, однако 45,5% лиц, принимающих решения в области ИИ, называют высокую вычислительную стоимость и инфраструктурные требования главным барьером для внедрения.

Фреймворк Miles от RadixArk устраняет этот барьер, объединяя open-source инструменты в единый стек для крупномасштабного RL post-training LLM, существенно снижая вычислительные затраты и инженерную сложность.

⚠ Важно для команд
Miles ориентирован на корпоративное использование и требует серьёзной GPU-инфраструктуры (от NVIDIA H100/A100 или AMD MI300X). Для небольших исследовательских проектов авторы рекомендуют рассматривать родительский фреймворк slime как более лёгкую альтернативу.

Miles v0.1 доступен на GitHub. Сообщество развивается в Slack-канале #miles-rl, документация — на официальном сайте radixark.mintlify.app.