SGLang: де-факто стандарт инференса LLM на 400 000 GPU
SGLang — высокопроизводительный фреймворк для запуска LLM и мультимодальных моделей. Уже на 400 000 GPU по всему миру, 25x прирост производительности на GB300.
SGLang превращается в индустриальный стандарт для запуска больших языковых моделей
Как open-source движок для инференса LLM, SGLang стал де-факто отраслевым стандартом — его развёртывания работают более чем на 400 000 GPU по всему миру. Ежедневно фреймворк генерирует триллионы токенов в продакшен-среде. За последние месяцы проект получил крупные технические обновления, расширил поддержку железа и закрепился у ключевых игроков отрасли.
Что такое SGLang
SGLang — высокопроизводительный serving-фреймворк, который снижает вычислительные издержки инференса LLM за счёт совместного проектирования языка программирования фронтенда и среды выполнения бэкенда.
Ключевая технология — RadixAttention: техника управления памятью, которая агрессивно кэширует и переиспользует KV-состояния (key-value, ключ-значение) между запросами, что даёт значительный прирост производительности по сравнению со стандартными движками типа vLLM в сценариях с высоким перекрытием префиксов.
Главные события 2026 года
Производительность на новом железе
Сотрудничество SGLang с NVIDIA принесло экстраординарные результаты: в феврале 2026 года команды объявили о достижении до 25x прироста производительности при запуске DeepSeek R1 на стойке NVIDIA GB300 NVL72 по сравнению с H200.
В июле 2026 года было опубликовано руководство по обслуживанию агентных нагрузок GLM5.2 NVFP4 с SGLang — достигнута скорость 500 TPS (токенов в секунду) за две недели.
Поддержка новых моделей день-в-день (Day-0)
В июле 2026 SGLang и Miles добавили поддержку Kimi K3 в день выхода модели. В июне фреймворк получил поддержку Nemotron 3 Ultra, Nemotron 3 Super и Higgs Audio v3 TTS. В апреле была добавлена поддержка DeepSeek-V4 в день релиза.
Speculative Decoding нового поколения
В июне 2026 года вышла статья о следующем поколении спекулятивного декодирования — технологиях DFlash и Spec V2.
TPU и расширение железной базы
В июле 2026 года RadixArk совместно с Google обеспечили полную поддержку возможностей SGLang на Google TPU. Это продолжение работы, начатой ещё в октябре 2025: тогда SGLang получил нативную поддержку TPU через бэкенд SGLang-Jax.
Кто использует SGLang в продакшене
Среди пользователей SGLang — xAI, NVIDIA, AMD, Intel, LinkedIn, Cursor, Oracle Cloud, Google Cloud, Microsoft Azure, AWS, а также университеты MIT, UCLA, Stanford, UC Berkeley, Tsinghua University и крупные технологические компании — Baidu, AntGroup, Alibaba, Tencent.
Например, xAI использует SGLang для обслуживания своей флагманской модели Grok 3. Microsoft Azure применяет SGLang для запуска DeepSeek R1 на AMD GPU.
«SGLang стал де-факто отраслевым стандартом» — GitHub-репозиторий проекта
SGLang vs vLLM: сравнение
| Параметр | SGLang | vLLM |
|---|---|---|
| Ключевая технология кэша | RadixAttention | PagedAttention |
| Преимущество на H100 | +29% throughput | Базовый уровень |
| Лучший сценарий | Multi-turn, RAG, агенты | Уникальные промпты |
| Поддержка моделей | Все основные LLM + мультимодальные | Широкий список |
| Железо | NVIDIA, AMD, TPU, Ascend | Преимущественно NVIDIA |
| Экосистема | Активно растёт | Крупнее (3x контрибьюторов) |
SGLang обеспечивает на 29% более высокий throughput, чем vLLM, на GPU H100 и в 3.1 раза более быстрый инференс DeepSeek V3.
Архитектура и место в экосистеме RL
SGLang активно используется не только для инференса, но и как backend для обучения с подкреплением (Reinforcement Learning). Фреймворк интегрирован с такими системами пост-обучения, как AReaL, Miles, slime, Tunix и verl.
graph TD
A[Запрос пользователя] --> B[SGLang Frontend]
B --> C[CPU Scheduler]
C --> D{Кэш RadixAttention}
D -->|Попадание в кэш| E[Переиспользование KV-состояния]
D -->|Промах кэша| F[Prefill на GPU]
E --> G[Decode / Генерация]
F --> G
G --> H[Ответ]
style D fill:#f0a500,color:#000
style E fill:#22c55e,color:#fff
style F fill:#3b82f6,color:#fff
Быстрый старт
# Установка SGLang
pip install sglang[all]
# Запуск сервера (пример с Llama-3)
python -m sglang.launch_server \
--model-path meta-llama/Meta-Llama-3-8B-Instruct \
--port 30000
После запуска сервера доступен OpenAI-совместимый API на http://localhost:30000.
Итог
SGLang достиг примечательного результата: фреймворк обеспечивает инференс более чем на 400 000 GPU по всему миру, ежедневно генерируя триллионы токенов в продакшен-среде. При этом проект остаётся полностью открытым — он размещён под некоммерческой организацией LMSYS и принимает вклад от сообщества.
Для разработчиков, которые ищут высокопроизводительное решение для деплоя LLM — особенно в сценариях с повторяющимися контекстами (чат-боты, RAG-системы, агенты) — SGLang сегодня является одним из лучших выборов в open-source экосистеме.