SGLang превращается в индустриальный стандарт для запуска больших языковых моделей

Как open-source движок для инференса LLM, SGLang стал де-факто отраслевым стандартом — его развёртывания работают более чем на 400 000 GPU по всему миру. Ежедневно фреймворк генерирует триллионы токенов в продакшен-среде. За последние месяцы проект получил крупные технические обновления, расширил поддержку железа и закрепился у ключевых игроков отрасли.


Что такое SGLang

SGLang — высокопроизводительный serving-фреймворк, который снижает вычислительные издержки инференса LLM за счёт совместного проектирования языка программирования фронтенда и среды выполнения бэкенда.

Ключевая технология — RadixAttention: техника управления памятью, которая агрессивно кэширует и переиспользует KV-состояния (key-value, ключ-значение) между запросами, что даёт значительный прирост производительности по сравнению со стандартными движками типа vLLM в сценариях с высоким перекрытием префиксов.

ℹ Ключевые возможности SGLang
Fast Runtime (быстрая среда выполнения): RadixAttention для кэширования префиксов, планировщик CPU без накладных расходов, disaggregation (разделение) prefill/decode, speculative decoding (спекулятивное декодирование), continuous batching, paged attention, параллелизм на уровне тензоров/конвейеров/экспертов, квантизация FP4/FP8/INT4/AWQ/GPTQ и multi-LoRA batching.

Главные события 2026 года

Производительность на новом железе

Сотрудничество SGLang с NVIDIA принесло экстраординарные результаты: в феврале 2026 года команды объявили о достижении до 25x прироста производительности при запуске DeepSeek R1 на стойке NVIDIA GB300 NVL72 по сравнению с H200.

В июле 2026 года было опубликовано руководство по обслуживанию агентных нагрузок GLM5.2 NVFP4 с SGLang — достигнута скорость 500 TPS (токенов в секунду) за две недели.

Поддержка новых моделей день-в-день (Day-0)

В июле 2026 SGLang и Miles добавили поддержку Kimi K3 в день выхода модели. В июне фреймворк получил поддержку Nemotron 3 Ultra, Nemotron 3 Super и Higgs Audio v3 TTS. В апреле была добавлена поддержка DeepSeek-V4 в день релиза.

Speculative Decoding нового поколения

В июне 2026 года вышла статья о следующем поколении спекулятивного декодирования — технологиях DFlash и Spec V2.

TPU и расширение железной базы

В июле 2026 года RadixArk совместно с Google обеспечили полную поддержку возможностей SGLang на Google TPU. Это продолжение работы, начатой ещё в октябре 2025: тогда SGLang получил нативную поддержку TPU через бэкенд SGLang-Jax.

💡 Поддерживаемое железо
SGLang работает на: NVIDIA GPU (GB200/B300/H100/A100/Spark/5090), AMD GPU (MI355/MI300), Intel Xeon CPU, Google TPU, Ascend NPU и других платформах.

Кто использует SGLang в продакшене

Среди пользователей SGLang — xAI, NVIDIA, AMD, Intel, LinkedIn, Cursor, Oracle Cloud, Google Cloud, Microsoft Azure, AWS, а также университеты MIT, UCLA, Stanford, UC Berkeley, Tsinghua University и крупные технологические компании — Baidu, AntGroup, Alibaba, Tencent.

Например, xAI использует SGLang для обслуживания своей флагманской модели Grok 3. Microsoft Azure применяет SGLang для запуска DeepSeek R1 на AMD GPU.

«SGLang стал де-факто отраслевым стандартом» — GitHub-репозиторий проекта


SGLang vs vLLM: сравнение

ПараметрSGLangvLLM
Ключевая технология кэшаRadixAttentionPagedAttention
Преимущество на H100+29% throughputБазовый уровень
Лучший сценарийMulti-turn, RAG, агентыУникальные промпты
Поддержка моделейВсе основные LLM + мультимодальныеШирокий список
ЖелезоNVIDIA, AMD, TPU, AscendПреимущественно NVIDIA
ЭкосистемаАктивно растётКрупнее (3x контрибьюторов)

SGLang обеспечивает на 29% более высокий throughput, чем vLLM, на GPU H100 и в 3.1 раза более быстрый инференс DeepSeek V3.

⚠ Когда SGLang не даёт преимущества
Когда каждый промпт уникален (пакетная генерация контента, однократная классификация) — переиспользовать нечего. В тестах на уникальных однократных промптах vLLM обогнал SGLang: 60 tok/s против 52.7 tok/s.

Архитектура и место в экосистеме RL

SGLang активно используется не только для инференса, но и как backend для обучения с подкреплением (Reinforcement Learning). Фреймворк интегрирован с такими системами пост-обучения, как AReaL, Miles, slime, Tunix и verl.


graph TD
    A[Запрос пользователя] --> B[SGLang Frontend]
    B --> C[CPU Scheduler]
    C --> D{Кэш RadixAttention}
    D -->|Попадание в кэш| E[Переиспользование KV-состояния]
    D -->|Промах кэша| F[Prefill на GPU]
    E --> G[Decode / Генерация]
    F --> G
    G --> H[Ответ]
    style D fill:#f0a500,color:#000
    style E fill:#22c55e,color:#fff
    style F fill:#3b82f6,color:#fff


Быстрый старт

# Установка SGLang
pip install sglang[all]

# Запуск сервера (пример с Llama-3)
python -m sglang.launch_server \
  --model-path meta-llama/Meta-Llama-3-8B-Instruct \
  --port 30000

После запуска сервера доступен OpenAI-совместимый API на http://localhost:30000.


Итог

SGLang достиг примечательного результата: фреймворк обеспечивает инференс более чем на 400 000 GPU по всему миру, ежедневно генерируя триллионы токенов в продакшен-среде. При этом проект остаётся полностью открытым — он размещён под некоммерческой организацией LMSYS и принимает вклад от сообщества.

Для разработчиков, которые ищут высокопроизводительное решение для деплоя LLM — особенно в сценариях с повторяющимися контекстами (чат-боты, RAG-системы, агенты) — SGLang сегодня является одним из лучших выборов в open-source экосистеме.