KTransformers позволяет запускать гигантские LLM на обычном железе

KTransformers — исследовательский проект, сфокусированный на эффективном инференсе и тонкой настройке больших языковых моделей через CPU-GPU гетерогенные вычисления. Используя совместную работу CPU и GPU, фреймворк позволяет разворачивать топовые модели с 100B+ параметрами локально — достаточно одной RTX 5090 с 32 ГБ видеопамяти. Свежие обновления добавили поддержку MiniMax-M3 и GLM-5.2, а сам проект уже собрал более 17 тысяч звёзд на GitHub.


Что умеет KTransformers

Проект предоставляет два пользовательских модуля из дерева исходников kt-kernel: Inference (инференс) и SFT (supervised fine-tuning, тонкая настройка с учителем).

Инференс: горячие эксперты — на GPU, холодные — на CPU

KTransformers реализует концепцию гетерогенного инференса: наиболее востребованные «горячие» эксперты MoE-модели (Mixture-of-Experts — смесь экспертов) размещаются на GPU, а менее используемые «холодные» — выгружаются в оперативную память CPU.

ℹ Что такое MoE?
Mixture-of-Experts (смесь экспертов) — архитектура, при которой модель активирует только часть своих параметров для каждого токена. Это позволяет иметь огромное число параметров при относительно небольших вычислительных затратах на один запрос.

Ключевые возможности модуля инференса:

  • AMX/AVX ускорение: оптимизированные ядра Intel AMX и AVX512/AVX2 для INT4/INT8-квантованного инференса
  • MoE-оптимизация: NUMA-aware управление памятью для эффективной работы с экспертами
  • Квантование: поддержка INT4/INT8 на стороне CPU и GPTQ на стороне GPU
  • Интеграция с SGLang: чистый Python API для production-сервинга

Производительность на реальном железе

МодельКонфигурацияСуммарный throughputThroughput на вывод
DeepSeek-R1-0528 (FP8)8×L20 GPU + Xeon Gold 6454S227,85 tok/s87,58 tok/s (8 потоков)
DeepSeek-R1/V3 (Q4_K_M)1× RTX 4090 + 382 GB DRAMдо 28× быстрее llama.cpp

Ещё в феврале 2025 года была добавлена поддержка DeepSeek-R1 и V3 на одной GPU (24 GB VRAM) или нескольких GPU и 382 ГБ оперативной памяти — с ускорением до 3–28× по сравнению с альтернативами.

💡 Для разработчиков

Запустить kt-kernel можно буквально двумя командами:

cd kt-kernel
pip install .

После этого доступен чистый Python API для интеграции с SGLang и другими фреймворками.


SFT: тонкая настройка 100B+ моделей на 4×RTX 4090

Модуль SFT реализован как интеграция KTransformers с LLaMA-Factory для тонкой настройки сверхбольших MoE-моделей. Это позволяет дообучать модели с 100B+ параметрами с полными параметрами на потребительских GPU — без дорогих многогрядных кластеров.

Производительность SFT:

МодельПамять GPUСкорость обученияЖелезо
DeepSeek-V3~80 ГБ суммарно3,7 it/s4× RTX 4090
DeepSeek-R1~80 ГБ суммарно3,7 it/s4× RTX 4090
Qwen3-30B-A3B~24 ГБ суммарно8+ it/s1× RTX 4090

Скорость обучения в 6–12 раз выше, чем у ZeRO-Offload — при вдвое меньшем потреблении CPU-памяти.


Последние обновления: MiniMax-M3 и GLM-5.2

21 июня 2026 года была добавлена поддержка MiniMax-M3 в день выхода (Day0). Туториал демонстрирует запуск инференса MiniMax-M3 через SGLang с KT-Kernel для CPU-GPU гетерогенного инференса — разреженная архитектура M3 со 128 маршрутизируемыми экспертами эффективно выгружается на CPU.

17 июня добавлена поддержка GLM-5.2: инференс запускается через SGLang с KT-Kernel, «горячие» эксперты остаются на GPU, «холодные» выгружаются на CPU.

📝 Другие поддерживаемые модели

2026: DeepSeek-V4-Flash, MiniMax-M2.5, Kimi-K2.5

2025: Kimi-K2, Kimi-K2-Thinking, Qwen3-Next, GLM4-MoE, SmallThinker, LLaMA 4, Qwen3MoE

Ускорители: NVIDIA (CUDA), AMD (ROCm), Intel Arc, Ascend NPU


Архитектура работы


graph TD
    A[Запрос пользователя] --> B[SGLang сервер]
    B --> C{KT-Kernel планировщик}
    C --> D["Горячие эксперты → GPU\n(быстрый доступ)"]
    C --> E["Холодные эксперты → CPU\n(NUMA-aware)"]
    D --> F[Объединение результатов]
    E --> F
    F --> G[Ответ модели]


Хронология ключевых обновлений 2026 года

За первую половину 2026 года KTransformers получил поддержку DeepSeek-V4-Flash (май), вышел релиз v0.6.1 с обновлёнными документами Inference и SFT Quick Start (апрель), добавлен AVX2-only бэкенд для CPU-инференса (март).

В январе 2026 года реализованы CPU-GPU Expert Scheduling (планирование экспертов), Native BF16 и FP8 per channel precision, а также AutoDL — единое окружение для тонкой настройки и инференса.

В мае проект был представлен на конференции GOSIM Paris 2026 в треке «Agentic AI on Edge» — с демонстрацией производительности инференса на потребительском железе.


Кто стоит за проектом

Научная статья по KTransformers опубликована в рамках ACM SIGOPS 31st Symposium on Operating Systems Principles (2025). Проект разрабатывается лабораторией MADSys Lab Университета Цинхуа, компанией Approaching.AI и командой 9#AISoft при участии open-source сообщества.

⚠ Важно
Оригинальный монолитный код KTransformers перенесён в директорию archive/ для справки. Актуальная разработка ведётся в модулях kt-kernel (инференс) и SFT-пайплайне через LLaMA-Factory.

GitHub: github.com/kvcache-ai/ktransformers