KTransformers: запуск 100B+ моделей на потребительском железе
KTransformers — фреймворк для гетерогенного инференса LLM на CPU+GPU. Поддержка MiniMax-M3, GLM-5.2, DeepSeek-R1, тонкая настройка через LLaMA-Factory.
KTransformers позволяет запускать гигантские LLM на обычном железе
KTransformers — исследовательский проект, сфокусированный на эффективном инференсе и тонкой настройке больших языковых моделей через CPU-GPU гетерогенные вычисления. Используя совместную работу CPU и GPU, фреймворк позволяет разворачивать топовые модели с 100B+ параметрами локально — достаточно одной RTX 5090 с 32 ГБ видеопамяти. Свежие обновления добавили поддержку MiniMax-M3 и GLM-5.2, а сам проект уже собрал более 17 тысяч звёзд на GitHub.
Что умеет KTransformers
Проект предоставляет два пользовательских модуля из дерева исходников kt-kernel: Inference (инференс) и SFT (supervised fine-tuning, тонкая настройка с учителем).
Инференс: горячие эксперты — на GPU, холодные — на CPU
KTransformers реализует концепцию гетерогенного инференса: наиболее востребованные «горячие» эксперты MoE-модели (Mixture-of-Experts — смесь экспертов) размещаются на GPU, а менее используемые «холодные» — выгружаются в оперативную память CPU.
Ключевые возможности модуля инференса:
- AMX/AVX ускорение: оптимизированные ядра Intel AMX и AVX512/AVX2 для INT4/INT8-квантованного инференса
- MoE-оптимизация: NUMA-aware управление памятью для эффективной работы с экспертами
- Квантование: поддержка INT4/INT8 на стороне CPU и GPTQ на стороне GPU
- Интеграция с SGLang: чистый Python API для production-сервинга
Производительность на реальном железе
| Модель | Конфигурация | Суммарный throughput | Throughput на вывод |
|---|---|---|---|
| DeepSeek-R1-0528 (FP8) | 8×L20 GPU + Xeon Gold 6454S | 227,85 tok/s | 87,58 tok/s (8 потоков) |
| DeepSeek-R1/V3 (Q4_K_M) | 1× RTX 4090 + 382 GB DRAM | до 28× быстрее llama.cpp | — |
Ещё в феврале 2025 года была добавлена поддержка DeepSeek-R1 и V3 на одной GPU (24 GB VRAM) или нескольких GPU и 382 ГБ оперативной памяти — с ускорением до 3–28× по сравнению с альтернативами.
Запустить kt-kernel можно буквально двумя командами:
cd kt-kernel
pip install .
После этого доступен чистый Python API для интеграции с SGLang и другими фреймворками.
SFT: тонкая настройка 100B+ моделей на 4×RTX 4090
Модуль SFT реализован как интеграция KTransformers с LLaMA-Factory для тонкой настройки сверхбольших MoE-моделей. Это позволяет дообучать модели с 100B+ параметрами с полными параметрами на потребительских GPU — без дорогих многогрядных кластеров.
Производительность SFT:
| Модель | Память GPU | Скорость обучения | Железо |
|---|---|---|---|
| DeepSeek-V3 | ~80 ГБ суммарно | 3,7 it/s | 4× RTX 4090 |
| DeepSeek-R1 | ~80 ГБ суммарно | 3,7 it/s | 4× RTX 4090 |
| Qwen3-30B-A3B | ~24 ГБ суммарно | 8+ it/s | 1× RTX 4090 |
Скорость обучения в 6–12 раз выше, чем у ZeRO-Offload — при вдвое меньшем потреблении CPU-памяти.
Последние обновления: MiniMax-M3 и GLM-5.2
21 июня 2026 года была добавлена поддержка MiniMax-M3 в день выхода (Day0). Туториал демонстрирует запуск инференса MiniMax-M3 через SGLang с KT-Kernel для CPU-GPU гетерогенного инференса — разреженная архитектура M3 со 128 маршрутизируемыми экспертами эффективно выгружается на CPU.
17 июня добавлена поддержка GLM-5.2: инференс запускается через SGLang с KT-Kernel, «горячие» эксперты остаются на GPU, «холодные» выгружаются на CPU.
2026: DeepSeek-V4-Flash, MiniMax-M2.5, Kimi-K2.5
2025: Kimi-K2, Kimi-K2-Thinking, Qwen3-Next, GLM4-MoE, SmallThinker, LLaMA 4, Qwen3MoE
Ускорители: NVIDIA (CUDA), AMD (ROCm), Intel Arc, Ascend NPU
Архитектура работы
graph TD
A[Запрос пользователя] --> B[SGLang сервер]
B --> C{KT-Kernel планировщик}
C --> D["Горячие эксперты → GPU\n(быстрый доступ)"]
C --> E["Холодные эксперты → CPU\n(NUMA-aware)"]
D --> F[Объединение результатов]
E --> F
F --> G[Ответ модели]
Хронология ключевых обновлений 2026 года
За первую половину 2026 года KTransformers получил поддержку DeepSeek-V4-Flash (май), вышел релиз v0.6.1 с обновлёнными документами Inference и SFT Quick Start (апрель), добавлен AVX2-only бэкенд для CPU-инференса (март).
В январе 2026 года реализованы CPU-GPU Expert Scheduling (планирование экспертов), Native BF16 и FP8 per channel precision, а также AutoDL — единое окружение для тонкой настройки и инференса.
В мае проект был представлен на конференции GOSIM Paris 2026 в треке «Agentic AI on Edge» — с демонстрацией производительности инференса на потребительском железе.
Кто стоит за проектом
Научная статья по KTransformers опубликована в рамках ACM SIGOPS 31st Symposium on Operating Systems Principles (2025). Проект разрабатывается лабораторией MADSys Lab Университета Цинхуа, компанией Approaching.AI и командой 9#AISoft при участии open-source сообщества.
archive/ для справки. Актуальная разработка ведётся в модулях kt-kernel (инференс) и SFT-пайплайне через LLaMA-Factory.