NVIDIA Model Optimizer: единая библиотека оптимизации ИИ-моделей
NVIDIA ModelOpt объединяет квантизацию, прунинг, дистилляцию и NAS в одну Python-библиотеку. W4A4 NVFP4 + QAD даёт до 1.30× прироста throughput над BF16.
Единая библиотека оптимизации нейросетей от NVIDIA
NVIDIA Model Optimizer (ModelOpt) — библиотека, объединяющая передовые техники оптимизации моделей: квантизацию, дистилляцию, прунинг, Speculative Decoding и разреженность. Оптимизированные чекпоинты сразу готовы к развёртыванию в инференс-фреймворках: SGLang, TensorRT-LLM, TensorRT и vLLM. Последние обновления библиотеки показывают, что NVIDIA последовательно расширяет охват моделей и форматов точности, делая агрессивное сжатие более доступным.
Что такое ModelOpt и зачем он нужен
До появления ModelOpt ландшафт инструментов квантизации был фрагментирован: AutoAWQ для INT4, SmoothQuant для INT8, разные форки GPTQ и отдельные пути для FP8 через Transformer Engine. Переключение между форматами означало смену инструментов, а совмещение квантизации с прунингом требовало склейки несовместимых библиотек.
NVIDIA ModelOpt консолидирует всё это в одну библиотеку. Она поддерживает форматы FP4, FP8, INT8 и INT4 с алгоритмами SmoothQuant, AWQ, SVDQuant и Double Quantization — как для post-training quantization, так и для quantization-aware training.
Ключевые техники оптимизации
| Техника | Что даёт | Поддерживаемые форматы |
|---|---|---|
| Post-Training Quantization (PTQ) | Сжатие 2–4× без переобучения | FP4, FP8, INT4, INT8 |
| Quantization-Aware Training (QAT) | Восстановление точности после PTQ | FP4, FP8 |
| Quantization-Aware Distillation (QAD) | Дистилляция + квантизация совместно | NVFP4 W4A4 |
| Pruning (прунинг) | Удаление лишних весов | Общий, Megatron-Bridge |
| Distillation (дистилляция) | Обучение малой модели у большой | HF, Megatron, NeMo |
| Speculative Decoding | Предсказание дополнительных токенов | HF, Megatron-LM |
| Sparsity (разреженность) | Хранение только ненулевых параметров | Hugging Face |
Главное обновление: W4A4 NVFP4 + QAD для Qwen3.6-35B-A3B
16 сентября 2026 года NVIDIA опубликовала сквозной туториал по связке W4A4 NVFP4 + Quantization-Aware Distillation (QAD) для модели Qwen3.6-35B-A3B.
Техника W4A4 — достаточно агрессивная, чтобы одно лишь PTQ оставляло заметный разрыв в точности; именно для его устранения и существует QAD.
Почему W4A4, а не weight-only NVFP4: W4A16 оказался медленнее BF16 в 10 из 12 измеренных форм — активация в BF16 принудительно переключает vLLM на Marlin dequant fallback и не задействует Blackwell FP4 tensor cores.
W4A4 превосходит BF16 в 9 из 12 форм (до 1.30×) и сжимает чекпоинт с 67 ГБ до 23 ГБ.
Как устроен пайплайн оптимизации
graph LR
A[Исходная модель\nHF / PyTorch / ONNX] --> B[PTQ\nCalibration]
B --> C{Достаточно\nточности?}
C -- Да --> D[Оптимизированный\nчекпоинт]
C -- Нет --> E[QAT / QAD\nDообучение]
E --> D
D --> F[Экспорт]
F --> G[TensorRT-LLM]
F --> H[vLLM]
F --> I[SGLang]
F --> J[TensorRT]
Другие важные новости 2026 года
AutoQuantize (август 2026): новый алгоритм AutoQuantize находит назначения смешанной точности с низкой чувствительностью с помощью градиентной оценки при заданном бюджете эффективных бит.
Local-Hessian (сентябрь 2026): метод Local-Hessian выбирает блочные масштабы NVFP4 для минимизации ошибки выхода слоя и сравнивается с алгоритмами max, MSE, Four-over-six и GPTQ.
Nemotron 3 Ultra (550B): ранее NVIDIA квантизировала гигантскую модель Nemotron 3 Ultra до NVFP4 — результат составил до 5.9× большего throughput на decode-heavy нагрузках по сравнению с конкурентом при сохранении точности BF16.
Domyn / Bielik.AI: квантизация Qwen3.6-35B-A3B в NVFP4 уменьшает дисковый размер и требования к GPU-памяти примерно в 3.06×. Аналогичный результат клиенты NVIDIA получают через Minitron pruning + distillation.
Установка и экосистема
# Стабильная версия из PyPI
pip install -U nvidia-modelopt[all]
# Из исходников (для последних функций)
git clone git@github.com:NVIDIA/Model-Optimizer.git
cd Model-Optimizer
pip install -e .[dev]
Начиная с первого полностью открытого релиза лицензия изменена с проприетарной NVIDIA и MIT на Apache 2.0. Последний релиз на PyPI датирован 23 сентября 2026 года.
ModelOpt интегрирован с NVIDIA NeMo, Megatron-LM и Hugging Face Accelerate для техник оптимизации инференса, требующих дообучения.
Почему это важно
Агрессивная квантизация W4A4 перестала быть экзотикой: с QAD разрыв в точности закрывается, а inference-throughput растёт в разы — и всё это через единый Python API.
По мере распространения архитектуры Blackwell (RTX 50-й серии, DGX Spark) именно NVFP4 W4A4 становится де-факто стандартом для production-деплоя крупных LLM. Квантизация Qwen3.6-27B в NVFP4 уменьшает память в 2.5× при потере точности менее 1%, а модель весом 19.7 ГБ способна работать на RTX PRO 6000 и DGX Spark, выдавая более 2000 токенов/с с vLLM и MTP speculative decoding.
ModelOpt закрывает важную нишу: вместо зоопарка инструментов — один пакет, который ведёт модель от «сырого» чекпоинта до задеплоенного сервиса.