Единая библиотека оптимизации нейросетей от NVIDIA

NVIDIA Model Optimizer (ModelOpt) — библиотека, объединяющая передовые техники оптимизации моделей: квантизацию, дистилляцию, прунинг, Speculative Decoding и разреженность. Оптимизированные чекпоинты сразу готовы к развёртыванию в инференс-фреймворках: SGLang, TensorRT-LLM, TensorRT и vLLM. Последние обновления библиотеки показывают, что NVIDIA последовательно расширяет охват моделей и форматов точности, делая агрессивное сжатие более доступным.


Что такое ModelOpt и зачем он нужен

До появления ModelOpt ландшафт инструментов квантизации был фрагментирован: AutoAWQ для INT4, SmoothQuant для INT8, разные форки GPTQ и отдельные пути для FP8 через Transformer Engine. Переключение между форматами означало смену инструментов, а совмещение квантизации с прунингом требовало склейки несовместимых библиотек.

NVIDIA ModelOpt консолидирует всё это в одну библиотеку. Она поддерживает форматы FP4, FP8, INT8 и INT4 с алгоритмами SmoothQuant, AWQ, SVDQuant и Double Quantization — как для post-training quantization, так и для quantization-aware training.

ℹ Поддерживаемые входные форматы
ModelOpt принимает модели в форматах Hugging Face, PyTorch и ONNX — и экспортирует оптимизированный чекпоинт одной командой.

Ключевые техники оптимизации

ТехникаЧто даётПоддерживаемые форматы
Post-Training Quantization (PTQ)Сжатие 2–4× без переобученияFP4, FP8, INT4, INT8
Quantization-Aware Training (QAT)Восстановление точности после PTQFP4, FP8
Quantization-Aware Distillation (QAD)Дистилляция + квантизация совместноNVFP4 W4A4
Pruning (прунинг)Удаление лишних весовОбщий, Megatron-Bridge
Distillation (дистилляция)Обучение малой модели у большойHF, Megatron, NeMo
Speculative DecodingПредсказание дополнительных токеновHF, Megatron-LM
Sparsity (разреженность)Хранение только ненулевых параметровHugging Face

Главное обновление: W4A4 NVFP4 + QAD для Qwen3.6-35B-A3B

16 сентября 2026 года NVIDIA опубликовала сквозной туториал по связке W4A4 NVFP4 + Quantization-Aware Distillation (QAD) для модели Qwen3.6-35B-A3B.

Техника W4A4 — достаточно агрессивная, чтобы одно лишь PTQ оставляло заметный разрыв в точности; именно для его устранения и существует QAD.

Почему W4A4, а не weight-only NVFP4: W4A16 оказался медленнее BF16 в 10 из 12 измеренных форм — активация в BF16 принудительно переключает vLLM на Marlin dequant fallback и не задействует Blackwell FP4 tensor cores.

W4A4 превосходит BF16 в 9 из 12 форм (до 1.30×) и сжимает чекпоинт с 67 ГБ до 23 ГБ.

💡 Ключевой результат
W4A4 NVFP4 + QAD для Qwen3.6-35B-A3B: до 1.30× прироста throughput в vLLM по сравнению с BF16, чекпоинт в 3.1× меньше при сохранённой точности.

Как устроен пайплайн оптимизации


graph LR
    A[Исходная модель\nHF / PyTorch / ONNX] --> B[PTQ\nCalibration]
    B --> C{Достаточно\nточности?}
    C -- Да --> D[Оптимизированный\nчекпоинт]
    C -- Нет --> E[QAT / QAD\nDообучение]
    E --> D
    D --> F[Экспорт]
    F --> G[TensorRT-LLM]
    F --> H[vLLM]
    F --> I[SGLang]
    F --> J[TensorRT]


Другие важные новости 2026 года

AutoQuantize (август 2026): новый алгоритм AutoQuantize находит назначения смешанной точности с низкой чувствительностью с помощью градиентной оценки при заданном бюджете эффективных бит.

Local-Hessian (сентябрь 2026): метод Local-Hessian выбирает блочные масштабы NVFP4 для минимизации ошибки выхода слоя и сравнивается с алгоритмами max, MSE, Four-over-six и GPTQ.

Nemotron 3 Ultra (550B): ранее NVIDIA квантизировала гигантскую модель Nemotron 3 Ultra до NVFP4 — результат составил до 5.9× большего throughput на decode-heavy нагрузках по сравнению с конкурентом при сохранении точности BF16.

Domyn / Bielik.AI: квантизация Qwen3.6-35B-A3B в NVFP4 уменьшает дисковый размер и требования к GPU-памяти примерно в 3.06×. Аналогичный результат клиенты NVIDIA получают через Minitron pruning + distillation.

📝 Пример: Adobe
Adobe применила ModelOpt + TensorRT и получила 60% снижение latency диффузионных моделей и 40% сокращение совокупной стоимости владения — реальный production-кейс.

Установка и экосистема

# Стабильная версия из PyPI
pip install -U nvidia-modelopt[all]

# Из исходников (для последних функций)
git clone git@github.com:NVIDIA/Model-Optimizer.git
cd Model-Optimizer
pip install -e .[dev]

Начиная с первого полностью открытого релиза лицензия изменена с проприетарной NVIDIA и MIT на Apache 2.0. Последний релиз на PyPI датирован 23 сентября 2026 года.

ModelOpt интегрирован с NVIDIA NeMo, Megatron-LM и Hugging Face Accelerate для техник оптимизации инференса, требующих дообучения.


Почему это важно

Агрессивная квантизация W4A4 перестала быть экзотикой: с QAD разрыв в точности закрывается, а inference-throughput растёт в разы — и всё это через единый Python API.

По мере распространения архитектуры Blackwell (RTX 50-й серии, DGX Spark) именно NVFP4 W4A4 становится де-факто стандартом для production-деплоя крупных LLM. Квантизация Qwen3.6-27B в NVFP4 уменьшает память в 2.5× при потере точности менее 1%, а модель весом 19.7 ГБ способна работать на RTX PRO 6000 и DGX Spark, выдавая более 2000 токенов/с с vLLM и MTP speculative decoding.

ModelOpt закрывает важную нишу: вместо зоопарка инструментов — один пакет, который ведёт модель от «сырого» чекпоинта до задеплоенного сервиса.