16
Jul
news
vLLM: главный движок для запуска LLM в продакшене
vLLM — открытый фреймворк для высокопроизводительного инференса LLM. Поддерживает 200+ моделей, …
→
vLLM — открытый фреймворк для высокопроизводительного инференса LLM. Поддерживает 200+ моделей, …
LMCache — открытый слой управления KV Cache для LLM. Новая MP-архитектура снижает TTFT в 13 раз и …
Полное руководство по ускорению инференса LLM: KV-кэш, квантизация, спекулятивное декодирование, MoE …
В Lemonade v10.4 добавлен экспериментальный бэкенд vLLM ROCm для AMD Strix Halo. Запуск модели — …