SGLang: де-факто стандарт инференса LLM на 400 000 GPU
SGLang — высокопроизводительный фреймворк для запуска LLM и мультимодальных моделей. Уже на 400 000 …
SGLang — высокопроизводительный фреймворк для запуска LLM и мультимодальных моделей. Уже на 400 000 …
Gartner: затраты на инференс в агентных AI-воркфлоу вырастут более чем в 5 раз к 2028 году. …
OpenAI представила чип Jalapeño на Hot Chips 2026: ASIC для LLM-инференса превзошёл Nvidia GB300 по …
OpenAI и Cerebras запустили режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду, ускорение в 14× …
vLLM — открытый фреймворк для высокопроизводительного инференса LLM. Поддерживает 200+ моделей, …
Полное руководство по ускорению инференса LLM: KV-кэш, квантизация, спекулятивное декодирование, MoE …
Google представила TPU 8-го поколения: два специализированных чипа TPU 8t и TPU 8i для обучения и …
Ollama — CLI-инструмент для локального запуска LLM. Обзор возможностей, поддерживаемые модели, …
Google запустил два новых уровня инференса в Gemini API — Flex со скидкой 50% и Priority с …
LM Studio — бесплатное десктопное приложение для запуска LLM локально. Обзор возможностей, сравнение …