OpenAI Jalapeño: собственный чип обошёл Nvidia Blackwell
OpenAI представила чип Jalapeño на Hot Chips 2026: ASIC для LLM-инференса превзошёл Nvidia GB300 по …
OpenAI представила чип Jalapeño на Hot Chips 2026: ASIC для LLM-инференса превзошёл Nvidia GB300 по …
OpenAI и Cerebras запустили режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду, ускорение в 14× …
vLLM — открытый фреймворк для высокопроизводительного инференса LLM. Поддерживает 200+ моделей, …
Полное руководство по ускорению инференса LLM: KV-кэш, квантизация, спекулятивное декодирование, MoE …
Google представила TPU 8-го поколения: два специализированных чипа TPU 8t и TPU 8i для обучения и …
Ollama — CLI-инструмент для локального запуска LLM. Обзор возможностей, поддерживаемые модели, …
Google запустил два новых уровня инференса в Gemini API — Flex со скидкой 50% и Priority с …
LM Studio — бесплатное десктопное приложение для запуска LLM локально. Обзор возможностей, сравнение …
Разбираем путь запроса к LLM: фазы prefill и decode, KV-кэш, speculative decoding и оптимизации, …