macOS VM + llama.cpp: в 16× быстрее на Apple Silicon
Как команда Cua разогнала LLM-инференс внутри macOS VM до 98% скорости bare-metal с помощью шима …
Как команда Cua разогнала LLM-инференс внутри macOS VM до 98% скорости bare-metal с помощью шима …
Сальваторе Санфилиппо выпустил DwarfStar — нативный inference-движок для запуска DeepSeek V4 Flash и …
Подробный разбор руководства Jamesob по запуску топовых LLM на своём железе: железо, квантизация, …
Разработчики на Hacker News делятся реальным опытом замены Claude и GPT на локальные модели. Что …
llama.cpp получил поддержку gpt-oss с нативным MXFP4, мультимодальный llama-server и интеграцию с …
Ollama — CLI-инструмент для локального запуска LLM. Обзор возможностей, поддерживаемые модели, …
LM Studio — бесплатное десктопное приложение для запуска LLM локально. Обзор возможностей, сравнение …
Как запустить большую языковую модель локально: выбор железа, софта, модели и пошаговая настройка …
Как с помощью квантования запустить большие языковые модели на обычном ПК. Методы GPTQ, AWQ, GGUF, …