<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Metal on AI-Uchi — Всё об искусственном интеллекте</title><link>https://ai-uchi.ru/tags/metal/</link><description>Recent content in Metal on AI-Uchi — Всё об искусственном интеллекте</description><generator>Hugo</generator><language>ru</language><lastBuildDate>Thu, 13 Aug 2026 08:00:00 +0300</lastBuildDate><atom:link href="https://ai-uchi.ru/tags/metal/index.xml" rel="self" type="application/rss+xml"/><item><title>macOS VM + llama.cpp: в 16× быстрее на Apple Silicon</title><link>https://ai-uchi.ru/articles/macos-vm-llama-cpp-apple-silicon-uskorenie/</link><pubDate>Thu, 13 Aug 2026 08:00:00 +0300</pubDate><guid>https://ai-uchi.ru/articles/macos-vm-llama-cpp-apple-silicon-uskorenie/</guid><description>&lt;h2 id="когда-медленная-vm--это-просто-неправильно-настроенный-metal"&gt;Когда «медленная VM» — это просто неправильно настроенный Metal&lt;/h2&gt;
&lt;p&gt;Представьте: вы запускаете llama.cpp внутри macOS-виртуальной машины на M1 Ultra, ожидаете хоть какое-то GPU-ускорение — и получаете 432 токена в секунду при обработке промпта. Кажется, неплохо? Только вот на bare-metal тот же чип выдаёт тысячи токенов. Виноват не гипервизор, не память и не квантизация — виновата пара строк в коде, из-за которых llama.cpp выбирает не те Metal-ядра внутри гостевой ОС.&lt;/p&gt;
&lt;p&gt;Именно эту проблему вскрыла и решила команда проекта &lt;a href="https://github.com/trycua/cua"&gt;Cua&lt;/a&gt;. Результат — на M1 Ultra TinyLlama 1.1B в llama.cpp обрабатывает промпты в &lt;strong&gt;11,08×&lt;/strong&gt; быстрее, а генерирует токены в &lt;strong&gt;16,36×&lt;/strong&gt; быстрее по сравнению со стандартной VM без патча. И это не теория: обработка промптов достигла 98% от результата bare-metal.&lt;/p&gt;</description></item><item><title>DwarfStar: локальный движок для DeepSeek V4 Flash и PRO</title><link>https://ai-uchi.ru/news/dwarfstar-lokalnyy-dvigatel-deepseek-v4/</link><pubDate>Mon, 03 Aug 2026 03:10:52 +0300</pubDate><guid>https://ai-uchi.ru/news/dwarfstar-lokalnyy-dvigatel-deepseek-v4/</guid><description>&lt;h2 id="запуск-frontier-модели-без-облака--теперь-на-вашем-macbook"&gt;Запуск frontier-модели без облака — теперь на вашем MacBook&lt;/h2&gt;
&lt;p&gt;Сальваторе Санфилиппо (antirez) — итальянский разработчик и автор Redis — тихо выпустил написанный с нуля на C inference-движок, который запускает DeepSeek V4 локально и умеет работать с Claude Code. Проект называется &lt;strong&gt;DwarfStar&lt;/strong&gt; и оптимизирован прежде всего под &lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt;, а на машинах с очень большим объёмом памяти поддерживает и &lt;strong&gt;DeepSeek V4 PRO&lt;/strong&gt;, а также &lt;strong&gt;GLM 5.2&lt;/strong&gt;. Движок написан на C, GPU-бэкенды реализованы на Objective-C (Metal), CUDA и HIP/ROCm.&lt;/p&gt;</description></item><item><title>Gemma 4 26B в 2 ГБ RAM: магия TurboFieldfare на Mac</title><link>https://ai-uchi.ru/articles/gemma-4-26b-2gb-ram-turbofieldfare-mac/</link><pubDate>Fri, 31 Jul 2026 08:00:00 +0300</pubDate><guid>https://ai-uchi.ru/articles/gemma-4-26b-2gb-ram-turbofieldfare-mac/</guid><description>&lt;h2 id="введение-26-миллиардов-параметров-в-кармане"&gt;Введение: 26 миллиардов параметров в кармане&lt;/h2&gt;
&lt;p&gt;Представьте: вы открываете MacBook Air с базовыми 8 ГБ памяти — и запускаете языковую модель с 26 миллиардами параметров. Без облака, без подписки, без GPU за $5000. Именно это стало реальностью благодаря проекту &lt;strong&gt;TurboFieldfare&lt;/strong&gt; — специализированному движку для инференса, появившемуся на Hacker News и мгновенно привлёкшему внимание разработчиков.&lt;/p&gt;
&lt;p&gt;Автор собрал специализированный движок для запуска 4-bit Gemma 4 26B-A4B-IT на любом Mac с чипом M-серии, используя около 2 ГБ оперативной памяти. Это звучит почти невозможно — ведь стандартный 4-bit вариант модели занимает 14–18 ГБ. Как это работает и почему это важно — разбираемся в этой статье.&lt;/p&gt;</description></item></channel></rss>