<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>MacOS VM on AI-Uchi — Всё об искусственном интеллекте</title><link>https://ai-uchi.ru/tags/macos-vm/</link><description>Recent content in MacOS VM on AI-Uchi — Всё об искусственном интеллекте</description><generator>Hugo</generator><language>ru</language><lastBuildDate>Thu, 13 Aug 2026 08:00:00 +0300</lastBuildDate><atom:link href="https://ai-uchi.ru/tags/macos-vm/index.xml" rel="self" type="application/rss+xml"/><item><title>macOS VM + llama.cpp: в 16× быстрее на Apple Silicon</title><link>https://ai-uchi.ru/articles/macos-vm-llama-cpp-apple-silicon-uskorenie/</link><pubDate>Thu, 13 Aug 2026 08:00:00 +0300</pubDate><guid>https://ai-uchi.ru/articles/macos-vm-llama-cpp-apple-silicon-uskorenie/</guid><description>&lt;h2 id="когда-медленная-vm--это-просто-неправильно-настроенный-metal"&gt;Когда «медленная VM» — это просто неправильно настроенный Metal&lt;/h2&gt;
&lt;p&gt;Представьте: вы запускаете llama.cpp внутри macOS-виртуальной машины на M1 Ultra, ожидаете хоть какое-то GPU-ускорение — и получаете 432 токена в секунду при обработке промпта. Кажется, неплохо? Только вот на bare-metal тот же чип выдаёт тысячи токенов. Виноват не гипервизор, не память и не квантизация — виновата пара строк в коде, из-за которых llama.cpp выбирает не те Metal-ядра внутри гостевой ОС.&lt;/p&gt;
&lt;p&gt;Именно эту проблему вскрыла и решила команда проекта &lt;a href="https://github.com/trycua/cua"&gt;Cua&lt;/a&gt;. Результат — на M1 Ultra TinyLlama 1.1B в llama.cpp обрабатывает промпты в &lt;strong&gt;11,08×&lt;/strong&gt; быстрее, а генерирует токены в &lt;strong&gt;16,36×&lt;/strong&gt; быстрее по сравнению со стандартной VM без патча. И это не теория: обработка промптов достигла 98% от результата bare-metal.&lt;/p&gt;</description></item></channel></rss>