Кому: тем, кто ищет «Mac mini M4 vs M5 для Ollama», «сколько RAM нужно для 13B локально» и «стоит ли ждать M5 для LLM» — и должен принять решение до закупки железа или API-подписок.

Вывод: в 2026 локальный инференс 7B–13B на Apple Silicon упирается в объём unified memory и bandwidth, а не в маркетинговые TOPS NPU. M5 даст прирост ~10–20% decode, но M4 24 ГБ уже закрывает 80% production-сценариев по лучшему price/performance.

На странице: три системных риска, матрица AI-мощности в шести измерениях, сценарная таблица, пять шагов деплоя, цифры для planning session и путь к аренде MacPull Mac mini M4.

Три системных риска при выборе железа под локальные LLM

  • 1. Ориентация на NPU вместо memory bandwidth. M5 обещает ~50–60 TOPS Neural Engine против ~38 TOPS у M4, но Ollama и llama.cpp в 2026 в основном идут через GPU+Metal. Реальный bottleneck — 120 GB/s vs ~150 GB/s bandwidth и объём RAM, а не цифра на слайде WWDC.
  • 2. Стоимость ожидания M5. Релиз Mac mini M5 традиционно отстаёт на 6–12 месяцев с премией +15–25% к list price. За полгода API-расходы команды из пяти человек на GPT-4o/Claude легко превышают годовую аренду M4 24 ГБ на MacPull.
  • 3. Переплата за «на всякий случай» 64 ГБ. Покупка топ-конфигурации ради редкого 32B inference при daily workload 7B–13B даёт utilization <10%. Аренда M4 24 ГБ на 1–3 месяца для benchmark — рациональнее, чем CAPEX «на будущее».
Технический принцип: throughput локального LLM на Apple Silicon ≈ min(RAM pool, memory bandwidth) × quantization efficiency. NPU ускоряет Core ML-модели, но не заменяет GPU-decode для Llama/Mistral в Ollama — это физический потолок, который marketing TOPS не снимает.

Матрица AI-мощности M4 vs M5: шесть измерений локального инференса

ИзмерениеMac mini M4 (24 ГБ)Mac mini M5 (прогноз)Влияние на LLM
CPU / GPU10+10 ядер~+15% single-corePrefill TTFT
NPU / Neural Engine~38 TOPS~50–60 TOPSCore ML, не Ollama
Unified memory BW120 GB/s~150 GB/sDecode tokens/s
Потолок модели13B Q4 стабильно22B Q4 комфортнееRAM > TOPS
MLX / Ollama зрелостьProduction-readyСовместимость Day 1Риск простоя
TCO entry (USD)~$599–799+15–25%ROI локального LLM
  • Price/performance tier A (7B–13B daily): M4 24 ГБ — sweet spot; прирост M5 ~10–20% decode не оправдывает тысячи долларов премии.
  • Tier B (32B Q4 production): M4 32 ГБ или M5 32 ГБ — только при подтверждённом workload; иначе API/cascade дешевле.
  • Bandwidth rule: decode tokens/s масштабируется с memory BW линейнее, чем с NPU TOPS — см. архитектурный гид M4 vs M5.
  • Framework delta: MLX vs Ollama vs llama.cpp на M4 — разброс <15%; выбор фреймворка вторичен относительно RAM.

Сценарная матрица: workload → конфигурация → buy vs rent

СценарийРекомендацияBuy vs Rent
Personal 7B chat / codeM4 16 ГБ + OllamaRent 1 мес → benchmark
Team RAG + embeddingM4 24 ГБ + MLXMacPull monthly — гибко
Parallel A/B моделейM4 24 ГБ dedicated nodeSSH remote, 24h delivery
32B Q4 productionM4 32 ГБ или wait M5Rent → validate → buy
70B+ localAPI / distributedНе single Mac mini

Пять шагов: развернуть локальный LLM на Mac за один спринт

  • Зафиксировать модель и RAM-бюджет. 7B Q4 ≈ 5 ГБ weights; 13B Q4 ≈ 8 ГБ; оставьте 30% под OS, RAG-индекс и embedding cache. Минимум production — 24 ГБ unified memory.
  • Выбрать inference stack. Apple-native — MLX; cross-platform — Ollama; max perf tuning — llama.cpp + Metal. На M4 разница <15% — не тратьте неделю на framework wars.
  • Benchmark «три метрики». TTFT (prefill), decode tokens/s при batch=1, swap при 2 concurrent sessions. Один и тот же prompt — без сравнения с vendor TOPS.
  • Remote node на MacPull. Арендуйте Mac mini M4 24 ГБ / 512 ГБ, установите Ollama/MLX по SSH, храните weights на SSD. Локальная машина — thin client; данные и compute на выделенном Apple Silicon.
  • TCO review через 30 дней. Сравните API bill vs rental fee. При >8 ч/день inference — consider buy M4; после релиза M5 — пересчитать upgrade delta на реальных tokens/s.

Цифры для planning session (можно цитировать)

  • Benchmark reference: M4 24 ГБ, Llama 3.1 8B Q4 через MLX — decode ~45–55 tokens/s; 13B Q4 — ~25–35 tokens/s (batch=1, macOS 15).
  • RAM floor: production local LLM minimum — 24 ГБ; 16 ГБ только для 7B lab; swap kills latency независимо от NPU.
  • TCO shortcut: M4 list ~$799; MacPull monthly rental ≈ 1/15–1/20 от buy price — оптимально для 3–6 мес validation перед CAPEX.
  • Decision mnemonic: daily 7B–13B → M4 now; must-have 32B full Q → M4 32GB or M5 wait; uncertain → rent M4, measure, decide with data.
  • M5 NPU caveat: Ollama/llama.cpp не используют NPU напрямую в 2026; реальный gain M5 — bandwidth + larger memory pool, не TOPS slide.
  • Provisioning SLA: MacPull M4 24 ГБ — SSH/VNC delivery за 24 часа; Ollama pull + first benchmark в тот же день.

FAQ: три частых вопроса про локальный LLM на Mac

M4 потянет 70B локально?

70B Q4 weights ~40 ГБ+; даже 64 ГБ — swap и <5 tokens/s. Для 70B используйте API или multi-node; sweet spot M4 24 ГБ — 7B–13B, иногда 22B Q4.

Насколько NPU M5 ускорит Ollama?

Минимально: Ollama идёт через GPU+Metal. NPU M5 релевантен для Core ML и Apple Intelligence pipeline, не для Llama/Mistral decode в 2026.

Аренда MacPull vs свой Mac mini?

Rent даёт dedicated node, 512 ГБ SSD под weights, low-latency SSH и billing по неделям/месяцам — без риска M5 delay и depreciation. Ideal для ROI validation перед buy.

Итог: M4 — price/performance king для локальных LLM; сначала аренда, потом buy

M5 в 2026 добавит bandwidth и, возможно, базовые 512 ГБ SSD — но для mainstream 7B–13B inference gap с M4 составляет ~10–20%, что меньше разницы в цене и риске Day-1 совместимости. Mac mini M4 24 ГБ остаётся лучшим соотношением цены и AI-мощности для Ollama, MLX и RAG-pipeline на Apple Silicon.

Ошибка №1 — ждать M5 полгода, платя API. Ошибка №2 — покупать 64 ГБ «на вырост» без benchmark. Ошибка №3 — сравнивать TOPS вместо tokens/s на вашем prompt.

Готовы развернуть локальный LLM без CAPEX? Откройте тарифы MacPull, выберите Mac mini M4 24 ГБ / 512 ГБ, оформите аренду и подключитесь по гиду SSH/VNC. За сутки — pull модели, benchmark tokens/s и data-driven решение: M4 buy, продление rent или wait M5.

MacPull M4: Ollama / MLX ready — локальный LLM за 24 часа

24 ГБ + 512 ГБ · 7B–13B fluent inference · SSH remote API · dedicated Apple Silicon · без CAPEX и без swap на локальном Mac.