Вывод: в 2026 локальный инференс 7B–13B на Apple Silicon упирается в объём unified memory и bandwidth, а не в маркетинговые TOPS NPU. M5 даст прирост ~10–20% decode, но M4 24 ГБ уже закрывает 80% production-сценариев по лучшему price/performance.
На странице: три системных риска, матрица AI-мощности в шести измерениях, сценарная таблица, пять шагов деплоя, цифры для planning session и путь к аренде MacPull Mac mini M4.
Три системных риска при выборе железа под локальные LLM
- 1. Ориентация на NPU вместо memory bandwidth. M5 обещает ~50–60 TOPS Neural Engine против ~38 TOPS у M4, но Ollama и llama.cpp в 2026 в основном идут через GPU+Metal. Реальный bottleneck — 120 GB/s vs ~150 GB/s bandwidth и объём RAM, а не цифра на слайде WWDC.
- 2. Стоимость ожидания M5. Релиз Mac mini M5 традиционно отстаёт на 6–12 месяцев с премией +15–25% к list price. За полгода API-расходы команды из пяти человек на GPT-4o/Claude легко превышают годовую аренду M4 24 ГБ на MacPull.
- 3. Переплата за «на всякий случай» 64 ГБ. Покупка топ-конфигурации ради редкого 32B inference при daily workload 7B–13B даёт utilization <10%. Аренда M4 24 ГБ на 1–3 месяца для benchmark — рациональнее, чем CAPEX «на будущее».
Матрица AI-мощности M4 vs M5: шесть измерений локального инференса
| Измерение | Mac mini M4 (24 ГБ) | Mac mini M5 (прогноз) | Влияние на LLM |
|---|---|---|---|
| CPU / GPU | 10+10 ядер | ~+15% single-core | Prefill TTFT |
| NPU / Neural Engine | ~38 TOPS | ~50–60 TOPS | Core ML, не Ollama |
| Unified memory BW | 120 GB/s | ~150 GB/s | Decode tokens/s |
| Потолок модели | 13B Q4 стабильно | 22B Q4 комфортнее | RAM > TOPS |
| MLX / Ollama зрелость | Production-ready | Совместимость Day 1 | Риск простоя |
| TCO entry (USD) | ~$599–799 | +15–25% | ROI локального LLM |
- Price/performance tier A (7B–13B daily): M4 24 ГБ — sweet spot; прирост M5 ~10–20% decode не оправдывает тысячи долларов премии.
- Tier B (32B Q4 production): M4 32 ГБ или M5 32 ГБ — только при подтверждённом workload; иначе API/cascade дешевле.
- Bandwidth rule: decode tokens/s масштабируется с memory BW линейнее, чем с NPU TOPS — см. архитектурный гид M4 vs M5.
- Framework delta: MLX vs Ollama vs llama.cpp на M4 — разброс <15%; выбор фреймворка вторичен относительно RAM.
Сценарная матрица: workload → конфигурация → buy vs rent
| Сценарий | Рекомендация | Buy vs Rent |
|---|---|---|
| Personal 7B chat / code | M4 16 ГБ + Ollama | Rent 1 мес → benchmark |
| Team RAG + embedding | M4 24 ГБ + MLX | MacPull monthly — гибко |
| Parallel A/B моделей | M4 24 ГБ dedicated node | SSH remote, 24h delivery |
| 32B Q4 production | M4 32 ГБ или wait M5 | Rent → validate → buy |
| 70B+ local | API / distributed | Не single Mac mini |
Пять шагов: развернуть локальный LLM на Mac за один спринт
- Зафиксировать модель и RAM-бюджет. 7B Q4 ≈ 5 ГБ weights; 13B Q4 ≈ 8 ГБ; оставьте 30% под OS, RAG-индекс и embedding cache. Минимум production — 24 ГБ unified memory.
- Выбрать inference stack. Apple-native — MLX; cross-platform — Ollama; max perf tuning — llama.cpp + Metal. На M4 разница <15% — не тратьте неделю на framework wars.
- Benchmark «три метрики». TTFT (prefill), decode tokens/s при batch=1, swap при 2 concurrent sessions. Один и тот же prompt — без сравнения с vendor TOPS.
- Remote node на MacPull. Арендуйте Mac mini M4 24 ГБ / 512 ГБ, установите Ollama/MLX по SSH, храните weights на SSD. Локальная машина — thin client; данные и compute на выделенном Apple Silicon.
- TCO review через 30 дней. Сравните API bill vs rental fee. При >8 ч/день inference — consider buy M4; после релиза M5 — пересчитать upgrade delta на реальных tokens/s.
Цифры для planning session (можно цитировать)
- Benchmark reference: M4 24 ГБ, Llama 3.1 8B Q4 через MLX — decode ~45–55 tokens/s; 13B Q4 — ~25–35 tokens/s (batch=1, macOS 15).
- RAM floor: production local LLM minimum — 24 ГБ; 16 ГБ только для 7B lab; swap kills latency независимо от NPU.
- TCO shortcut: M4 list ~$799; MacPull monthly rental ≈ 1/15–1/20 от buy price — оптимально для 3–6 мес validation перед CAPEX.
- Decision mnemonic: daily 7B–13B → M4 now; must-have 32B full Q → M4 32GB or M5 wait; uncertain → rent M4, measure, decide with data.
- M5 NPU caveat: Ollama/llama.cpp не используют NPU напрямую в 2026; реальный gain M5 — bandwidth + larger memory pool, не TOPS slide.
- Provisioning SLA: MacPull M4 24 ГБ — SSH/VNC delivery за 24 часа; Ollama pull + first benchmark в тот же день.
FAQ: три частых вопроса про локальный LLM на Mac
70B Q4 weights ~40 ГБ+; даже 64 ГБ — swap и <5 tokens/s. Для 70B используйте API или multi-node; sweet spot M4 24 ГБ — 7B–13B, иногда 22B Q4.
Минимально: Ollama идёт через GPU+Metal. NPU M5 релевантен для Core ML и Apple Intelligence pipeline, не для Llama/Mistral decode в 2026.
Rent даёт dedicated node, 512 ГБ SSD под weights, low-latency SSH и billing по неделям/месяцам — без риска M5 delay и depreciation. Ideal для ROI validation перед buy.
Итог: M4 — price/performance king для локальных LLM; сначала аренда, потом buy
M5 в 2026 добавит bandwidth и, возможно, базовые 512 ГБ SSD — но для mainstream 7B–13B inference gap с M4 составляет ~10–20%, что меньше разницы в цене и риске Day-1 совместимости. Mac mini M4 24 ГБ остаётся лучшим соотношением цены и AI-мощности для Ollama, MLX и RAG-pipeline на Apple Silicon.
Ошибка №1 — ждать M5 полгода, платя API. Ошибка №2 — покупать 64 ГБ «на вырост» без benchmark. Ошибка №3 — сравнивать TOPS вместо tokens/s на вашем prompt.
Готовы развернуть локальный LLM без CAPEX? Откройте тарифы MacPull, выберите Mac mini M4 24 ГБ / 512 ГБ, оформите аренду и подключитесь по гиду SSH/VNC. За сутки — pull модели, benchmark tokens/s и data-driven решение: M4 buy, продление rent или wait M5.
MacPull M4: Ollama / MLX ready — локальный LLM за 24 часа
24 ГБ + 512 ГБ · 7B–13B fluent inference · SSH remote API · dedicated Apple Silicon · без CAPEX и без swap на локальном Mac.