Kernaussage: Für den Massen-Workload 7B–13B ist der M4-vs-M5-Inferenzabstand nur 10–20 % — deutlich kleiner als Speicherkonfiguration und Anschaffungspreis. Mac mini M4 (24 GB) bleibt 2026 der Preis-Leistungs-König für lokale LLM-Produktion.
Struktur: Drei Engpässe, zwei Spec-Tabellen, Szenario-Matrix, fünf Deployment-Schritte, vier Kennzahlen, FAQ — plus Verweise auf M4-vs-M5-Architekturleitfaden und AI-Harness-Leitfaden.
Drei Engpässe bei der lokalen LLM-Hardwarewahl
- NPU-TOPS statt Speicherbandbreite: M5-Leaks versprechen 50–60 TOPS NPU (+30–55 %), doch 7B–13B-Quantisierungsmodelle auf Apple Silicon sind primär Unified-Memory- und Bandbreiten-limitiert (M4: ca. 120 GB/s). 16 GB mit Q4-13B erzeugt Swap — höhere NPU-TOPS helfen nicht.
- Opportunitätskosten beim M5-Warten: M5 Mac mini wird für Mitte bis Ende 2026 erwartet, Einstieg vermutlich 749–799 € (+15–25 %). Sechs Monate API-Rechnungen und Rechenleistungs-Leerstand können eine M4-Jahresmiete übersteigen.
- Überdimensionierung vs. Auslastung: 64 GB für gelegentliche 70B-Tests bei unter 10 % Tagesauslastung — die versteckten Kosten der Leerlauf-Hardware übersteigen oft den M4-vs-M5-Chip-Unterschied.
Spec-Tabelle 1: M4 vs M5 — Sechs KI-Dimensionen für lokale LLMs
| Dimension | Mac mini M4 (24 GB) | Mac mini M5 (Prognose) | LLM-Auswirkung |
|---|---|---|---|
| CPU / GPU | 10 Kerne + 10 GPU | +8–15 % Single-Core | Token-Präfill-Geschwindigkeit |
| NPU / Neural Engine | 38 TOPS | 50–60 TOPS | Core ML kleine Modelle |
| Unified Memory BW | ca. 120 GB/s | ca. 150 GB/s | Decode-Durchsatz |
| Modell-Obergrenze | 24 GB: 13B Q4 flüssig | 32 GB: 22B stabiler | Speicher > Roh-TOPS |
| MLX / Ollama-Ökosystem | Reif, viele Referenzen | Initiale Kompatibilität offen | Produktionsrisiko |
| Einstiegspreis DE | ab 699 € (256 GB) | 749–799 € geschätzt | TCO-Kernvariable |
Preis-Leistungs-Fazit
Für 7B–13B RAG und Agent-Workflows: M4 24 GB reicht. M5 liefert ca. 10–20 % schnellere Inferenz — schwer zu rechtfertigen bei 15–25 % Preisaufschlag. M4 bleibt König.
Wann M5 warten lohnt
Nur bei 32B+ Vollquantisierung und Budget für 32/64 GB Top-Config. Sonst: M4 mieten, Benchmark fahren, datenbasiert entscheiden.
Spec-Tabelle 2: Inferenz-Benchmarks und Framework-Vergleich
| Kennzahl | MLX (Apple) | Ollama | llama.cpp + Metal | M4 vs M5 Delta |
|---|---|---|---|---|
| Llama 3.1 8B Q4 decode | 45–55 tok/s | 40–50 tok/s | 42–52 tok/s | M5: +10–15 % |
| Llama 3.1 13B Q4 decode | 25–35 tok/s | 22–30 tok/s | 24–32 tok/s | M5: +12–18 % |
| TTFT (8B, 2K Kontext) | 0,8–1,2 s | 1,0–1,5 s | 0,9–1,3 s | M5: −8–12 % |
| Min. RAM (Produktion) | 24 GB empfohlen; 16 GB nur 7B-Experimente | Unverändert | ||
| NPU-Nutzung | Core ML Pfad | Primär GPU/Metal | GPU/Metal | NPU-Zuwachs marginal |
Technische Regel: Ollama und llama.cpp nutzen primär GPU/Metal — M5-NPU-TOPS allein rechtfertigen kein Halbjahr Warten. Entscheidend: Speichergröße, Bandbreite und Framework-Reife.
Szenario-Entscheidungsmatrix: Kaufen, mieten oder auf M5 warten?
| Nutzungsszenario | Empfohlene Config | Kauf vs. Miete | M4 vs M5 |
|---|---|---|---|
| Persönlicher 7B-Chat / Code | M4 16 GB + Ollama | 1 Monat mieten | M4 ausreichend |
| Team-RAG + Embedding | M4 24 GB + MLX | MacPull monatlich | M4 optimal |
| Multi-Modell A/B-Test | M4 24 GB dediziert | SSH-Remote 24 h | M4 skaliert horizontal |
| 32B Quantisierung Produktion | M4 32 GB oder M5 | Erst mieten, dann kaufen | M5 prüfen |
| 70B+ lokal | API oder Multi-Node | Nicht empfohlen | Beide unzureichend |
Fünf Schritte: Lokales LLM auf Mac mini M4 deployen
- Modell und Speicherbudget festlegen: 7B Q4 ≈ 5 GB; 13B Q4 ≈ 8 GB; 30 % Reserve für OS und RAG-Vektoren — 24 GB ist der Sweet Spot.
- Inferenz-Framework wählen: Apple-Ökosystem → MLX; Cross-Platform → Ollama; maximale Kontrolle → llama.cpp + Metal. Auf M4 liegt der Gap unter 15 %.
- Benchmark-Dreiklang: TTFT (Time-to-First-Token), decode tokens/s und Swap-Verhalten bei 2 parallelen Requests — identischer Prompt, keine Hersteller-TOPS-Illusion.
- Remote-Knoten bereitstellen: MacPull Mac mini M4 24 GB bestellen, per SSH Ollama/MLX installieren, Gewichte auf 512 GB SSD. Lokaler Rechner als Thin Client.
- TCO-Review und Skalierung: 30-Tage-API-Kosten vs. Mietgebühr vergleichen. Bei >8 h täglicher Inferenz M4-Kauf prüfen; M5 nach Launch mit echten Daten bewerten.
Vier zitierbare Kennzahlen für Beschaffungsmeetings
- Inferenz-Referenz: M4 24 GB, Llama 3.1 8B Q4 (MLX): 45–55 tokens/s decode; 13B Q4: 25–35 tokens/s (batch=1).
- Speicher-Schwelle: Produktions-LLM minimum 24 GB Unified Memory; 16 GB nur für 7B-Leichtgewichte.
- TCO-Schnellrechnung: M4 ab 699 € + 3-Jahres-Abschreibung; MacPull-Monatsmiete ≈ 1/15–1/20 des Kaufpreises — ideal für 3–6 Monate Validierung.
- Entscheidungsregel: 7B–13B → M4; 32B + Budget → M5 prüfen; unsicher → M4 sieben Tage mieten und Benchmark dokumentieren.
FAQ: Drei häufige Fragen zur lokalen LLM-Hardware
Kann M4 ein 70B-Modell lokal ausführen? 70B Q4-Gewichte benötigen über 40 GB RAM. Selbst 64 GB ist am Limit und praktisch unbrauchbar langsam. 70B über API oder verteilte Architektur; M4 24 GB Sweet Spot: 7B–13B, gelegentlich 22B quantisiert.
Wie stark hilft die M5-NPU bei Ollama? Ollama und llama.cpp laufen primär über GPU/Metal — NPU-Beschleunigung ist marginal. Der echte M5-Gewinn liegt in Speicherbandbreite (+25 %) und größeren Speicherpools, nicht in TOPS-Zahlen allein.
MacPull M4 mieten oder selbst kaufen? Miete liefert dedizierten Knoten, 512 GB SSD für Modellgewichte, SSH in 24 h und flexible Abrechnung — ohne M5-Lieferrisiko und Abschreibung. Ideal: ROI validieren, dann kaufen oder auf M5 upgraden.
Fazit: M4 bleibt Preis-Leistungs-König — erst mieten, dann kaufen
2026 bringt M5 echte KI-Upgrades in NPU und Speicherbandbreite — aber für den Mainstream-Workload 7B–13B liegt der Inferenzabstand bei nur 10–20 %. Speicherkonfiguration und Anschaffungspreis dominieren die TCO. Mac mini M4 (24 GB) ist und bleibt der Preis-Leistungs-König für lokale LLM-Produktion. Auf unbestätigte NPU-Leaks zu warten, kostet mehr als eine M4-Miete.
Die effizienteste Strategie: Mit einem dedizierten MacPull Mac mini M4 (24 GB, 512 GB) starten, echte tokens/s messen, API-Kosten gegen Mietgebühr halten — dann informiert M4 kaufen oder M5 abwarten.
Kauf- und Mietempfehlung: Lokales LLM-Setup starten? MacPull Mac mini M4 mieten (empfohlen: 24 GB + 512 GB, Ollama/MLX per SSH). Pakete unter Preise vergleichen — Modell ziehen, Benchmark fahren, mit echten Daten entscheiden: M4 kaufen oder M5 abwarten. Das ist der kosteneffizienteste Weg in die lokale KI-Inferenz.
MacPull M4: Ollama / MLX — lokale LLMs in 24 Stunden produktionsreif
24 GB + 512 GB dediziert · 7B–13B flüssige Inferenz · SSH-Remote-API · Kein Warten auf M5 — heute Benchmark, morgen Entscheidung.