Inhaltsverzeichnis
Lokale LLMs für den Mac Mini
Diese Seite dokumentiert lokale Sprachmodelle, die auf einem Mac Mini mit 24 GB Unified Memory via Ollama betrieben werden können. Ziel: Praxiserfahrung mit lokaler KI sammeln, Stärken und Grenzen ausloten.
Stand: 4. August 2026
Gemma 4 Familie (Google DeepMind)
Google's neueste offene Modellfamilie (Apache 2.0). Multimodal (Text + Bild), nativ Audio bei den kleinen Varianten.
| Modell | Disk (Q4_K_M) | RAM-Bedarf | Kontext | Typ |
| gemma4:e2b | 3,1 GB | ~8 GB | 128K | Dense |
| gemma4:e4b | 5,0 GB | ~10 GB | 128K | Dense |
| gemma4:12b | ~8 GB | ~14 GB | 128K | Dense |
| gemma4:26b | 16,9 GB | ~22 GB | 256K | MoE (3,8B aktiv) |
| gemma4:31b | 18,3 GB | ~24 GB | 256K | Dense |
Bewertung pro Variante
gemma4:e2b (2,3B effektiv)
- Stärken: Fliegt auf schwacher Hardware, Audio-nativ, 140+ Sprachen
- Schwächen: Simplistisch bei komplexen Aufgaben, kein Tool Use nativ
- Einsatz: Schnellantwort-Bot, einfache Klassifikation, Spickzettel-Abfragen
- Install:
ollama pull gemma4:e2b
gemma4:e4b (4,5B effektiv — Standard)
- Stärken: Guter Allrounder, flott, Audio + Bild, Apache 2.0
- Schwächen: Kein Reasoning-Champion, stößt bei komplexer Logik an Grenzen
- Einsatz: FAQ-Bot, Zusammenfassungen, Leichte Code-Hilfe
- Install:
ollama pull gemma4:e4b
gemma4:12b
- Stärken: Solider Mittelweg zwischen Geschwindigkeit und Hirn
- Schwächen: Kein MoE → voller Parameter-Satz immer aktiv → höherer RAM-Verbrauch als nötig
- Einsatz: Gute Wahl, wenn e4b zu leicht und 26b zu schwer ist
- Install:
ollama pull gemma4:12b
gemma4:26b (MoE — ★ Empfohlen)
- Stärken: Bestes Preis-Leistungs-Verhältnis der Familie. Nur 3,8 Mrd. aktiv → schnell. 256K Kontext. Agentic-fähig
- Schwächen: Knapp in 24 GB — parallele Prozesse schwierig
- Einsatz: Primärer Alltags-Assistent, HA-Überwachung, Reasoning
- Install:
ollama pull gemma4:26b
gemma4:31b (Dense)
- Stärken: Maximale Qualität, exzellent für Coding + Reasoning + lange Dokumente
- Schwächen: Füllt den RAM komplett aus — nichts läuft parallel, grenzwertig auf 24 GB
- Einsatz: Batch-Jobs über Nacht, Code-Review, komplexe Analysen
- Install:
ollama pull gemma4:31b
Qwen-Familie (Alibaba)
| Modell | Disk (Q4_K_M) | RAM-Bedarf | Kontext | Typ |
| Qwen3-30B-A3B | ~15 GB | ~20 GB | 256K | MoE |
| Qwen3-Coder (30B) | ~20 GB | ~24 GB | 256K | MoE |
Qwen3-30B-A3B (Denker)
- Stärken: Hervorragendes Reasoning, natives Tool Use, starkes Deutsch (>100 Sprachen), Denkmodus schaltbar
- Schwächen: Größer als Gemma 26B, braucht 20+ GB
- Einsatz: Offline-Clone für Gaston, HA-Automation, komplexe Entscheidungen
- Install:
ollama pull qwen3:30b-a3b
Qwen3-Coder (30B — ★ Empfohlen für Code)
- Stärken: State-of-the-Art für lokale Code-Generierung, 92 Programmiersprachen, 256K Kontext, Shell-Scripting
- Schwächen: RAM-Hungrig (24 GB), nur für Code-Aufgaben optimiert
- Einsatz: Server-Administration, Gitea CI/Debugging, HA-Automation-Skripte
- Install:
ollama pull qwen3-coder:30b
Spezialisierte Modelle
OpenEuroLLM-German (15 GB, 128K Kontext)
- Stärken: Muttersprachliches Deutsch — kein Übersetzer-Deutsch. Kulturell präzise. Apache 2.0
- Schwächen: Nur Deutsch/Englisch, kein Reasoning-Monster
- Einsatz: Lucie (muss korrektes Deutsch sprechen), DokuWiki, formelle Kommunikation
- Install:
ollama pull jobautomation/OpenEuroLLM-German
Llama 3.2 Vision (11B, ~8 GB, 128K Kontext)
- Stärken: Bildanalyse on-device, leicht, flott
- Schwächen: 11B → begrenzte Reasoning-Tiefe
- Einsatz: HA-Kamerabilder analysieren, Screenshot-Verarbeitung
- Install:
ollama pull llama3.2-vision:11b
Ausser Reichweite (für 24 GB Mac Mini)
DeepSeek-R1-Distill-Llama-70B (~35 GB Q3)
- Warum nicht: 70 Mrd. Parameter. Selbst mit extremer Quantisierung 35+ GB. Mac Mini erstickt
- Alternative: DeepSeek-R1 über Cloud (Bifrost/OpenRouter) bereits verfügbar
Empfohlene Erstinstallation (3 Modelle)
Mit 4 TB SSD ist Platz kein Thema — aber RAM ist die Grenze. Diese 3 decken 95% aller Anwendungsfälle ab:
1. **gemma4:26b** — Alltags-Assistent (16,9 GB, flott, 256K) 2. **qwen3-coder:30b** — Code & Admin (20 GB, nacheinander laden) 3. **OpenEuroLLM-German** — Perfektes Deutsch (15 GB)
Alle drei können nicht gleichzeitig laufen (zusammen ~52 GB), aber einzeln passen sie bequem in 24 GB.
Bewertungsmatrix
| Modell | Deutsch | Code | Reasoning | Geschwindigkeit | RAM-Fit |
|---|---|---|---|---|---|
| gemma4:e2b | ★★★☆☆ | ★★☆☆☆ | ★★☆☆☆ | ★★★★★ | ★★★★★ |
| gemma4:e4b | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★★☆ | ★★★★☆ |
| gemma4:12b | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ |
| gemma4:26b | ★★★★☆ | ★★★★☆ | ★★★★★ | ★★★★☆ | ★★★☆☆ |
| gemma4:31b | ★★★★☆ | ★★★★★ | ★★★★★ | ★★☆☆☆ | ★★☆☆☆ |
| qwen3:30b-a3b | ★★★★☆ | ★★★★☆ | ★★★★★ | ★★★☆☆ | ★★★☆☆ |
| qwen3-coder:30b | ★★★☆☆ | ★★★★★ | ★★★★☆ | ★★★☆☆ | ★★☆☆☆ |
| OpenEuroLLM-German | ★★★★★ | ★★☆☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ |
| llama3.2-vision:11b | ★★★☆☆ | ★★☆☆☆ | ★★★☆☆ | ★★★★☆ | ★★★★★ |
