====== Lokale LLMs für den Mac Mini ======
Diese Seite dokumentiert lokale Sprachmodelle, die auf einem Mac Mini mit 24 GB Unified Memory via Ollama betrieben werden können. Ziel: Praxiserfahrung mit lokaler KI sammeln, Stärken und Grenzen ausloten.
//Stand: 4. August 2026//
===== Gemma 4 Familie (Google DeepMind) =====
Google's neueste offene Modellfamilie (Apache 2.0). Multimodal (Text + Bild), nativ Audio bei den kleinen Varianten.
| **Modell** | **Disk (Q4_K_M)** | **RAM-Bedarf** | **Kontext** | **Typ** |
| gemma4:e2b | 3,1 GB | ~8 GB | 128K | Dense |
| gemma4:e4b | 5,0 GB | ~10 GB | 128K | Dense |
| gemma4:12b | ~8 GB | ~14 GB | 128K | Dense |
| gemma4:26b | 16,9 GB | ~22 GB | 256K | MoE (3,8B aktiv) |
| gemma4:31b | 18,3 GB | ~24 GB | 256K | Dense |
=== Bewertung pro Variante ===
**gemma4:e2b (2,3B effektiv)**
* Stärken: Fliegt auf schwacher Hardware, Audio-nativ, 140+ Sprachen
* Schwächen: Simplistisch bei komplexen Aufgaben, kein Tool Use nativ
* Einsatz: Schnellantwort-Bot, einfache Klassifikation, Spickzettel-Abfragen
* Install: ollama pull gemma4:e2b
**gemma4:e4b (4,5B effektiv — Standard)**
* Stärken: Guter Allrounder, flott, Audio + Bild, Apache 2.0
* Schwächen: Kein Reasoning-Champion, stößt bei komplexer Logik an Grenzen
* Einsatz: FAQ-Bot, Zusammenfassungen, Leichte Code-Hilfe
* Install: ollama pull gemma4:e4b
**gemma4:12b**
* Stärken: Solider Mittelweg zwischen Geschwindigkeit und Hirn
* Schwächen: Kein MoE → voller Parameter-Satz immer aktiv → höherer RAM-Verbrauch als nötig
* Einsatz: Gute Wahl, wenn e4b zu leicht und 26b zu schwer ist
* Install: ollama pull gemma4:12b
**gemma4:26b (MoE — ★ Empfohlen)**
* Stärken: Bestes Preis-Leistungs-Verhältnis der Familie. Nur 3,8 Mrd. aktiv → schnell. 256K Kontext. Agentic-fähig
* Schwächen: Knapp in 24 GB — parallele Prozesse schwierig
* Einsatz: Primärer Alltags-Assistent, HA-Überwachung, Reasoning
* Install: ollama pull gemma4:26b
**gemma4:31b (Dense)**
* Stärken: Maximale Qualität, exzellent für Coding + Reasoning + lange Dokumente
* Schwächen: Füllt den RAM komplett aus — nichts läuft parallel, grenzwertig auf 24 GB
* Einsatz: Batch-Jobs über Nacht, Code-Review, komplexe Analysen
* Install: ollama pull gemma4:31b
===== Qwen-Familie (Alibaba) =====
| **Modell** | **Disk (Q4_K_M)** | **RAM-Bedarf** | **Kontext** | **Typ** |
| Qwen3-30B-A3B | ~15 GB | ~20 GB | 256K | MoE |
| Qwen3-Coder (30B) | ~20 GB | ~24 GB | 256K | MoE |
**Qwen3-30B-A3B (Denker)**
* Stärken: Hervorragendes Reasoning, natives Tool Use, starkes Deutsch (>100 Sprachen), Denkmodus schaltbar
* Schwächen: Größer als Gemma 26B, braucht 20+ GB
* Einsatz: Offline-Clone für Gaston, HA-Automation, komplexe Entscheidungen
* Install: ollama pull qwen3:30b-a3b
**Qwen3-Coder (30B — ★ Empfohlen für Code)**
* Stärken: State-of-the-Art für lokale Code-Generierung, 92 Programmiersprachen, 256K Kontext, Shell-Scripting
* Schwächen: RAM-Hungrig (24 GB), nur für Code-Aufgaben optimiert
* Einsatz: Server-Administration, Gitea CI/Debugging, HA-Automation-Skripte
* Install: ollama pull qwen3-coder:30b
===== Spezialisierte Modelle =====
**OpenEuroLLM-German (15 GB, 128K Kontext)**
* Stärken: Muttersprachliches Deutsch — kein Übersetzer-Deutsch. Kulturell präzise. Apache 2.0
* Schwächen: Nur Deutsch/Englisch, kein Reasoning-Monster
* Einsatz: Lucie (muss korrektes Deutsch sprechen), DokuWiki, formelle Kommunikation
* Install: ollama pull jobautomation/OpenEuroLLM-German
**Llama 3.2 Vision (11B, ~8 GB, 128K Kontext)**
* Stärken: Bildanalyse on-device, leicht, flott
* Schwächen: 11B → begrenzte Reasoning-Tiefe
* Einsatz: HA-Kamerabilder analysieren, Screenshot-Verarbeitung
* Install: ollama pull llama3.2-vision:11b
===== Ausser Reichweite (für 24 GB Mac Mini) =====
**DeepSeek-R1-Distill-Llama-70B (~35 GB Q3)**
* Warum nicht: 70 Mrd. Parameter. Selbst mit extremer Quantisierung 35+ GB. Mac Mini erstickt
* Alternative: DeepSeek-R1 über Cloud (Bifrost/OpenRouter) bereits verfügbar
===== Empfohlene Erstinstallation (3 Modelle) =====
Mit 4 TB SSD ist Platz kein Thema — aber RAM ist die Grenze. Diese 3 decken 95% aller Anwendungsfälle ab:
1. **gemma4:26b** — Alltags-Assistent (16,9 GB, flott, 256K)
2. **qwen3-coder:30b** — Code & Admin (20 GB, nacheinander laden)
3. **OpenEuroLLM-German** — Perfektes Deutsch (15 GB)
Alle drei können nicht gleichzeitig laufen (zusammen ~52 GB), aber einzeln passen sie bequem in 24 GB.
===== Bewertungsmatrix =====
^ Modell ^ Deutsch ^ Code ^ Reasoning ^ Geschwindigkeit ^ RAM-Fit ^
| gemma4:e2b | ★★★☆☆ | ★★☆☆☆ | ★★☆☆☆ | ★★★★★ | ★★★★★ |
| gemma4:e4b | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★★☆ | ★★★★☆ |
| gemma4:12b | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ |
| gemma4:26b | ★★★★☆ | ★★★★☆ | ★★★★★ | ★★★★☆ | ★★★☆☆ |
| gemma4:31b | ★★★★☆ | ★★★★★ | ★★★★★ | ★★☆☆☆ | ★★☆☆☆ |
| qwen3:30b-a3b | ★★★★☆ | ★★★★☆ | ★★★★★ | ★★★☆☆ | ★★★☆☆ |
| qwen3-coder:30b | ★★★☆☆ | ★★★★★ | ★★★★☆ | ★★★☆☆ | ★★☆☆☆ |
| OpenEuroLLM-German | ★★★★★ | ★★☆☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ |
| llama3.2-vision:11b | ★★★☆☆ | ★★☆☆☆ | ★★★☆☆ | ★★★★☆ | ★★★★★ |