====== Lokale LLMs für den Mac Mini ====== Diese Seite dokumentiert lokale Sprachmodelle, die auf einem Mac Mini mit 24 GB Unified Memory via Ollama betrieben werden können. Ziel: Praxiserfahrung mit lokaler KI sammeln, Stärken und Grenzen ausloten. //Stand: 4. August 2026// ===== Gemma 4 Familie (Google DeepMind) ===== Google's neueste offene Modellfamilie (Apache 2.0). Multimodal (Text + Bild), nativ Audio bei den kleinen Varianten. | **Modell** | **Disk (Q4_K_M)** | **RAM-Bedarf** | **Kontext** | **Typ** | | gemma4:e2b | 3,1 GB | ~8 GB | 128K | Dense | | gemma4:e4b | 5,0 GB | ~10 GB | 128K | Dense | | gemma4:12b | ~8 GB | ~14 GB | 128K | Dense | | gemma4:26b | 16,9 GB | ~22 GB | 256K | MoE (3,8B aktiv) | | gemma4:31b | 18,3 GB | ~24 GB | 256K | Dense | === Bewertung pro Variante === **gemma4:e2b (2,3B effektiv)** * Stärken: Fliegt auf schwacher Hardware, Audio-nativ, 140+ Sprachen * Schwächen: Simplistisch bei komplexen Aufgaben, kein Tool Use nativ * Einsatz: Schnellantwort-Bot, einfache Klassifikation, Spickzettel-Abfragen * Install: ollama pull gemma4:e2b **gemma4:e4b (4,5B effektiv — Standard)** * Stärken: Guter Allrounder, flott, Audio + Bild, Apache 2.0 * Schwächen: Kein Reasoning-Champion, stößt bei komplexer Logik an Grenzen * Einsatz: FAQ-Bot, Zusammenfassungen, Leichte Code-Hilfe * Install: ollama pull gemma4:e4b **gemma4:12b** * Stärken: Solider Mittelweg zwischen Geschwindigkeit und Hirn * Schwächen: Kein MoE → voller Parameter-Satz immer aktiv → höherer RAM-Verbrauch als nötig * Einsatz: Gute Wahl, wenn e4b zu leicht und 26b zu schwer ist * Install: ollama pull gemma4:12b **gemma4:26b (MoE — ★ Empfohlen)** * Stärken: Bestes Preis-Leistungs-Verhältnis der Familie. Nur 3,8 Mrd. aktiv → schnell. 256K Kontext. Agentic-fähig * Schwächen: Knapp in 24 GB — parallele Prozesse schwierig * Einsatz: Primärer Alltags-Assistent, HA-Überwachung, Reasoning * Install: ollama pull gemma4:26b **gemma4:31b (Dense)** * Stärken: Maximale Qualität, exzellent für Coding + Reasoning + lange Dokumente * Schwächen: Füllt den RAM komplett aus — nichts läuft parallel, grenzwertig auf 24 GB * Einsatz: Batch-Jobs über Nacht, Code-Review, komplexe Analysen * Install: ollama pull gemma4:31b ===== Qwen-Familie (Alibaba) ===== | **Modell** | **Disk (Q4_K_M)** | **RAM-Bedarf** | **Kontext** | **Typ** | | Qwen3-30B-A3B | ~15 GB | ~20 GB | 256K | MoE | | Qwen3-Coder (30B) | ~20 GB | ~24 GB | 256K | MoE | **Qwen3-30B-A3B (Denker)** * Stärken: Hervorragendes Reasoning, natives Tool Use, starkes Deutsch (>100 Sprachen), Denkmodus schaltbar * Schwächen: Größer als Gemma 26B, braucht 20+ GB * Einsatz: Offline-Clone für Gaston, HA-Automation, komplexe Entscheidungen * Install: ollama pull qwen3:30b-a3b **Qwen3-Coder (30B — ★ Empfohlen für Code)** * Stärken: State-of-the-Art für lokale Code-Generierung, 92 Programmiersprachen, 256K Kontext, Shell-Scripting * Schwächen: RAM-Hungrig (24 GB), nur für Code-Aufgaben optimiert * Einsatz: Server-Administration, Gitea CI/Debugging, HA-Automation-Skripte * Install: ollama pull qwen3-coder:30b ===== Spezialisierte Modelle ===== **OpenEuroLLM-German (15 GB, 128K Kontext)** * Stärken: Muttersprachliches Deutsch — kein Übersetzer-Deutsch. Kulturell präzise. Apache 2.0 * Schwächen: Nur Deutsch/Englisch, kein Reasoning-Monster * Einsatz: Lucie (muss korrektes Deutsch sprechen), DokuWiki, formelle Kommunikation * Install: ollama pull jobautomation/OpenEuroLLM-German **Llama 3.2 Vision (11B, ~8 GB, 128K Kontext)** * Stärken: Bildanalyse on-device, leicht, flott * Schwächen: 11B → begrenzte Reasoning-Tiefe * Einsatz: HA-Kamerabilder analysieren, Screenshot-Verarbeitung * Install: ollama pull llama3.2-vision:11b ===== Ausser Reichweite (für 24 GB Mac Mini) ===== **DeepSeek-R1-Distill-Llama-70B (~35 GB Q3)** * Warum nicht: 70 Mrd. Parameter. Selbst mit extremer Quantisierung 35+ GB. Mac Mini erstickt * Alternative: DeepSeek-R1 über Cloud (Bifrost/OpenRouter) bereits verfügbar ===== Empfohlene Erstinstallation (3 Modelle) ===== Mit 4 TB SSD ist Platz kein Thema — aber RAM ist die Grenze. Diese 3 decken 95% aller Anwendungsfälle ab: 1. **gemma4:26b** — Alltags-Assistent (16,9 GB, flott, 256K) 2. **qwen3-coder:30b** — Code & Admin (20 GB, nacheinander laden) 3. **OpenEuroLLM-German** — Perfektes Deutsch (15 GB) Alle drei können nicht gleichzeitig laufen (zusammen ~52 GB), aber einzeln passen sie bequem in 24 GB. ===== Bewertungsmatrix ===== ^ Modell ^ Deutsch ^ Code ^ Reasoning ^ Geschwindigkeit ^ RAM-Fit ^ | gemma4:e2b | ★★★☆☆ | ★★☆☆☆ | ★★☆☆☆ | ★★★★★ | ★★★★★ | | gemma4:e4b | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★★☆ | ★★★★☆ | | gemma4:12b | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | | gemma4:26b | ★★★★☆ | ★★★★☆ | ★★★★★ | ★★★★☆ | ★★★☆☆ | | gemma4:31b | ★★★★☆ | ★★★★★ | ★★★★★ | ★★☆☆☆ | ★★☆☆☆ | | qwen3:30b-a3b | ★★★★☆ | ★★★★☆ | ★★★★★ | ★★★☆☆ | ★★★☆☆ | | qwen3-coder:30b | ★★★☆☆ | ★★★★★ | ★★★★☆ | ★★★☆☆ | ★★☆☆☆ | | OpenEuroLLM-German | ★★★★★ | ★★☆☆☆ | ★★★☆☆ | ★★★☆☆ | ★★★☆☆ | | llama3.2-vision:11b | ★★★☆☆ | ★★☆☆☆ | ★★★☆☆ | ★★★★☆ | ★★★★★ |