Benutzer-Werkzeuge

Webseiten-Werkzeuge


projekte:lokale_llms

Lokale LLMs für den Mac Mini

Diese Seite dokumentiert lokale Sprachmodelle, die auf einem Mac Mini mit 24 GB Unified Memory via Ollama betrieben werden können. Ziel: Praxiserfahrung mit lokaler KI sammeln, Stärken und Grenzen ausloten.

Stand: 4. August 2026

Gemma 4 Familie (Google DeepMind)

Google's neueste offene Modellfamilie (Apache 2.0). Multimodal (Text + Bild), nativ Audio bei den kleinen Varianten.

Modell Disk (Q4_K_M) RAM-Bedarf Kontext Typ
gemma4:e2b 3,1 GB ~8 GB 128K Dense
gemma4:e4b 5,0 GB ~10 GB 128K Dense
gemma4:12b ~8 GB ~14 GB 128K Dense
gemma4:26b 16,9 GB ~22 GB 256K MoE (3,8B aktiv)
gemma4:31b 18,3 GB ~24 GB 256K Dense

Bewertung pro Variante

gemma4:e2b (2,3B effektiv)

  • Stärken: Fliegt auf schwacher Hardware, Audio-nativ, 140+ Sprachen
  • Schwächen: Simplistisch bei komplexen Aufgaben, kein Tool Use nativ
  • Einsatz: Schnellantwort-Bot, einfache Klassifikation, Spickzettel-Abfragen
  • Install:
    ollama pull gemma4:e2b

gemma4:e4b (4,5B effektiv — Standard)

  • Stärken: Guter Allrounder, flott, Audio + Bild, Apache 2.0
  • Schwächen: Kein Reasoning-Champion, stößt bei komplexer Logik an Grenzen
  • Einsatz: FAQ-Bot, Zusammenfassungen, Leichte Code-Hilfe
  • Install:
    ollama pull gemma4:e4b

gemma4:12b

  • Stärken: Solider Mittelweg zwischen Geschwindigkeit und Hirn
  • Schwächen: Kein MoE → voller Parameter-Satz immer aktiv → höherer RAM-Verbrauch als nötig
  • Einsatz: Gute Wahl, wenn e4b zu leicht und 26b zu schwer ist
  • Install:
    ollama pull gemma4:12b

gemma4:26b (MoE — ★ Empfohlen)

  • Stärken: Bestes Preis-Leistungs-Verhältnis der Familie. Nur 3,8 Mrd. aktiv → schnell. 256K Kontext. Agentic-fähig
  • Schwächen: Knapp in 24 GB — parallele Prozesse schwierig
  • Einsatz: Primärer Alltags-Assistent, HA-Überwachung, Reasoning
  • Install:
    ollama pull gemma4:26b

gemma4:31b (Dense)

  • Stärken: Maximale Qualität, exzellent für Coding + Reasoning + lange Dokumente
  • Schwächen: Füllt den RAM komplett aus — nichts läuft parallel, grenzwertig auf 24 GB
  • Einsatz: Batch-Jobs über Nacht, Code-Review, komplexe Analysen
  • Install:
    ollama pull gemma4:31b

Qwen-Familie (Alibaba)

Modell Disk (Q4_K_M) RAM-Bedarf Kontext Typ
Qwen3-30B-A3B ~15 GB ~20 GB 256K MoE
Qwen3-Coder (30B) ~20 GB ~24 GB 256K MoE

Qwen3-30B-A3B (Denker)

  • Stärken: Hervorragendes Reasoning, natives Tool Use, starkes Deutsch (>100 Sprachen), Denkmodus schaltbar
  • Schwächen: Größer als Gemma 26B, braucht 20+ GB
  • Einsatz: Offline-Clone für Gaston, HA-Automation, komplexe Entscheidungen
  • Install:
    ollama pull qwen3:30b-a3b

Qwen3-Coder (30B — ★ Empfohlen für Code)

  • Stärken: State-of-the-Art für lokale Code-Generierung, 92 Programmiersprachen, 256K Kontext, Shell-Scripting
  • Schwächen: RAM-Hungrig (24 GB), nur für Code-Aufgaben optimiert
  • Einsatz: Server-Administration, Gitea CI/Debugging, HA-Automation-Skripte
  • Install:
    ollama pull qwen3-coder:30b

Spezialisierte Modelle

OpenEuroLLM-German (15 GB, 128K Kontext)

  • Stärken: Muttersprachliches Deutsch — kein Übersetzer-Deutsch. Kulturell präzise. Apache 2.0
  • Schwächen: Nur Deutsch/Englisch, kein Reasoning-Monster
  • Einsatz: Lucie (muss korrektes Deutsch sprechen), DokuWiki, formelle Kommunikation
  • Install:
    ollama pull jobautomation/OpenEuroLLM-German

Llama 3.2 Vision (11B, ~8 GB, 128K Kontext)

  • Stärken: Bildanalyse on-device, leicht, flott
  • Schwächen: 11B → begrenzte Reasoning-Tiefe
  • Einsatz: HA-Kamerabilder analysieren, Screenshot-Verarbeitung
  • Install:
    ollama pull llama3.2-vision:11b

Ausser Reichweite (für 24 GB Mac Mini)

DeepSeek-R1-Distill-Llama-70B (~35 GB Q3)

  • Warum nicht: 70 Mrd. Parameter. Selbst mit extremer Quantisierung 35+ GB. Mac Mini erstickt
  • Alternative: DeepSeek-R1 über Cloud (Bifrost/OpenRouter) bereits verfügbar

Empfohlene Erstinstallation (3 Modelle)

Mit 4 TB SSD ist Platz kein Thema — aber RAM ist die Grenze. Diese 3 decken 95% aller Anwendungsfälle ab:

1. **gemma4:26b** — Alltags-Assistent (16,9 GB, flott, 256K)
2. **qwen3-coder:30b** — Code & Admin (20 GB, nacheinander laden)
3. **OpenEuroLLM-German** — Perfektes Deutsch (15 GB)

Alle drei können nicht gleichzeitig laufen (zusammen ~52 GB), aber einzeln passen sie bequem in 24 GB.

Bewertungsmatrix

Modell Deutsch Code Reasoning Geschwindigkeit RAM-Fit
gemma4:e2b ★★★☆☆ ★★☆☆☆ ★★☆☆☆ ★★★★★ ★★★★★
gemma4:e4b ★★★☆☆ ★★★☆☆ ★★★☆☆ ★★★★☆ ★★★★☆
gemma4:12b ★★★☆☆ ★★★☆☆ ★★★☆☆ ★★★☆☆ ★★★☆☆
gemma4:26b ★★★★☆ ★★★★☆ ★★★★★ ★★★★☆ ★★★☆☆
gemma4:31b ★★★★☆ ★★★★★ ★★★★★ ★★☆☆☆ ★★☆☆☆
qwen3:30b-a3b ★★★★☆ ★★★★☆ ★★★★★ ★★★☆☆ ★★★☆☆
qwen3-coder:30b ★★★☆☆ ★★★★★ ★★★★☆ ★★★☆☆ ★★☆☆☆
OpenEuroLLM-German ★★★★★ ★★☆☆☆ ★★★☆☆ ★★★☆☆ ★★★☆☆
llama3.2-vision:11b ★★★☆☆ ★★☆☆☆ ★★★☆☆ ★★★★☆ ★★★★★
projekte/lokale_llms.txt · Zuletzt geändert: von gaston