Anleitung
Qwen3.8-27B Benchmark — MacBook Air M4 24 GB
Meine Messwerte vom 19.08.2026: Cold Start, tokens/s, E-Mail-Klassifikation — ehrlich inklusive Grenzen.
Setup: MacBook Air M4, 24 GB Unified Memory, Mac16,13. Ollama 0.32.14, Modell qwen3.8:27b (17 GB, Q4_K_M). Kein Overclocking, normale Raumtemperatur.
Ergebnisse
| Test | Thinking | Dauer | Tokens/s |
|---|---|---|---|
| Erster Prompt (Cold Start) | an (default) | 5:38 min | 1,14 |
| E-Mail-Klassifikation (warm) | aus | 48 s | 1,53 |
Was das bedeutet
Qualität: Inhaltlich überzeugend — historische Fragen, Klassifikation Google Ads Tagesreport → Handlungsbedarf korrekt.
Geschwindigkeit: Nicht für Echtzeit-Chat. Gut für Batch-Jobs (morgens E-Mails sortieren, nachts Digest).
RAM: ollama ps zeigt ~18 GB geladen, 72 % GPU / 28 % CPU. Knapp, aber stabil bei 4096 Context.
Praxis-Regel: Thinking immer aus für Routine — /no_think im Chat oder "think": false in der API. Spart Minuten pro Prompt.
Modell wirklich lokal?
Ja. ollama run spricht nur localhost. Dass das Modell manchmal behauptet, Cloud/Claude zu sein, ist Training-Bias — der Forward Pass läuft trotzdem auf deinem Mac.