Ein open-source Modell, das auf Benchmarks neben Claude Opus steht — und auf deinem MacBook mit Ollama läuft. Ich habe es auf einem MacBook Air M4 mit 24 GB getestet. Hier findest du Setup, Benchmarks und ehrliche Grenzen.
* Artificial Analysis, unabhängig gemessen. Vendor-Benchmarks mit Caveats — siehe unten.
Qwen3.8-27B ist kein Spielzeug-Modell. Alibaba hat im August 2026 ein 27B dense Vision-Language-Modell unter Apache 2.0 veröffentlicht — frei downloadbar, kommerziell nutzbar, ohne API-Zwang.
Auf dem Papier schlägt es laut Qwen Model Card Claude Opus 4.6 Max bei SWE-bench Pro (61,7 vs. 53,4) und CoWorkBench (long-horizon Office Work). Unabhängig bestätigt: Artificial Analysis Intelligence Index 52, Agentic Index 51.
Das Entscheidende für dich: Das Ganze passt in eine ~17 GB Datei und läuft auf einem MacBook Air M4 mit 24 GB RAM. Ich habe es selbst getestet — inklusive Kulturrevolution-Antwort und E-Mail-Klassifikation. Qualität: überraschend gut. Geschwindigkeit: Batch-tauglich, nicht Chat-schnell.
| Benchmark | Qwen3.8-27B | Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro | 61,7 | 53,4 |
| LiveCodeBench v6 | 90,3 | 88,8 |
| CoWorkBench | 70,7 | 68,2 |
| Terminal Bench 2.1 | 73,0 | 78,2 |
Quelle: Qwen Model Card, Aug 2026. SWE-bench mit korrigierten Tasks — nicht 1:1 mit älteren Vergleichszahlen vergleichbar.
Hands-on aus eigener Praxis — nicht nur Specs vom Hersteller.
Ja — mit Ollama spricht dein Terminal nur localhost:11434. Kein API-Key nötig. Inference passiert auf deinem Mac; nur bei Cursor-Anbindung über Tunnel geht Prompt-Kontext zusätzlich durch Cursor-Cloud.
Praktisch 24 GB Unified Memory für Q4 (~17–18 GB Modell). 16 GB ist zu knapp; 32 GB+ gibt mehr Context-Spielraum.
Thinking ist standardmäßig an — das Modell denkt laut mit und braucht Minuten. Für Routine: /no_think im Chat oder think: false in der API.
Auf Papier nahe dran bei Coding-Benchmarks (Vendor + Artificial Analysis). Lokal auf dem Air: Qualität überraschend hoch, Geschwindigkeit nicht vergleichbar mit Cloud.
Lokal: Strom und Hardware — $0 pro Token. OpenRouter: ca. $0,40/M Input, $3/M Output, wenn du Cloud-Geschwindigkeit willst.
Qwen ist ein Baustein — im KI-Agenten-Programm baust du eigene Agenten und Routinen (E-Mail, Ops, Content) auf deinem Setup.
KI-Automatisierung ansehen