Mentor · Trainer · Dozent für KI-Ethik

Start › Qwen3.8-27B

Lokale KI · getestet Aug 2026

Qwen3.8-27B: Frontier-Nähe in 17 Gigabyte

Ein open-source Modell, das auf Benchmarks neben Claude Opus steht — und auf deinem MacBook mit Ollama läuft. Ich habe es auf einem MacBook Air M4 mit 24 GB getestet. Hier findest du Setup, Benchmarks und ehrliche Grenzen.

Thomas Rümmele · KI-Trainer, EPUGetestet: 19.08.2026Hardware: MacBook Air M4, 24 GBOllama 0.32.14 · qwen3.8:27b Q4
17 GBlokal (Q4)
52Intelligence Index*
$0pro Token lokal
Apache 2Lizenz

* Artificial Analysis, unabhängig gemessen. Vendor-Benchmarks mit Caveats — siehe unten.

Was ist das Sensationelle?

Qwen3.8-27B ist kein Spielzeug-Modell. Alibaba hat im August 2026 ein 27B dense Vision-Language-Modell unter Apache 2.0 veröffentlicht — frei downloadbar, kommerziell nutzbar, ohne API-Zwang.

Auf dem Papier schlägt es laut Qwen Model Card Claude Opus 4.6 Max bei SWE-bench Pro (61,7 vs. 53,4) und CoWorkBench (long-horizon Office Work). Unabhängig bestätigt: Artificial Analysis Intelligence Index 52, Agentic Index 51.

Das Entscheidende für dich: Das Ganze passt in eine ~17 GB Datei und läuft auf einem MacBook Air M4 mit 24 GB RAM. Ich habe es selbst getestet — inklusive Kulturrevolution-Antwort und E-Mail-Klassifikation. Qualität: überraschend gut. Geschwindigkeit: Batch-tauglich, nicht Chat-schnell.

BenchmarkQwen3.8-27BOpus 4.6 Max
SWE-bench Pro61,753,4
LiveCodeBench v690,388,8
CoWorkBench70,768,2
Terminal Bench 2.173,078,2

Quelle: Qwen Model Card, Aug 2026. SWE-bench mit korrigierten Tasks — nicht 1:1 mit älteren Vergleichszahlen vergleichbar.

Häufige Fragen

Läuft Qwen3.8-27B wirklich lokal?

Ja — mit Ollama spricht dein Terminal nur localhost:11434. Kein API-Key nötig. Inference passiert auf deinem Mac; nur bei Cursor-Anbindung über Tunnel geht Prompt-Kontext zusätzlich durch Cursor-Cloud.

Wie viel RAM brauche ich?

Praktisch 24 GB Unified Memory für Q4 (~17–18 GB Modell). 16 GB ist zu knapp; 32 GB+ gibt mehr Context-Spielraum.

Warum antwortet es so langsam?

Thinking ist standardmäßig an — das Modell denkt laut mit und braucht Minuten. Für Routine: /no_think im Chat oder think: false in der API.

Ist es wirklich so gut wie Opus?

Auf Papier nahe dran bei Coding-Benchmarks (Vendor + Artificial Analysis). Lokal auf dem Air: Qualität überraschend hoch, Geschwindigkeit nicht vergleichbar mit Cloud.

Was kostet es?

Lokal: Strom und Hardware — $0 pro Token. OpenRouter: ca. $0,40/M Input, $3/M Output, wenn du Cloud-Geschwindigkeit willst.

Lokale KI im eigenen Business?

Qwen ist ein Baustein — im KI-Agenten-Programm baust du eigene Agenten und Routinen (E-Mail, Ops, Content) auf deinem Setup.

KI-Automatisierung ansehen