Inhalt (17 Abschnitte)
Lokales 27B mit Opus-4.6-Nähe beim Coding — oder nur Benchmark-Hype? In diesem Tutorial zeige ich dir, ob sich Qwen3.8-27B lokal lohnt — und wie du es auf Mac oder NVIDIA-PC wirklich startest.
Der Guide ist für DACH-Selbstständige und EPUs, die ohne Cloud testen oder entscheiden wollen. Du brauchst keinen ML-Hintergrund, aber einen Rechner mit genug Speicher.
Danach weißt du in etwa zehn Minuten, ob das Modell zu deinem Fall passt — und in etwa zwanzig Minuten läuft es lokal, ohne API-Key.
Getestet am 20.08.2026 auf einem MacBook Air M4 mit 24 GB Unified Memory, Ollama 0.32.14, Modell-Tag qwen3.8:27b (Q4_K_M, ~17 GB).
think: false startest du in Minuten. Apache 2.0. Kein Chat-Speed-Ersatz für Opus — aber für bestimmte Workflows plötzlich realistisch lokal.*Vendor-Tabelle — siehe Abschnitt Benchmarks; nicht deine Latenz.
Phase 1 · EntscheidenLohnt sich Qwen3.8-27B für dich?
Ja — wenn du bestimmte Coding-, Agent- oder Vision-Jobs lokal erledigen willst und genug Speicher hast. Nein — wenn du ChatGPT-Tempo im Dialog erwartest oder unter ~24 GB bleibst und trotzdem „alles“ willst.
Das ist die Frage, mit der die meisten kommen. Die News sagen „neu“ und „stark“. Du brauchst eine praktische Antwort.
Voraussetzungen
- Mac oder PC mit ≥ 24 GB Unified Memory bzw. VRAM (Minimum für sinnvollen Alltag)
- Ollama ≥ 0.32.12, rund 20 GB freier Speicher für den Pull
- Etwa 10 Minuten für die Entscheidung, 20 Minuten bis zum ersten Lauf
- Kein ML-Hintergrund nötig — Terminal copy-paste reicht
Was ist das — in einem Absatz
Qwen3.8-27B ist ein dichtes 27-Milliarden-Parameter-Modell mit Vision (Text + Bild), veröffentlicht am 14.08.2026 unter Apache 2.0. Über Ollama lädst du es als qwen3.8:27b — rund 17 GB im Default-Quant Q4_K_M. Quelle: ollama.com/library/qwen3.8.
Schreibweisen, die du auch siehst: Qwen 3.8 27B, qwen3 8 27b und qwen3.8 27b — gemeint ist dasselbe Modell. Ollama listet den Download oft mit 18 GB; die Quant-Datei liegt bei mir bei ~17 GB (Q4_K_M) — dieselbe Sache, andere Rundung.
Abgrenzung Qwen3.8-Max
Qwen3.8-Max (bzw. die große Open-Weights-Linie um 2.4T) ist ein anderes Produkt: andere Größe, nicht Apache 2.0, und der 27B-Tag ist das Modell, das du realistisch lokal fährst. Der 27B bringt Vision mit; Max ist nicht „dasselbe in größer“.
Für diesen Artikel gilt: wir reden vom lokal nutzbaren 27B — nicht vom Cloud-Flaggschiff.
Warum gerade so viel Aufmerksamkeit
Die Aufmerksamkeit kommt vom Release am 14.08.2026 plus Vendor-Benchmarks nahe Opus 4.6 — nicht vom Alltagstempo auf einem Air.
Kurz danach überschlagen sich Tests und Videos. AICodeKing nennt Qwen3.8-27B auf einem Mac mit 48 GB ein starkes lokales Agent-Modell und zitiert Vendor-Zahlen wie SWE-bench Pro über Opus 4.6 Max. IchBinFabian fragt auf Deutsch, ob das lokale Modell wirklich gegen Claude/Opus hält — getestet auf starker NVIDIA-Hardware.
Meine Einordnung: In SE-Benchmarks liegt Qwen nahe an Opus 4.6 Max — das heißt nicht Chat-Gefühl wie Opus. Vergleich ist 4.6, nicht 5. Und 48 GB im Video sind nicht dein Air mit 24 GB.
Wenn Creator sagen, sie könnten Claude kündigen: das ist ihre Meinung, nicht meine Empfehlung.
Für wen ja — und für wen nein
Ja, wenn du Batch-Jobs, Coding-Agenten, Repo-Fragen oder lokale Beleg-/Screenshot-Prüfung willst — und Latenz in Sekunden bis Minuten okay ist.
Nein, wenn du flüssigen Chat-Ersatz für Opus/Claude brauchst, unter 24 GB bleibst und trotzdem volles Kontextfenster erwartest, oder wenn du nur „das neueste Modell“ willst, ohne einen konkreten Job.
Welche Hardware brauchst du wirklich?
Du brauchst mindestens rund 24 GB Unified Memory (Apple) oder VRAM (NVIDIA), wenn du Qwen3.8-27B im Alltag sinnvoll nutzen willst. Darunter geht es oft nur mit Abstrichen — ehrlich gesagt.
Nach „lohnt sich“ kommt als Nächstes die Hardware-Frage. Ohne klare Wahl scheiterst du später am Download oder am Swap.
Minimum: 24 GB Unified Memory oder VRAM
Der Default-Download liegt bei ~17 GB Gewichten. Dazu kommen Runtime, KV-Cache und Betriebssystem. Auf meinem Air mit 24 GB läuft qwen3.8:27b — aber nur, wenn du Kontext und Thinking im Griff hast (siehe Messwerte und Troubleshooting).
Entscheidungsbaum
| Ziel | Empfehlung |
|---|---|
| Testen / EPU nebenbei | MacBook Air/Pro 24 GB oder Mac mini M4 |
| Täglich Agent/Coding | Mac Studio 32–64 GB oder RTX 4090/5090 |
| Max Speed, Budget GPU | RTX 4090/5090 |
| Leise, privat, unkompliziert | Mac + Tag qwen3.8:27b-mlx |
| Nur ausprobieren | Miet-GPU (Prompt Engineer: 4090-Klasse stundenweise) |
| Unter 24 GB | Kleineres Quant oder anderes Modell — ehrlich |
Willst du erst prüfen, ob lokal Sinn macht? Nimm Air/Pro 24 GB oder Mac mini M4.
Willst du täglich Agents und Coding? Mac Studio mit 32–64 GB oder eine RTX 4090/5090.
Willst du maximale Token/s? NVIDIA high-end — siehe Named Sources wie KGP Talkie und Prompt Engineer, nicht meine Air-Zahlen.
Willst du leise und im Apple-Ökosystem bleiben? Mac plus MLX-Tag.
Nur Wochenend-Experiment? GPU mieten statt Hardware kaufen.
16 GB / 8 GB: geht, mit Abstrichen
Auf 16 GB und darunter berichten Tester Abstriche bei Quant, Kontext und Tempo. Prompt Engineer zeigt ehrlich, was auf einem 8-GB-Laptop übrig bleibt — und wie weit das von einer 4090 entfernt ist.
Quant: Q4_K_M Default; wann Q8
Ollamas Default-Tag qwen3.8:27b kommt als Q4_K_M (~17 GB). Das ist der Sweet Spot für 24 GB.
Q8 braucht mehr Speicher und lohnt sich, wenn du Qualität über Kapazität stellst und die Hardware mitzieht. Ausführliche Quant-Leitern (2–8 bit) sparst du dir für später — für den Start reicht Q4_K_M.
Kosten: lokal vs. Miet-GPU vs. OpenRouter
Lokal: Strom + einmal Hardware. Kein Token-Preis, aber deine Zeit und dein RAM.
Miet-GPU: laut Prompt Engineer gut zum Wochenend-Test (4090-Klasse stundenweise) — Preis im Video prüfen, hier keine ct/h-Zahl.
OpenRouter/API: du zahlst pro Token, bekommst Tempo und Skalierung — aber Daten verlassen dein Gerät.
Was kann das Modell — jenseits der Benchmark-Tabelle?
Qwen3.8-27B eignet sich vor allem für lokale Coding-, Agent-, Vision- und Batch-Jobs — nicht als Drop-in für schnellen Chat. Die Vendor-Tabelle ist ein Hinweis, kein Alltag.
Hier die Jobs, die für Selbstständige zählen.
Lokaler Coding-Agent ohne API-Key
Mit Ollama kannst du Agent-Setups ohne Cloud-Key fahren — etwa über ollama launch claude mit dem lokalen Modell (siehe Prompt Engineer und AICodeKing). Du bleibst auf localhost.
In Qwens Vendor-Tabelle liegt Qwen3.8-27B bei SWE-bench Pro bei 61,7 % — über Opus 4.6 Max (53,4 %). Das bedeutet nicht, dass sich jede Unterhaltung wie Opus anfühlt.
Auf meinem MacBook Air M4 messe ich eher Batch-Tempo als Chat-Speed.
Für Coding- und Agent-Workflows, bei denen du think: false setzt und genug RAM hast, wird lokal aber plötzlich realistisch.
Repository-Fragen, Refactoring, Tool-Calling
Das Modell bringt Tool-Calling mit (Ollama listet tools bei den Capabilities). Repo-Fragen, Refactoring und Review-Schleifen sind genau der Bereich, in dem die SWE-Zahlen interessant werden — als Batch, nicht als Instant-Chat.
think: false. Für Brainstorming im Dialogtempo bleib bei der Cloud, wenn Tempo zählt.Screenshots, Belege, Dokumente lokal prüfen (Vision)
Der Default-Tag ist ein VLM: Text und Bild. Auf dem Air hat ein synthetischer Testbeleg mit „Betrag: EUR 127,50“ lokal korrekt EUR 127,50 gelesen — in 42 s mit think: false, ohne Cloud.
Das beweist den Vision-Tag, nicht die Belegprüfung im EPU-Alltag. Für sensible Dokumente ist der Punkt trotzdem: der Byte-Strom muss die Cloud nicht berühren. Die konkrete Anleitung steht im Abschnitt Vision.
Batch-Routinen wo Latenz egal ist (Mail — mein Fall)
Wenn du nachts 200 Mails sortieren oder klassifizieren willst, zählt Durchsatz über Stunden, nicht Antwortzeit im Dialog. Genau dafür ist lokales Qwen interessant: kein API-Budget, keine Cloud-Weitergabe der Mailtexte.
Harte Sekunden-pro-Mail-Zahlen folgen in einem späteren Update. Qualitativ: der Use-Case passt — wenn Thinking aus und Kontext klein sind.
Wann Cloud trotzdem schneller ist
Immer dann, wenn du flüssig hin und her reden willst, große Kontexte brauchst, oder dein Gerät am Limit swappt. Vendor-Nähe zu Opus 4.6 in einer Tabelle ersetzt keine Cloud-Latenz.
Phase 2 · Umsetzen1Ollama installieren
Ohne aktuelle Ollama-Version lädst du Qwen3.8-27B nicht zuverlässig. Mindestversion laut Modell-Anforderung: 0.32.12 oder neuer.
Auf dem Mac:
brew install ollama # oder Installer von https://ollama.com ollama --version
Auf Windows/Linux denselben Weg über die offizielle Distribution — der Befehl ollama bleibt gleich.
Bei mir lief der Test mit 0.32.14 unter /opt/homebrew/bin/ollama.

which -a ollama prüfen — zwei Installationen sind ein Klassiker (siehe Troubleshooting).2Modell laden (~17 GB)
Mit einem Befehl holst du den Default-Tag — rund 17 GB, Q4_K_M:
ollama pull qwen3.8:27b
Der Download braucht Zeit und Speicher. Lass ihn durchlaufen; abgebrochene Pulls führen oft zu Manifest-Fehlern.
qwen3.8:27b. Den MLX-Tag (qwen3.8:27b-mlx) holst du später, wenn du auf Apple Silicon Speed vergleichen willst.3Erster Test im Terminal
So prüfst du in Sekunden, ob Modell und Runtime sprechen:
ollama run qwen3.8:27b
Stell eine kurze Frage. Wenn die Antwort minutenlang auf sich warten lässt, ist Thinking sehr wahrscheinlich noch an — das ist der nächste Schritt, nicht „dein Mac ist kaputt“.
ollama ps
zeigt, ob das Modell geladen ist und wie SIZE / Processor aussehen.

4Thinking abschalten — sonst wartest du Minuten
Thinking ist bei Qwen3.8-27B unter Ollama standardmäßig aktiv — und macht triviale Antworten auf dem Air unnötig langsam. Der richtige Schalter heißt think: false, nicht /no_think.
Das ist der häufigste Live-Fehler nach dem Pull.
Warum Default so langsam ist
Auf dem MacBook Air M4 (24 GB, Ollama 0.32.14, qwen3.8:27b Q4_K_M) braucht die Frage „Hauptstadt Österreichs — ein Wort“ im Default Median 44 Sekunden und 40 Thinking-Wörter. Mit think: false sind es Median 3,8 Sekunden und null Thinking-Wörter — rund elfmal schneller.
/no_think im Chat-Text funktioniert bei Qwen3.8-27B nicht. Median 36 s, 43 Thinking-Wörter — dasselbe Verhalten wie Default. Der Schalter ist Ollamas Parameter think: false, nicht der alte Qwen3-Hybrid-Token. (Qwen-Cloud-Doku: /no_think gilt für Qwen3-Hybridmodelle.)
Caveat: triviale Aufgabe, n=3, Kontext 4K. Kein Throughput-Claim in Tokens/s.

Im Chat und API: think: false
Im API-Body (Chat):
{
"model": "qwen3.8:27b",
"messages": [{"role": "user", "content": "Nenne die Hauptstadt von Oesterreich. Antworte in genau einem Wort."}],
"think": false,
"stream": false
}Im interaktiven Chat: Thinking über die Ollama-/Client-Option abschalten, die think: false setzt — nicht den String /no_think in die Nachricht tippen.
think: false. Thinking nur bewusst einschalten, wenn du Reasoning wirklich brauchst und Zeit hast.Unter Ollama zählt an/aus — nicht Cloud-Parameter
Unter Ollama steuerst du Thinking praktisch über think (an/aus). Cloud-Parameter aus der Qwen-Doku brauchst du für den Start nicht.
Antwort wirkt leer?
Manchmal frisst Thinking das Token-Budget. Die Antwort wirkt leer, obwohl das Modell „gedacht“ hat.
Dann hilft oft: Max-Output-Limit im Client erhöhen und parallel think: false, wenn du keine Reasoning-Spur brauchst.
5Die lokale API nutzen
Ollama spricht lokal unter http://localhost:11434 — ohne HTTPS und ohne API-Key für den lokalen Default. So baust du Skripte und Agenten an.
http://localhost:11434/v1 — nicht https
OpenAI-kompatibel:
http://localhost:11434/v1
Basis-Chat auch unter /api/chat. Kein Cloud-Endpoint, kein TLS auf localhost nötig.
curl/Python mit think: false
curl http://127.0.0.1:11434/api/chat -d '{
"model": "qwen3.8:27b",
"messages": [{"role": "user", "content": "ping — antworte mit einem Wort"}],
"think": false,
"stream": false,
"keep_alive": "30m"
}'In Python dasselbe JSON an denselben Port. Setze think: false explizit — Defaults können Thinking anlassen.
think: false wirkt nicht über /v1?
Die OpenAI-kompatible Route http://localhost:11434/v1/chat/completions nimmt think nicht immer genauso entgegen wie /api/chat. Symptom: Thinking bleibt an, obwohl du im Body abschalten wolltest.
Workaround: Für Thinking-Steuerung /api/chat nutzen (wie im curl oben) — oder prüfen, ob dein Client chat_template_kwargs / Ollama-eigene Felder unterstützt. Wenn Tempo zählt und Thinking aus soll: native Chat-API bevorzugen.
ollama launch claude --model qwen3.8
Für Agent-Workflows ohne eigenen API-Key zeigen Community-Guides Varianten wie ollama launch claude --model … mit dem lokalen Qwen-Tag (Prompt Engineer, AICodeKing). Prüfe die aktuelle CLI-Hilfe deiner Ollama-Version — Flags ändern sich.
127.0.0.1:11434 und mit think: false starten. Tunnel/Cursor-Cloud sind eine andere Geschichte (siehe Was bleibt wirklich lokal).Troubleshooting — die ersten Fehler der Woche
Die fünf häufigsten Woche-1-Fehler: Ollama zu alt, doppelte Installation, abgebrochener Pull, OOM, Thinking an. Hier die Fehler im Wortlaut.
Fehler 412: Ollama zu alt
Meldung sinngemäß: pull model manifest: 412 — requires a newer version. Ursache: Ollama unter der Mindestversion für Qwen3.8. Lösung: Update auf ≥ 0.32.12, Server neu starten. Tracking u. a. ollama/ollama#14876.
Zwei Ollama-Installationen (which -a ollama)
Symptom: du hast „aktualisiert“, der laufende Server ist aber noch die alte Binary.
which -a ollama ollama --version
Auf meinem Air zeigte which -a nur den Homebrew-Pfad — kein zweites Ollama. Wenn du /usr/local/bin und Homebrew parallel siehst: alte Instanz beenden, klare PATH-Priorität setzen, Server neu starten.

Download bricht ab / Manifest fehlt
Nach abgebrochenem Pull: erneut ollama pull qwen3.8:27b.
Out of memory — Mac unbenutzbar
Zu großer Kontext oder parallel zu viele Apps: macOS swappt, der Rechner wird träge. Modell entladen, num_ctx senken, andere Speicherfresser schließen.
# Modell entladen: keep_alive auf 0 setzen oder ollama stop / ps prüfen ollama ps
Antworten dauern minutenlang → Schritt 4
Das ist fast immer Thinking. Setze think: false. Vergiss /no_think im Prompt.
„does not support images“ trotz Vision-Tag
Falsches Tag, Client schickt kein Bild-Format, oder alter Client-Pfad. Mit Default qwen3.8:27b und korrektem Multimodal-Request sollte Vision gehen — bei mir kam der Fehler im E5-Test nicht. Siehe Vision-Abschnitt.
which -a, think: false und ollama ps prüfen — in dieser Reihenfolge.Kontext und Speicher auf 24 GB
Der Spec-Wert 262K ist kein Alltagswert auf 24 GB. Was du einstellst (num_ctx), bestimmt Tempo und Speicher — nicht die Marketingzahl.
Warum 262K nicht das ist, was du nutzt
262.144 Tokens sind die Architektur-Angabe (oft als 256K gerundet). Der KV-Cache dafür passt nicht komfortabel neben Gewichte und OS auf 24 GB.
num_ctx: 8K / 32K / 64K
Eigene Messung Air M4, Prompt „ping“, think: false:
| num_ctx | SIZE (ollama ps) | Processor | Dauer |
|---|---|---|---|
| 8192 | 18 GB | 30%/70% CPU/GPU | 3,22 s |
| 32768 | 18 GB | 35%/65% CPU/GPU | 123,64 s |
| 65536 | 20 GB | 44%/56% CPU/GPU | 201,06 s |
| 131072 | 22 GB | 55%/45% CPU/GPU | 250,62 s |
Kein OOM bis 131K. Der Kipppunkt ist nicht der Absturz, sondern: Speicher steigt, GPU-Anteil sinkt, ein One-Word-Ping braucht Minuten.
Mit Default-Kontext (4K–8K) bleibt das Modell bei 18 GB und antwortet in wenigen Sekunden. Für Routine auf 24 GB: Kontext klein halten.
ollama ps — GPU ja/nein
ollama ps zeigt SIZE und Processor-Anteile. Steigt der CPU-Anteil stark, arbeitest du nicht mehr „sauber“ auf der GPU — Tempo bricht ein.
keep_alive, Modell entladen
ollama stop qwen3.8:27b ollama ps
Zum Freigeben nach schweren Jobs: ollama stop (aktuelle CLI), dann erneut ollama ps prüfen. keep_alive hält Gewichte sonst im Speicher (bei mir in Messungen 30m).
Phase 3 · EinordnenWas an den Benchmarks Substanz hat — und was nur Tabelle ist
Benchmarks erklären den Hype — nicht dein Gefühl im Chat. Lies sie als Hinweis für Coding/Agent-Jobs, nicht als Qualitätsgarantie für jede Unterhaltung.
SWE-bench Pro (Vendor + Caveat)
Vendor und darauf aufbauende Videos heben Software-Engineering- und Agent-Benchmarks hervor — dieselbe Gegenüberstellung wie oben in der Kennzahlen-Leiste und im Coding-Use-Case, unter Laborbedingungen.
Das ist eine Tabelle. Deine Hardware, dein Quant und dein Prompt ändern das Ergebnis.
Wo es Opus 4.6 schlägt — und wo nicht (GPQA, HLE)
In einzelnen SE-/Agent-Spalten liegt das lokale 27B laut Vendor-Tabelle nahe oder über Opus 4.6 Max. In Reasoning-/Wissens-Benchmarks wie GPQA und HLE liegt Opus laut derselben Vendor-Gegenüberstellung oft höher.
DEEPTECH betont den Catch (Thinking, RAM, Speed) — unabhängig von einzelnen Benchmark-Namen. Für Zahlen: Vendor lesen, nicht YouTube.
Opus-These nochmal klar: Nie „Opus-Qualität lokal“. Immer: genug Nähe in bestimmten Coding- und Agent-Workflows, damit lokal realistisch wird — mit Caveat zu Chat-Gefühl und Hardware.
„Frontier-adjacent Agent“ — AICodeKing-Formulierung
AICodeKing und andere sprechen von einem frontier-adjacent Agent, nicht von einem Frontier-Reasoner. Das trifft den Alltagsnutzen besser als „besser als Opus“.
Welche Runtime?
Für die meisten reicht Ollama mit dem Default-Tag; auf Apple Silicon ist der MLX-Tag die naheliegende Alternative. LM Studio und llama.cpp sind Optionen, kein Muss für den Start.
qwen3.8:27b vs. qwen3.8:27b-mlx
qwen3.8:27b — Default, breit getestet, meine Messwerte.
qwen3.8:27b-mlx — Apple-Silicon-optimiert, von Ollama gelistet und in Videos (AICodeKing) empfohlen, wenn du auf dem Mac Speed vergleichen willst.
Ollama vs. LM Studio vs. llama.cpp — kurz
| Runtime | Wann |
|---|---|
| Ollama | API, Agent-Hooks, schneller Einstieg |
| LM Studio | GUI und Experimente |
| llama.cpp | Maximale Kontrolle, steilere Lernkurve |
Windows/Linux: gleicher Befehl
ollama pull / ollama run / API-Port sind plattformübergreifend gleich. Unterschied ist GPU-Treiber und VRAM, nicht die Befehlssyntax.
Vision: Bilder lokal testen
Qwen3.8-27B kann lokal Bilder lesen — ohne Cloud. Ein erster Test dauert eine Minute Setup und zeigt, ob dein Client Multimodal korrekt schickt.
Erster Test mit Foto/Screenshot
Schick ein klares Bild (Screenshot oder Foto) mit einer konkreten Frage („Welcher Betrag steht in der Zeile?“).
Bei mir: synthetisches PNG mit „Betrag: EUR 127,50“ → Antwort EUR 127,50 in 42 s mit think: false. Kein „does not support images“.

Caveat: synthetisches PNG, kein Papierscan. Für EPU-Alltag später echte Belege nachziehen.
Wenn „does not support images“ kommt
Prüfe Client/API-Pfad (Bild wirklich als Image-Part), Ollama-Version und korrektes Modell-Tag qwen3.8:27b. Bei meinem E5-Lauf trat der Fehler nicht auf — ähnliche Meldungen bei anderen Qwen-VL-Tags sind ein separates Thema.
think: false und kleinem Kontext testen. Sensible Belege lokal lassen, wenn Datenschutz der Grund für Qwen ist.Meine Messwerte (MacBook Air M4)
Auf dem MacBook Air M4 mit 24 GB: Thinking aus = ~3,8 s statt ~44 s; ab 32K Kontext kippt das Tempo. Alle eigenen Zahlen stammen vom 20.08.2026, Ollama 0.32.14, qwen3.8:27b Q4_K_M — ein Air, kein Studio und keine 5090.
Thinking (E1)
| Variante | Median Dauer | Median Thinking-Wörter |
|---|---|---|
| Default | 43,63 s | 40 |
think: false | 3,78 s | 0 |
/no_think im Prompt | 36,47 s | 43 |
Publish-Satz: Default ~44 s / 40 Thinking-Wörter; think: false ~3,8 s / null; /no_think wirkt nicht.
Warmlauf vorab: erster Load ~54,7 s (davon ~49 s Load). Danach ollama ps: 18 GB, 28%/72% CPU/GPU, CONTEXT 4096.
Mail-Batch (E2)
Qualitativ vorgesehen: lokale Mail-Klassifikation über Nacht, ohne Cloud. Harte s/Mail- und Mails/h-Zahlen folgen in v1.1 — hier bewusst keine erfundenen Benchmarks.
Kontext-Kipppunkt (E3)
Siehe Tabelle oben: ab 32K Kontext dauert selbst ein Ping Minuten; bei 131K SIZE 22 GB und mehr CPU als GPU. 262K Spec ≠ Alltag auf 24 GB.
RTX-Vergleich nur als Named Source
Speed auf RTX 4090/5090 übernehme ich nicht aus dem Air. Einordnung über KGP Talkie, Prompt Engineer und Hardware-Guides wie kingy.ai — mit dem Caveat: andere Quantisierung, anderer Stack.

Was bleibt wirklich lokal — und was nicht?
Ollama auf dem Rechner hält Prompt und Antwort standardmäßig auf localhost — ohne API-Key. Sobald ein Tunnel, eine Cloud-IDE oder ein Remote-Endpoint dazwischenhängt, gilt das nicht mehr.
Ollama = localhost, kein API-Key
Default: 127.0.0.1:11434. Kein Account bei Alibaba nötig für den lokalen Lauf. Gewichte liegen bei dir.
Cursor/Tunnel-Ausnahme ehrlich
Wenn du Cursor, Cloudflare-Tunnel oder einen gehosteten Agenten anbindest, können Inhalte die Maschine verlassen — auch wenn das Modell „lokal“ heißt. Das ist Konfiguration, nicht Magie.
Screenshots/Dokumente: wann wirklich lokal
Nur wenn der Client das Bild an die lokale API schickt und kein Sync in die Cloud parallel läuft. Vision lokal ist möglich (E5) — aber nur im richtigen Pfad.
Apache 2.0 kommerziell
Die Modell-Lizenz laut Ollama-Bibliothek: Apache 2.0. Für kommerzielle Nutzung im Rahmen der Lizenzbedingungen — kein Ersatz für deine eigene Rechtsprüfung bei Spezialfällen.
Datenschutz lokal / DSGVO: was gewonnen ist, was nicht
Gewonnen: keine Weitergabe an einen US-/Cloud-LLM-Anbieter für genau diesen Request, wenn wirklich lokal. Nicht gewonnen: Geräteverlust, Backups in iCloud, Telemetrie anderer Apps, menschliche Fehlkonfiguration.
AbschlussHäufige Fragen
Brauche ich wirklich 24 GB?
Für einen sinnvollen Alltag mit dem Default-Tag: ja, plane damit.
Darunter berichten Tester Abstriche; 8–16 GB sind Experiment, kein Komfort. Dann eher kleineres Quant, kleinerer Kontext — oder ein anderes Modell.
Reicht Qwen3.8-27B als Opus-Ersatz?
Nein als pauschaler Chat-Ersatz — auf dem Air messe ich Sekunden bis Minuten, nicht Dialogtempo.
Ja für abgegrenzte Coding-/Agent-Jobs mit think: false und genug RAM. Dann zählt Vendor-Nähe zu Opus 4.6 in SE-Benchmarks — nicht jede Unterhaltung.
Merksatz: Entscheide über den Job. Brainstorming live → Cloud. Repo-Review über Nacht → lokal prüfbar.
Soll ich /no_think verwenden?
Nein. Bei Qwen3.8-27B unter Ollama wirkt /no_think in meiner Messung wie Default (Median ~36 s, Thinking an).
Nutze think: false in der API bzw. die Client-Option, die denselben Parameter setzt. Der alte Hybrid-Token aus der Qwen-Cloud-Doku gilt hier nicht.
Mac oder RTX?
Mac, wenn du leise, mobil und im Apple-Ökosystem bleiben willst (ggf. MLX-Tag).
RTX 4090/5090, wenn Token/s und Budget für eine GPU da sind. Beides ist erstklassig — abhängig vom Job, nicht vom Hype.
Ist der 262K-Kontext nutzbar?
Auf 24 GB praktisch nein für Alltag. Spec ≠ Sitzplatz.
Halte num_ctx klein (4K–8K für Routine). Ab 32K dauert bei mir schon ein Ping Minuten.
Darf ich es kommerziell nutzen?
Apache 2.0 laut Modellseite — plus deine Compliance-Prüfung.
Lokal betreiben ≠ automatisch jede Datenverarbeitung erlaubt. Sensible Kundenmails brauchen den lokalen Pfad und saubere Konfiguration (kein Tunnel „nebenbei“).
Nächster Schritt
Wenn Qwen3.8-27B für dich ein Baustein ist — nicht nur ein Wochenend-Download — schau dir an, wie lokale Modelle in wiederholbare Agent-Routinen passen: KI-Agenten.
Dort geht es um Workflows; hier um das Modell. Beides gehört zusammen, wenn du lokal produktiv werden willst.