AIWAYKE
Blog
21. September 2026/1 minKIAutomation

Qwen3 A3B lokal: Warum 32 GB RAM heute mehr bringen als eine dicke Grafikkarte

20 bis 30 Tokens pro Sekunde, lokal, auf einem Laptop mit RTX 4060 und gerade mal 8 GB VRAM. Das war mein Ergebnis mit Qwen3 in der A3B-Variante über LM Studio, und ehrlich gesagt hab ich vorher mit deutlich weniger gerechnet.

Der Grund dafür steckt in der Architektur. Qwen3 ist ein MoE-Modell, also Mixture of Experts. Statt bei jeder Anfrage das komplette Modell anzuwerfen, werden nur die kleinen Experten losgeschickt, die für eure Frage gerade zuständig sind. Das A3B im Namen sagt genau das aus, effektiv sind nur rund drei Milliarden Parameter permanent aktiv. Der ganze Rest liegt währenddessen im CPU-RAM und nicht auf der Grafikkarte.

In der Praxis heißt das für euch, dass die teure GPU plötzlich nicht mehr der Flaschenhals ist. Acht bis sechzehn Gigabyte VRAM reichen bei diesem Modell vollkommen, viel wichtiger ist euer Arbeitsspeicher, und da solltet ihr bei ungefähr 32 GB landen. In der Q4-Quantisierung sind dann je nach Rechner 20 bis 40 Tokens die Sekunde drin. Mein Laptop mit 32 GB DDR5 liegt eben im unteren Bereich davon, und das ist für so ein mittelmäßiges Gaming-Setup schon erstaunlich.

Gerade das finde ich am MoE-Ansatz super spannend und es zeigt bereits die Richtung auf, in die sich lokale KI zukünftig bewegt. Ich glaube nämlich, dass langfristig die Speicherbandbreite wichtiger sein wird, als die pure GPU VRAM Zahl.

Coden geht mit Qwen 3.6 35B übrigens auch ganz ordentlich, ihr hängt das Modell einfach an ein Coding Harness wie OpenCode. Rechnet da aber mit spürbar weniger Tokens pro Sekunde als beim reinen Chatten, weil Tool Calls in einer Programmiersession richtig Kontext fressen.

Dokumentenverwaltung, RAG, interne Notizen sortieren, einfach assistieren. Das sind hier definitiv die wahren Stärken dieses Modell's.

Damit wünsche ich euch einen guten Start in die Woche! Gruß, Chris