Voor Qwen3.8-Flash-Next geldt: de verpakking is groter dan het etiket doet vermoeden. Naast het hoofdmodel van 125B met 6B actieve parameters bevat het pakket een n-gram-opzoektabel en een MTP-component, samen goed voor ongeveer 180B parameters. Maar niet alles hoeft permanent in snel geheugen te passen. De Qwen-README beschrijft de n-gram-tabel expliciet als geschikt voor offload naar hostgeheugen, met asynchroon vooraf ophalen. Met geschikte runtimes kan die tabel ook op NVMe blijven, waarbij alleen de benodigde delen worden ingelezen.
De Atomic Chat-gids documenteert een kleine Atomic Dynamic-build op een Mac met 64 GB unified memory, met de n-gram-tabel op SSD. 96 GB is dus niet per definitie te krap. Dit vraagt wel een passende kwantisatie en runtime met n-gram-offload; het is geen belofte dat elk Ollama- of LM Studio-pakket zo werkt.
Eindgebruikers rapporteren met NVMe-offload grofweg 22–40 tokens per seconde bij tekstgeneratie op verschillende DGX Spark-opstellingen. Het snelheidsverlies blijft in die tests beperkt, maar de metingen in Hugging Face-discussie #11 laten ook zien dat promptverwerking trager kan worden. Hardware, kwantisatie, context en runtime maken verschil. Volledig in geheugen blijft doorgaans sneller en eenvoudiger, vooral bij lange prompts; met een passende kwantisatie is 128 GB daarvoor een praktisch vertrekpunt.
Onze eigen opstelling bij Voltti laat zien dat het met minder kan. Daar draait Qwen3.8-Flash-Next als EXL3-kwantisatie van 3,05 bits per gewicht in TabbyAPI met ExLlamaV3 als runtime, op een computer met een RTX 5090 (32 GB videogeheugen) en 60 GB werkgeheugen. De runtime houdt de gewichten op de videokaart en de zware n-gram-opzoektabel in het werkgeheugen, precies zoals de Qwen-README voor die opzet beschrijft. Bij dagelijks agentwerk op die machine meten we consistent 50 tot 60 tokens per seconde, met ruim 700 tokens per seconde voor nieuwe promptinvoer. Dat is geen benchmarkrecord, maar het laat zien dat 128 GB geen harde eis is om dit model prettig te laten draaien, zolang de kwantisatie en de runtime bij het model passen.
GLM-5.3-Flash van Z.ai is qua modelomvang nog zwaarder dan Qwen3.8-Flash-Next en gpt-oss:120b, maar kan met voldoende geheugen volledig lokaal draaien. Het multimodale model heeft een MIT-licentie en een contextvenster van ongeveer 1 miljoen tokens. Unsloth's dynamische 4-bitvariant UD-Q4_K_XL is 199,7 GB; daarvoor adviseren we een computer met 256 GB geheugen. Kleinere dynamische quants kunnen op 128 GB, met minder precisie en beperkte ruimte voor context. De 1-bitvariant UD-IQ1_S is bijvoorbeeld 93,1 GB. Dat is alleen het modelpakket: het volledige contextvenster past niet automatisch naast de gewichten. Let op bij de Ollama-modelpagina: die biedt alleen glm-5.3-flash:cloud, gehost door Ollama in de VS en Europa, niet op jouw computer. Voor de lokale route gebruik je Unsloth-GGUF's via Unsloth Desktop of de geschikte llama.cpp-build uit de Unsloth-gids.
Ook twee nieuwe modellen richten zich specifiek op lokale agents. Muse Glimmer van Meta (10 augustus 2026, Apache 2.0) is een dense 30B-model met beeldingang en 128K context; Meta's eigen 4-bit-quant van 17 GB past in 24 GB VRAM, zodat één consumenten-videokaart volstaat. Nemotron 3.5 Lightning van NVIDIA (11 augustus 2026) is een MoE-model met 30B totaal en slechts 3B actieve parameters, met een contextvenster tot 1 miljoen tokens. Het Ollama-pakket is 25 GB; NVIDIA noemt één DGX Spark of RTX 5090 als minimale opstelling. Voor wie een agent continu wil laten doorwerken, verlagen deze twee de drempel aanzienlijk.
Wil je zelf aan de slag? Ollama draait een model met één commando en LM Studio geeft een grafische omgeving om modellen naast elkaar te proberen. Beide tools zijn gratis. Het terminalvenster hieronder toont een echte sessie van onze eigen testmachine: we laden Qwen3.8 in de 27B-variant met 4-bit-compressie, stellen één vraag en bekijken daarna met ollama ps waar het model terechtkomt.