AI lokaal draaien: welke computer heb je écht nodig?

Koop geen AI-computer omdat er een indrukwekkende videokaart in zit. Kies eerst het model en de taken die je ermee wilt uitvoeren. Voor een nieuwe computer waarop je grotere lokale modellen wilt draaien naast je dagelijkse software, adviseren we minstens 64 GB systeem-RAM. Dat is een aankoopadvies, geen harde ondergrens. GLM-5.3-Flash vraagt ook bij kleine kwantisaties een ruimer geheugenbudget; bij Qwen3.8-Flash-Next kan NVMe-offload juist veel snel geheugen besparen. Een klein model probeer je nog steeds gratis op de laptop die je al hebt.

Dit artikel zet de specificaties eerlijk op een rij voor bedrijven in België en Nederland: hoeveel geheugen moderne modellen écht vragen, welke computers met gedeeld geheugen er inmiddels bestaan, wat RAM en videokaarten momenteel kosten en wanneer de hybride route slimmer is dan alles lokaal forceren.

AI lokaal draaien op een mini-pc
Kleine modellen draaien op bescheiden hardware; zwaardere taken roepen een extern model aan.

Wat is een lokale AI-computer?

Een lokale AI-computer voert een model uit in je eigen omgeving, in plaats van op de servers van een modelprovider. Dat kan een pc met een losse videokaart zijn, een compacte computer met gedeeld geheugen of een Mac met unified memory.

Bij volledig lokale verwerking hoeven je opdrachten en bestanden niet naar een externe modelprovider. Maar lokaal is geen automatische privacygarantie: een agent kan nog steeds een externe API of webzoekfunctie gebruiken. Je bepaalt dus zelf welke verbindingen toegestaan zijn. De Ollama-documentatie beschrijft bijvoorbeeld hoe je cloudfuncties volledig uitschakelt.

Je betaalt bij lokale inferentie niet per token aan een modelprovider. Hardware, stroom, updates en support blijven wel kosten. En meer parameters betekenen niet automatisch een beter antwoord: modelarchitectuur, training en de concrete taak tellen ook mee.

De specificaties die er echt toe doen

Systeem-RAM is de laatste jaren onderschat. De oude richtlijn van 32 GB laat weinig werkruimte als je tegelijk een groter model, een agent, een browser en documentverwerking wilt gebruiken. Kies bij aankoop niet alleen een hoeveelheid RAM, maar controleer het geheugenbudget van de exacte modelvariant in de tabel hieronder. De kwantisatie, contextlengte en gekozen offloadroute bepalen samen wat je nodig hebt.

Bij een losse GPU zijn systeem-RAM en videogeheugen twee verschillende dingen. Een pc met 64 GB RAM en een videokaart met 16 GB VRAM heeft niet ineens 80 GB snel GPU-geheugen. Moeten veel modelberekeningen naar de CPU omdat de gewichten niet in VRAM passen, dan kan de snelheid flink dalen. Gerichte offload van een n-gram-opzoektabel is iets anders: die hoeft niet continu als geheel te worden doorgerekend. Met ollama ps controleer je bij Ollama waar het model werkelijk draait.

Kwantisatie verkleint de modelgewichten door getallen met minder precisie op te slaan. De vuistregel van ongeveer een halve GB per miljard parameters bij 4-bit geldt alleen voor die gewichten. Schalen, niet-gequantiseerde onderdelen, beeldverwerking, tijdelijke buffers en de contextcache komen daar nog bij. In de sessie hieronder rapporteert ollama ps 18 GB geheugengebruik bij een contextinstelling van 32.768 tokens. Dat is één concrete opstelling, geen vaste verhouding tussen downloadgrootte en geheugengebruik. Ook bij een MoE-model moet je álle experts opslaan, niet alleen de actieve. En een groot contextvenster op de modelpagina betekent niet dat je dat venster gratis kunt gebruiken: meer context vraagt meer geheugen.

Kies daarnaast snelle NVMe-opslag met ruimte voor meerdere modellen: grote modelpakketten kunnen inmiddels honderden GB per stuk vragen.

Welke lokale modellen kun je praktisch draaien?

Onderstaande selectie combineert veelgebruikte families uit de Ollama-bibliotheek met recente open modellen. Het is geen ranglijst van de slimste AI. De modelnamen linken naar Hugging Face. De pakketgroottes komen uit de vermelde Ollama-varianten, voor Qwen3.8-Flash-Next uit de Atomic Dynamic-builds en voor GLM-5.3-Flash uit de Unsloth-GGUF-bestanden en voor de twee nieuwste modellen uit de Ollama-modelpagina's (gecontroleerd op 15 september 2026). Het geheugenadvies hoort bij die specifieke builds. Downloadgrootte is niet hetzelfde als geheugengebruik: bij offload blijft een deel op SSD, terwijl context, beeldverwerking en parallelle taken extra geheugen vragen.

Model en variantParametersModelpakketPraktisch geheugenbudgetWaarvoor bekijken?

3B, dense

2,0 GB

circa 6 GB met 32K context

Leren werken met lokale AI op bestaande hardware

9B, dense

6,6 GB

12 tot 16 GB

Tekst, documentvragen en beeldbegrip met een klein model

12B, dense

7,6 GB

12 tot 16 GB

Tekst, redeneren en multimodale taken

21B, 3,6B actief

14 GB

16 GB gedocumenteerde ondergrens

Redeneren, programmeren en toolgebruik

27B, dense

18 GB

18 GB gemeten op een 32 GB GPU

Programmeerwerk, document- en beeldanalyse

35B, 3B actief

23 GB

circa 32 GB

Coding, werken met repositories en tools aanroepen

117B, 5,1B actief

65 GB

één GPU met 80 GB is gedocumenteerd

Zwaarder redeneerwerk en agenttaken

122B, 10B actief

81 GB

128 GB-systeem met circa 96 GB voor het model

Complexere tekst-, beeld- en agenttaken

125B/6B actief, plus n-gram en MTP

84,9–110,5 GB (Atomic Dynamic GGUF, excl. vision-projector)

Vanaf 64 GB unified op Mac met passende build en n-gram op NVMe; 128 GB als vertrekpunt voor volledig in geheugen

Multimodale agents, coding, experimenteel

320B, 18B actief (MoE)

199,7 GB (UD-Q4_K_XL, dynamisch 4-bit)

256 GB aanbevolen voor deze quant; kleine quants op 128 GB

Zwaarste model in deze selectie: coding met agents en multimodaal werk

30B, dense, multimodaal

18 GB

24 GB VRAM met 4-bit-quant van Meta

24/7 lokale agents met toolgebruik

30B MoE, 3B actief

25 GB

circa 32 GB

Snelle agenttaken met 1M context

Voor Qwen3.8-Flash-Next geldt: de verpakking is groter dan het etiket doet vermoeden. Naast het hoofdmodel van 125B met 6B actieve parameters bevat het pakket een n-gram-opzoektabel en een MTP-component, samen goed voor ongeveer 180B parameters. Maar niet alles hoeft permanent in snel geheugen te passen. De Qwen-README beschrijft de n-gram-tabel expliciet als geschikt voor offload naar hostgeheugen, met asynchroon vooraf ophalen. Met geschikte runtimes kan die tabel ook op NVMe blijven, waarbij alleen de benodigde delen worden ingelezen.

De Atomic Chat-gids documenteert een kleine Atomic Dynamic-build op een Mac met 64 GB unified memory, met de n-gram-tabel op SSD. 96 GB is dus niet per definitie te krap. Dit vraagt wel een passende kwantisatie en runtime met n-gram-offload; het is geen belofte dat elk Ollama- of LM Studio-pakket zo werkt.

Eindgebruikers rapporteren met NVMe-offload grofweg 22–40 tokens per seconde bij tekstgeneratie op verschillende DGX Spark-opstellingen. Het snelheidsverlies blijft in die tests beperkt, maar de metingen in Hugging Face-discussie #11 laten ook zien dat promptverwerking trager kan worden. Hardware, kwantisatie, context en runtime maken verschil. Volledig in geheugen blijft doorgaans sneller en eenvoudiger, vooral bij lange prompts; met een passende kwantisatie is 128 GB daarvoor een praktisch vertrekpunt.

Onze eigen opstelling bij Voltti laat zien dat het met minder kan. Daar draait Qwen3.8-Flash-Next als EXL3-kwantisatie van 3,05 bits per gewicht in TabbyAPI met ExLlamaV3 als runtime, op een computer met een RTX 5090 (32 GB videogeheugen) en 60 GB werkgeheugen. De runtime houdt de gewichten op de videokaart en de zware n-gram-opzoektabel in het werkgeheugen, precies zoals de Qwen-README voor die opzet beschrijft. Bij dagelijks agentwerk op die machine meten we consistent 50 tot 60 tokens per seconde, met ruim 700 tokens per seconde voor nieuwe promptinvoer. Dat is geen benchmarkrecord, maar het laat zien dat 128 GB geen harde eis is om dit model prettig te laten draaien, zolang de kwantisatie en de runtime bij het model passen.

GLM-5.3-Flash van Z.ai is qua modelomvang nog zwaarder dan Qwen3.8-Flash-Next en gpt-oss:120b, maar kan met voldoende geheugen volledig lokaal draaien. Het multimodale model heeft een MIT-licentie en een contextvenster van ongeveer 1 miljoen tokens. Unsloth's dynamische 4-bitvariant UD-Q4_K_XL is 199,7 GB; daarvoor adviseren we een computer met 256 GB geheugen. Kleinere dynamische quants kunnen op 128 GB, met minder precisie en beperkte ruimte voor context. De 1-bitvariant UD-IQ1_S is bijvoorbeeld 93,1 GB. Dat is alleen het modelpakket: het volledige contextvenster past niet automatisch naast de gewichten. Let op bij de Ollama-modelpagina: die biedt alleen glm-5.3-flash:cloud, gehost door Ollama in de VS en Europa, niet op jouw computer. Voor de lokale route gebruik je Unsloth-GGUF's via Unsloth Desktop of de geschikte llama.cpp-build uit de Unsloth-gids.

Ook twee nieuwe modellen richten zich specifiek op lokale agents. Muse Glimmer van Meta (10 augustus 2026, Apache 2.0) is een dense 30B-model met beeldingang en 128K context; Meta's eigen 4-bit-quant van 17 GB past in 24 GB VRAM, zodat één consumenten-videokaart volstaat. Nemotron 3.5 Lightning van NVIDIA (11 augustus 2026) is een MoE-model met 30B totaal en slechts 3B actieve parameters, met een contextvenster tot 1 miljoen tokens. Het Ollama-pakket is 25 GB; NVIDIA noemt één DGX Spark of RTX 5090 als minimale opstelling. Voor wie een agent continu wil laten doorwerken, verlagen deze twee de drempel aanzienlijk.

Wil je zelf aan de slag? Ollama draait een model met één commando en LM Studio geeft een grafische omgeving om modellen naast elkaar te proberen. Beide tools zijn gratis. Het terminalvenster hieronder toont een echte sessie van onze eigen testmachine: we laden Qwen3.8 in de 27B-variant met 4-bit-compressie, stellen één vraag en bekijken daarna met ollama ps waar het model terechtkomt.

ollama — qwen3.8:27b laden en draaien

$ ollama pull qwen3.8:27b-q4_K_M

$ ollama pull qwen3.8:27b-q4_K_M
pulling manifest
pulling ac3714bfddde: 100% ▕██████████████████▏ 931 MB
pulling f5f1dd8920d4: 100% ▕██████████████████▏  16 GB
pulling 4c6a8e842ef0: 100% ▕██████████████████▏  11 KB
pulling 448d29437397: 100% ▕██████████████████▏   92 B
pulling 492b2922d38e: 100% ▕██████████████████▏  215 B
verifying sha256 digest
writing manifest
success
$ ollama run qwen3.8:27b-q4_K_M
>>> Geef in exact één korte zin aan dat je lokaal draait.
Ik draai lokaal.
$ ollama ps
NAME                  ID               SIZE     PROCESSOR    CONTEXT    UNTIL
qwen3.8:27b-q4_K_M      25b843619e94     18 GB    100% GPU     32768      29 minutes from now
Echte sessie op onze eigen testmachine met een RTX 5090 (32 GB): het modelpakket is 16 GB, het geheugengebruik met 32K context is 18 GB.
ollama — qwen3.8:27b laden en draaien

$ ollama pull qwen3.8:27b-q4_K_M

$ ollama pull qwen3.8:27b-q4_K_M
pulling manifest
pulling ac3714bfddde: 100% ▕██████████████████▏ 931 MB
pulling f5f1dd8920d4: 100% ▕██████████████████▏  16 GB
pulling 4c6a8e842ef0: 100% ▕██████████████████▏  11 KB
pulling 448d29437397: 100% ▕██████████████████▏   92 B
pulling 492b2922d38e: 100% ▕██████████████████▏  215 B
verifying sha256 digest
writing manifest
success
$ ollama run qwen3.8:27b-q4_K_M
>>> Geef in exact één korte zin aan dat je lokaal draait.
Ik draai lokaal.
$ ollama ps
NAME                  ID               SIZE     PROCESSOR    CONTEXT    UNTIL
qwen3.8:27b-q4_K_M      25b843619e94     18 GB    100% GPU     32768      29 minutes from now

AI-computers met unified memory

Een losse videokaart is niet meer de enige route. Bij unified of gedeeld geheugen gebruiken CPU en GPU dezelfde fysieke geheugenpool, waardoor je op een compacte computer modellen kunt laden die niet in het VRAM van een gewone videokaart passen. Maar capaciteit is niet hetzelfde als snelheid: geheugenbandbreedte, GPU-rekenkracht en softwareondersteuning blijven bepalend. Een computer waarop het model nét past, is niet automatisch een prettige werkplek voor een heel team.

Drie families domineren dit segment. De NVIDIA DGX Spark combineert de GB10 Grace Blackwell Superchip met 128 GB coherent LPDDR5x-geheugen (273 GB/s) en een 4 TB NVMe-SSD. NVIDIA positioneert het toestel expliciet voor modellen tot 200 miljard parameters. Bij onze controle op 7 september stond de Founders Edition bij Alternate in Nederland op voorraad voor € 6.399. Let op: het systeem draait op Arm, controleer dus de compatibiliteit van je andere software.

De Mac Studio kreeg op 25 augustus een nieuwe generatie met M5 Max (tot 128 GB centraal geheugen) en M5 Ultra (tot 512 GB). Apple noemt het expliciet een desktop voor on-device AI die gigantische taalmodellen volledig lokaal draait. De Apple Store in België en Nederland toont vanafprijzen van € 3.029 (M5 Max) en € 6.649 (M5 Ultra); de levering begint volgens Apple op 22 september en de 512 GB-optie volgt eind oktober. Dat zijn basisconfiguraties, geen AI-maximale uitvoeringen.

En dan is er de AMD Strix Halo-familie: de Ryzen AI Max+ 395 combineert 16 Zen 5-cores met Radeon 8060S-graphics en ondersteunt tot 128 GB unified memory, waarvan volgens AMD tot 96 GB als grafisch geheugen kan dienen via Variable Graphics Memory. Compacte mini-pc's zoals de GMKtec EVO-X2 met 128 GB kosten rond de € 3.360. Het LPDDR5x-geheugen is gesoldeerd en dus niet achteraf uitbreidbaar; kies de capaciteit bij aankoop. Boven dit segment bestaat nog de DGX Station met 748 GB geheugen (252 GB HBM3e bij de GPU plus 496 GB LPDDR5X bij de CPU), een andere investeringscategorie die je laat offreren op je eigen workload.

ComputerGeheugenGeheugenbandbreedtePrijsKarakter

Gewone pc + losse GPU

32-64 GB RAM + 16-24 GB VRAM

VRAM: 500-1.800 GB/s

€ 2.000 - € 5.000

Klassieke route, snelste geheugenlaag

AMD Strix Halo mini-pc

128 GB unified (96 GB GPU-toewijsbaar)

circa 256 GB/s

rond € 3.400

Veel geheugen, x86-software

Apple Mac Studio M5 Ultra

tot 512 GB unified

1,2 TB/s

vanaf € 6.649

Veel unified memory, MLX-ecosysteem

NVIDIA DGX Spark

128 GB coherent unified

273 GB/s

rond € 6.400

Compleet NVIDIA AI-platform, Arm

Enterprise-server (multi-GPU)

honderden GB HBM

enkele TB/s per GPU

Offerte op maat

Grote modellen en meerdere gelijktijdige gebruikers

RAM- en GPU-prijzen veranderen je aankoopbeslissing

Wie vandaag een AI-computer plant, stuit op een marktbreed fenomeen: geheugen wordt schaars en duur omdat datacenters het opslorpen. TrendForce rapporteerde dat de contractprijzen voor conventioneel DRAM in het eerste kwartaal van 2026 ongeveer 93 tot 98 procent hoger lagen dan het kwartaal ervoor, en voorspelde voor het tweede kwartaal opnieuw een stijging van 58 tot 63 procent. De industrie wijst leveranciers de richting: hoogcapacitaire servermodules voor AI-servers krijgen voorrang, waardoor er minder ruimte overblijft voor gewoon pc-geheugen. Dat is een industrieel contractcijfer, niet de winkelprijs van jouw DDR5-kit, maar de RAM-prijstracker van Tom's Hardware laat zien dat consumentenmodules dezelfde curve volgen.

Videokaarten volgen hetzelfde patroon. De GPU-prijsmeting van TechSpot van eind augustus 2026 concludeerde dat kaartprijzen in één maand tijd met zo'n 15 procent stegen, over tien landen gemeten, met GeForce-kaarten voor de grootste klappen. De oorspronkelijke adviesprijs is dus geen betrouwbaar budget meer: vergelijk complete offertes en neem RAM, opslag, voeding, koeling, installatie en support mee in de vergelijking. In deze markt kan een unified-memory-computer met vast geheugen soms voordeliger uitvallen dan een uitbreidbare pc die je vandaag alvast moet opvoeren.

Prijs van een 32GB DDR5-6000 kit (2x16GB)

Voortschrijdend gemiddelde van de laagste Amerikaanse winkelprijzen. De sprong eind 2025 volgt uit de verschuiving van DRAM-productie naar geheugen voor AI-servers.

0200400600mrt 2025jul 2025sep 2025dec 2025mrt 2026jun 2026sep 2026mrt 2025: $ 120jul 2025: $ 115sep 2025: $ 130dec 2025: $ 450mrt 2026: $ 525jun 2026: $ 550sep 2026: $ 590
Prijs van een 32GB DDR5-6000 kit (2x16GB). Lijngrafiek met 7 datapunten in $, laagste waarde $ 115, hoogste waarde $ 590.
PeriodePrijs in dollar
mrt 2025$ 120
jul 2025$ 115
sep 2025$ 130
dec 2025$ 450
mrt 2026$ 525
jun 2026$ 550
sep 2026$ 590
Bron: PCPartPicker, september 2026

De GeForce RTX 5090 maakt dat concreet. Met 32 GB videogeheugen is dit de kaart uit onze eigen testsessie hierboven. De adviesprijs bij de lancering in januari 2025 was $ 1.999; de gemiddelde Amerikaanse marktprijs ligt in september 2026 rond $ 4.500 — ruim het dubbele.

Prijs van een NVIDIA GeForce RTX 5090

Gemiddelde Amerikaanse marktprijs van alle beschikbare RTX 5090-modellen. De NVIDIA-adviesprijs voor deze kaart is $ 1.999.

25003000350040004500mrt 2025jul 2025sep 2025dec 2025mrt 2026jun 2026sep 2026mrt 2025: $ 2700jul 2025: $ 3200sep 2025: $ 2900dec 2025: $ 2850mrt 2026: $ 3650jun 2026: $ 3850sep 2026: $ 4500
Prijs van een NVIDIA GeForce RTX 5090. Lijngrafiek met 7 datapunten in $, laagste waarde $ 2700, hoogste waarde $ 4500.
PeriodePrijs in dollar
mrt 2025$ 2700
jul 2025$ 3200
sep 2025$ 2900
dec 2025$ 2850
mrt 2026$ 3650
jun 2026$ 3850
sep 2026$ 4500
Bron: PCPartPicker, september 2026

Wanneer een Linux-computer voor je AI-agent logisch is

Een model draaien en een agent laten werken zijn twee verschillende dingen. Het model genereert antwoorden; de agent koppelt daar tools, bestanden en vervolgacties aan. Voor terugkerende taken past een eigen Linux-computer in je netwerk: een plek waar processen beschikbaar blijven, met afgebakende rechten en menselijke controle op gevoelige acties. Zo werkt het bij ons zelf: onze eigen Hermes-installatie bij Voltti draait op een Linux-machine in eigen beheer.

De agentcomputer hoeft niet dezelfde machine te zijn als de modelserver. Een compacte lokale node kan taken organiseren terwijl een zwaardere computer in hetzelfde netwerk het model uitvoert. Meer over die scheiding lees je in wanneer je een Linux-computer voor een AI-agent nodig hebt.

Lokale AI vs cloud: waar de grens ligt

Lokale modellen zijn niet meer alleen geschikt voor korte samenvattingen: de huidige families ondersteunen coding, beeldbegrip en toolgebruik. Sommige toonaangevende modellen zijn alleen via een externe dienst beschikbaar; meer hardware maakt die niet ineens lokaal uitvoerbaar. Voor grote downloadbare modellen kan een zwaardere workstation of multi-GPU-server nodig zijn. Vergelijk de kwaliteit en snelheid op je eigen taken voordat je zo’n investering doet.

De vergelijking gaat zelden over beter of slechter, maar over wat je waar plaatst. Gevoelige data en taken die in je eigen netwerk moeten blijven, verwerk je lokaal. Een extern model kan zinvol zijn als het op jouw taak aantoonbaar beter werkt en de gegevens je netwerk mogen verlaten. Het volledige overzicht staat in onze vergelijking van lokale AI versus cloud-AI.

Hybride is vaak de praktische keuze

Hybride kan een praktische route zijn: de agent en de aansturing blijven in je eigen omgeving, terwijl je geselecteerde taken via een API aan een extern model geeft. Dat hoeft niet alleen zwaar werk te zijn; de keuze hangt af van kwaliteit, snelheid, kosten en privacy. Eén kanttekening hoort daarbij: tekst en bestandsinhoud die je in een API-verzoek meestuurt, verlaten je netwerk wel degelijk. Bepaal vooraf welke informatie mee mag en laat gevoelige acties door een mens goedkeuren.

Back-ups gaan versleuteld naar een aparte locatie in je eigen netwerk, nooit naar de machine zelf. Ook dat hoort bij een bruikbare opstelling, net als updates, hersteltests en duidelijke toegangsrechten.

Hoe ziet dat eruit in de praktijk? Lees over lokale en hybride AI voor bedrijven, over wat er bij hybride AI lokaal blijft en over veilig en privé met AI werken. Voltti installeert en geeft support voor die opstellingen in België en Nederland, steeds met een offerte op maat.

Portretfoto van Seppe Gadeyne

Seppe Gadeyne

  • Artikel werd geüpdate op

    Veelgestelde vragen

    01Heb ik echt minimaal 64 GB RAM nodig voor lokale AI?

    Niet om te beginnen: kleine modellen draaien ook op 16 GB. Maar voor een nieuwe computer die serieuze lokale AI, een agent en je gewone werksoftware moet combineren, is 64 GB systeem-RAM een verstandig vertrekpunt. Zie het als werkruimte voor nu en voor de modellen van volgend jaar, niet als harde systeemeis.

    02Is 96 GB genoeg voor de zwaarste lokale modellen?

    Soms wel, maar pakketgrootte alleen geeft geen antwoord. Als alles in geheugen blijft, kan 96 GB unified memory ruimte bieden voor een modelpakket van grofweg 80 GB, mits runtime, context en andere software in de resterende ruimte passen. Het is geen garantie. Qwen3.8-Flash-Next kan met een geschikte build en de n-gram-tabel op NVMe ook op een Mac met 64 of 96 GB draaien. Dat is een modelspecifieke offloadroute, geen algemene vuistregel voor alle grote modellen. Voor GLM-5.3-Flash blijft 96 GB geen praktisch aankoopadvies: kijk naar 128 GB voor kleine dynamische quants en 256 GB voor de circa 200 GB grote UD-Q4_K_XL-variant. Test altijd de contextlengte en taken die je echt wilt gebruiken.

    03Wat is beter: een losse videokaart of een computer met unified memory?

    Dat hangt af van je doelen. Een losse GPU biedt het snelste geheugen voor modellen die erin passen en is flexibel uit te bouwen. Unified-memory-computers zoals de DGX Spark, Mac Studio of Strix Halo mini-pc's bieden veel meer capaciteit voor grotere modellen in een compact, zuinig formaat, maar het geheugen is langzamer en niet uitbreidbaar. Voor de meeste bedrijven is de keuze praktisch: welke modellen wil je draaien en welke software ondersteunt je omgeving?

    04Wat is de goedkoopste manier om te beginnen?

    Installeer Ollama of LM Studio op de computer die je al hebt en probeer een klein model. Dat kost niets en je voelt meteen wat je huidige machine aankan. Koop pas hardware als je weet welke modellen je echt wil draaien.

    05Waar blijven mijn back-ups in een lokale opstelling?

    Nooit op de AI-computer zelf. Back-ups gaan versleuteld naar een aparte locatie in je eigen netwerk, zodat een defect of inbraak op de machine je data niet meeneemt.

    Bespreek je hardware-vragen

    Bespreek je pilot