Fase 0,5 — Inference-rig: Marktplaats-PC + MSI RTX 3090

Gepubliceerd: 5 sep 2026 · Laatste wijziging: 5 sep 2026

Fase 0,5: eerst draaien, dan bouwen

Dit is het tussenstation tussen "niets" en de geplande 2×3090-build (zie lokale-llm-server-rtx3090). De geheugen- en NAND-crisis van 2026 maakt nieuwe hardware extreem duur (64GB DDR5-6000: €1.100+, 4TB NVMe: €490). Dit plan haalt een werkende 2×RTX 3090/48GB inference-rig voor ~€1.900 cash in huis — ongeveer 80% van de capaciteit van de eindstond-build, voor circa 40% van het geld — zonder geld te steken in componenten die de crisis duur maken.

De logica in één zin: een tweedehands gaming-PC kopen waarin de GPU de hoofdprijs bepaalt, en daar de eigen (reeds gekochte) MSI RTX 3090 naast zetten. De host-onderdelen (CPU, bord, PSU, koeling) worden daarmee effectief bijna gratis meegenomen — precies de onderdelen die nieuw wél in de crisis-prijzen zitten.


De hardware

Uit de Marktplaats-PC (ASUS ROG gaming-box, €1.700 vast)

OnderdeelSpecRol in deze rig
ASUS ROG Strix RTX 3090 24GB3-slot, 323mm, GA102GPU #1 — dezelfde chip als de SUPRIM
Intel Core i9-12900K8P+8E cores, DDR4-4000Host-CPU — ruim voldoende, sneller dan de geplande 7600X
ASUS ROG Strix Z690-A GamingLGA1700, 2× M.2 extraMoederbord — zie compromissen hieronder
32GB DDR4-40002×16GBStartpunt — bewust, zie bottleneck-ladder
1TB NVMeM.2Startpunt — bewust, zie bottleneck-ladder
SilverStone SX1000 Platinum1000W, 80+ PlatinumVoeding — voldoende mét power limits
NZXT Kraken Z73360mm AIOWordt verkocht (~€80-120) — vervangen door een air cooler, zie hieronder

Uit eigen bezit

OnderdeelSpecStatus
MSI SUPRIM RTX 3090 24GB2.7-slot, 323mm, 420W (power-limited naar 300-350W)Reeds gekocht (€1.200), thermal pads vervangen — wordt GPU #2

Nog te kopen

OnderdeelKeuzePrijs (sep 2026)
KastFractal Design Meshify 2 XL€219
Intake-fans (optioneel)1-2× 140mm extra€25-50
KoelerArctic Freezer 36 (+ paste)~€30
Later, als de workload het aantoont+2×16GB DDR4-3600 (naar 64GB)~€280
Later, als de workload het aantoont+2TB NVMe~€259

Wat bewust níét gekocht wordt (voorlopig): geen UPS (Postgres-loze testfase overleeft stroomuitval; UPS komt terug in de eindstond-planning), geen nieuwe RAM of SSD in het klein, geen riser, geen nieuw bord. Power limits zijn gratis (config). De kast is de enige echte grote aankoop — de 9 slots en 549mm GPU-clearance van de Meshify 2 XL zijn harde eisen voor twee 2.7-3-slot-kaarten (een 7-slot-kast zoals de Meshify 3 XL laat geen ademruimte over).

Koeling: AIO eruit, air cooler erin

De Kraken Z73 wordt verkocht en vervangen door een Arctic Freezer 36 (€28, 157mm — past ruim onder de 185mm koeler-clearance van de Meshify 2 XL). Twee redenen:

  • Betrouwbaarheid: een AIO heeft een pomp die als eerste sterft (typisch 3-5 jaar); een tower cooler heeft één fan en een massief blok. Voor een machine die 24/7 onbeheerd draait is dat een hard voordeel, geen compromis.
  • De 12900K wordt power-limited toch al: PL1/PL2 op 125W (of lager) is voor deze GPU-gebonden workload vrijblijvend — de CPU doet tokenization en orkestratie, geen 241W sustained load. De Freezer 36 houdt hem daarmee koeil en stil.

Netto effect van de ruil: ~€90-160 winst op het totaalplaatje (Kraken ~€80-120 opbrengst, min €30 koeler). De CPU-pasta van de vorige eigenaar schoonmaken (isopropyl) bij demontage.


De rekening

PostBedrag
Marktplaats-PC (vaste prijs)€1.700
Meshify 2 XL€219
Arctic Freezer 36 + paste~€30
Optionele intake-fans€25-50
Min: oude (witte) gaming-kast los verkopen, leeg−€40-80
Min: NZXT Kraken Z73 los verkopen−€80-120
Cash nu nodig~€1.760-1.900
All-in incl. de eerder betaalde €1.200 voor de MSI SUPRIM~€2.960-3.100

Ter vergelijking: de geplande build stond op €5.250+ in de sep-2026 crisis-prijzen. Dit tussenstation zit er ~€2.200 onder en levert 70B Q4 vandaag in plaats van in 2028+. De duurste slijtage-onderdelen van de box (AIO-pomp, kast) worden verkocht en vervangen door betrouwbaardere of goedkopere varianten — de enige echte aankoop blijft de Meshify 2 XL.


Kan het Z690-bord twee RTX 3090's aan?

Ja, met twee bekende compromissen — en beide zijn voor deze stack overleefbaar.

Compromis 1: de tweede kaart loopt via de chipset op Gen4 x4

Slot 1 is CPU-verbonden (Gen5 x16). Het tweede x16-fysieke slot loopt via de chipset op x4. Voor llama.cpp layer-splitting is dat nauwelijks relevant: inter-GPU-verkeer is minimaal, het kost vooral model-laadtijd van kaart 2. Voor vLLM tensor-parallel zou dit een harde bottleneck zijn — maar die runtime wordt op dit bord niet gedraaid. Bij bouw: BIOS updaten en Resizable BAR aanzetten voor beide kaarten (meetbaar bij 24GB VRAM).

Compromis 2: fysiek krap — twee 2.7-3-slot-kaarten

De Strix (3-slot) neemt slots 1-3; het chipset-x16 landt rond slot 5-6, dus de SUPRIM komt eronder op ~slot 6-8. Dat betekent ~1 slot gapije tussen twee axiale koelers — het thermisch krapste punt van de hele build. Werkbaar met: power limits (~260-270W per kaart), mesh-front intake, en de optionele extra 140mm-fans. Dit is geen luxe-opstelling, maar voor gelimiteerde kaarten in een Meshify 2 XL thermisch verantwoord.

Compromis 3: het platform is terminal

LGA1700/DDR4 heeft geen upgrade-pad naar de eindstond-build (AM5/DDR5). Dat is bewust geaccepteerd: dit is een fase-0,5-machine, geen opwaardeerbare basis. Elke euro die hier bovenop pompt om het "eindstond-waardig" te maken is verloren — vandaar de strakke scope: alleen kast, pas later RAM/SSD als de workload het aantoont.


Bottleneck-ladder: wat limiteert inference eerst?

#1: 32GB RAM

  • 70B Q4 is ~47GB aan weights. Met 32GB RAM kan de page cache het model nooit vasthouden — model-laden wordt mmap-thrashen van de NVMe: minuten in plaats van seconden, bij elke herstart of modelwissel.
  • Eenmaal geladen zit alles in 48GB VRAM en is RAM geen probleem tijdens decode. Maar de escape-hatch (lagen naar CPU offloaden) en het RAG-werk eromheen (embeddings, vector store, document-cache) raken de muur.
  • Fix als het pijn doet: +2×16GB DDR4-3600 ≈ €280 (3 extra M.2-slots op het Z690 irrelevant hier; 4 DIMM's kunnen de klok van 4000 naar 3600 drukken — irrelevant voor deze workload).

#2: 1TB NVMe

  • Geen doorvoerprobleem, wel een capaciteitsprobleem: 70B Q4 (~47GB) + 32B-varianten + embeddings + OS + Docker vullen de schijf binnen enkele weken.
  • Prima om te starten (2-3 modellen resident), maar de eerste uitbreiding die gewenst zal worden is +2TB (~€259 in de crisis). Het Z690 heeft 3 M.2-slots, dus dit is een instapklus, geen herbouw.

Staande beperkingen (instellingen, geen aankopen)

  • PSU power limits: 2×3090 met ~260-270W limiet = ~540W GPU + ~250W CPU = ~800W piek. De SX1000 Platinum draait dat bij ~80% belasting — binnen marge, mits de limits ingesteld staan.
  • x4-link voor kaart 2: non-issue voor llama.cpp layer-splitting (zie boven).
  • CPU power limit: 12900K op PL1/PL2 = 125W houdt de Freezer 36 comfortabel en stil; voor deze GPU-gebonden workload kost dat niets aan inference-snelheid.

Wat deze rig levert

ScenarioVerwachting
32B Q4 (1 kaart, of beide met ruimte voor context)~25-35 tok/s decode, prefill 700-1000 tok/s — de sweet spot
70B Q4, volledig in 48GB VRAM (layer-split over 2 kaarten)~15-20 tok/s decode — geen CPU-offload nodig
RAG-prefill 10k tokens (70B, 2 kaarten)~6-8s time-to-first-token; met prompt caching (KV-reuse tussen agent-stappen) daalt de effectieve TTFT per stap sterk
Agentic loads (geplande batch: mail-triage, agenda-briefing, Todoist-review)Dit is het beoogde gebruik. 70B met prompt caching is betrouwbaar genoeg voor 10-20-staps loops; latency is irrelevant bij nachtelijke batch.
Multi-agent / meerdere residente modellenNiet mogelijk — 48GB VRAM = één model resident. Dit blijft voorbehouden aan hosted modellen of de eindstond-build.

Bouwvolgorde

  1. Week 1: Marktplaats-PC kopen (GPU-healthcheck bij overname: gpu-burn/FurMark 15 min + memtest_vulkan), verse OS-installatie, Strix 3090 solo testen. 32B Q4 draaien.
  2. Week 1-2: Meshify 2 XL (€219) en Freezer 36 (€28) bestellen, systeem verhuizen: Kraken demonteren en los verkopen, Freezer 36 monteren (CPU-pasta schoonmaken), oude kast leeg verkopen.
  3. Week 2-3: SUPRIM in het chipset-slot, power limits configureren (~260-270W/kaart), Resizable BAR aan, BIOS-update. 70B Q4 layer-splitting testen.
  4. Later, op aanwijzing van de workload: RAM naar 64GB (+2×16GB, €280), SSD naar 3TB (+2TB, €259).
  5. 2028+, als de geheugenmarkt normaliseert: de geplande eindstond-build (AM5/DDR5, 128GB, 4TB, UPS) bouwen. Deze rig blijft dan developer/test-station of verhuist de kaarten mee.

Prijsdisclaimer

Nieuwprijzen live geverifiëerd via Alternate, 5 sep 2026. Tweedehandsprijzen zijn geïnformeerde schattingen op basis van Marktplaats-trends (±15% marge). De geheugen- en NAND-crisis van 2026 maakt alle opslag- en geheugenprijzen volatiel; componenten die in dit plan bewust uitgesteld worden (RAM, SSD) worden pas gekocht als de workload ze aantoont — uitstellen kost in deze markt weinig en levert mogelijk veel op.