AI-hemmalabb: hårdvara, VRAM och vad det faktiskt kostar
Ett hemmalabb har hårdvara, modell och harness. VRAM styr vad du kan köra; elförbrukning och kylning är verkliga kostnader. 80/20 local/cloud är ofta klokt.
Kort sagt
Ett AI-hemmalabb har tre delar: hårdvara (där modellen körs), modellen själv (hjärnan) och harness (mjukvaran som gör modellen till en agent med verktyg, minne och loopar).
VRAM är den kritiska budgeten. Mer VRAM låter dig köra större modeller, längre kontext eller flera modeller samtidigt. Elräkningen (watt) och kylning är ofta underskattade kostnader.
När är detta användbart?
- När du utvärderar om lokal drift lönar sig jämfört med cloud för dina uppgifter.
- För att dimensionera en maskin eller uppgradera befintlig hårdvara.
- För att förstå varför “billig” open-weight-modell ändå kan bli dyr i praktiken.
Gör så här
-
Börja med arbetslasten
- Interaktiv agent? → behöver låg latens och bra prefill.
- Batch eller långa kontexter? → mer VRAM och minne.
-
VRAM-trilemma
- Modellstorlek (parametrar)
- Kontextlängd
- Hastighet / samtidighet Välj två – den tredje blir begränsad.
-
Hårdvarukarta (exempelriktlinjer)
- En bra 24–32 GB GPU kan köra många 7–27B-modeller kvantiserade.
- 48 GB sweet spot för många “nästan frontier”-modeller med rimlig kontext.
- Flera kort kan slå en dyrare enskild i vissa fall.
- CPU/GPU-hybrid eller dedikerade inferenskort för specifika behov.
-
Räkna på elen
- 600W+ system drar snabbt på elräkningen vid kontinuerlig drift.
- Placering, kylning och strömförsörjning spelar roll.
-
Bygg harnessen
- Verktyg, minne (filbaserat, graf, lager), planering, guardrails och agent-loop.
- Börja enkelt: chat → lägg till verktyg → lägg till minne → lägg till verifiering.
-
80/20-regeln
- Kör 80% lokalt för integritet, kostnadskontroll och latens.
- Använd cloud för de 20% där du behöver spetskompetens eller extrem kapacitet (tills lokala alternativ hinner ikapp).
Vanliga fallgropar
- Att titta bara på tokens/sekund utan att mäta prefill-tid och verklig uppgiftsgenomströmning.
- Att ignorera licens, träningsdata-transparens och uppdateringsfrekvens för open weights.
- Att köpa dyr hårdvara innan du har en konkret uppgift som motiverar den.
Lisemark-vinkel
För Nodi och liknande agentiska system är hårdvara bara en del av ekvationen. Det som spelar roll är:
- Hur snabbt och pålitligt du kan iterera på en uppgift (se “Iteration som det verkliga modellmåttet”).
- Möjligheten att köra lokalt för sekretess och kontroll.
- Att ha tydliga gränser mellan lokal och cloud-del (hybrid är oftast bäst).
Mät alltid på dina egna arbetsflöden, inte bara benchmarks.
Relaterat
- Prefill vs decode – dimensionera din lokala LLM
- Iteration som det verkliga modellmåttet
- Klassiska ML-modeller som baslinjer
- Agentroller, minne och styrning