Data & AIPrefill vs decode – dimensionera din lokala LLM efter verklig arbetslastPrefill (läsa kontext) och decode (generera) är olika flaskhalsar. Dimensionera lokal LLM efter verklig arbetslast, inte bara tokens/sekund.6 min · lokal-llm, inferens, prefill