Wat is een inferentieconfiguratie?
Wat is het?
Een inferentieconfiguratie is de set instellingen die nodig is om een model op je eigen computer te draaien: de runtime (Ollama, vLLM, llama.cpp), de kwantisatie, de contextgrootte en de startopdracht.
Wanneer te gebruiken
- Een LLM lokaal draaien, zonder gegevens naar de cloud te sturen.
- De juiste instellingen vinden voor specifieke hardware (Mac, GPU, server).
De velden van de pagina
| Runtime | Ollama, vLLM, llama.cpp, LM Studio, TGI. |
|---|---|
| Configuratie | De Modelfile of het instellingenbestand. |
| Opdracht | De regel om uit te voeren. |
| Kwantisatie, context, geheugen | Wat er nodig is om op de machine te passen. |
Hoe gebruik je het
Kopieer de configuratie en voer daarna de opdracht uit die onder “Gebruik” staat.