Inloggen Publiceren

Wat is een inferentieconfiguratie?

Wat is het?

Een inferentieconfiguratie is de set instellingen die nodig is om een model op je eigen computer te draaien: de runtime (Ollama, vLLM, llama.cpp), de kwantisatie, de contextgrootte en de startopdracht.

Wanneer te gebruiken

  • Een LLM lokaal draaien, zonder gegevens naar de cloud te sturen.
  • De juiste instellingen vinden voor specifieke hardware (Mac, GPU, server).

De velden van de pagina

RuntimeOllama, vLLM, llama.cpp, LM Studio, TGI.
ConfiguratieDe Modelfile of het instellingenbestand.
OpdrachtDe regel om uit te voeren.
Kwantisatie, context, geheugenWat er nodig is om op de machine te passen.

Hoe gebruik je het

Kopieer de configuratie en voer daarna de opdracht uit die onder “Gebruik” staat.

Bekijk de Inferentieconfiguraties →