Vad är en inferenskonfiguration?
Vad är det?
En inferenskonfiguration är de inställningar som behövs för att köra en modell på din egen dator: motorn (Ollama, vLLM, llama.cpp), kvantiseringen, kontextens storlek och startkommandot.
När den ska användas
- Köra en LLM lokalt, utan att skicka data till molnet.
- Hitta rätt inställningar för en viss hårdvara (Mac, GPU, server).
Sidans fält
| Motor | Ollama, vLLM, llama.cpp, LM Studio, TGI. |
|---|---|
| Konfiguration | Modelfile eller inställningsfilen. |
| Kommando | Raden som ska köras. |
| Kvantisering, kontext, minne | Det som krävs för att få plats på maskinen. |
Hur den används
Kopiera konfigurationen och kör sedan kommandot under ”Användning”.