Cos'è una configurazione di inferenza?
Che cos'è?
Una configurazione di inferenza raccoglie le impostazioni per eseguire un modello sul proprio computer: il motore (Ollama, vLLM, llama.cpp), la quantizzazione, la dimensione del contesto e il comando di avvio.
Quando usarla
- Run an LLM locally, without sending data to the cloud.
- Find the right settings for specific hardware (Mac, GPU, server).
Campi della pagina
| Runtime | Ollama, vLLM, llama.cpp, LM Studio, TGI. |
|---|---|
| Configuration | The Modelfile or settings file. |
| Command | The line to run. |
| Quantization, context, memory | What it takes to fit on the machine. |
Come usarla
Copy the configuration, then run the command shown under “Usage”.