IT
Accedi Pubblica

Cos'è una configurazione di inferenza?

Che cos'è?

Una configurazione di inferenza raccoglie le impostazioni per eseguire un modello sul proprio computer: il motore (Ollama, vLLM, llama.cpp), la quantizzazione, la dimensione del contesto e il comando di avvio.

Quando usarla

  • Run an LLM locally, without sending data to the cloud.
  • Find the right settings for specific hardware (Mac, GPU, server).

Campi della pagina

RuntimeOllama, vLLM, llama.cpp, LM Studio, TGI.
ConfigurationThe Modelfile or settings file.
CommandThe line to run.
Quantization, context, memoryWhat it takes to fit on the machine.

Come usarla

Copy the configuration, then run the command shown under “Usage”.

Vedi Config. di inferenza →