O que é uma configuração de inferência?
O que é?
Uma configuração de inferência é o conjunto de definições necessárias para executar um modelo no seu próprio computador: o motor (Ollama, vLLM, llama.cpp), a quantização, o tamanho do contexto e o comando de arranque.
Quando o usar
- Executar um LLM localmente, sem enviar dados para a nuvem.
- Encontrar as definições certas para um hardware concreto (Mac, GPU, servidor).
Campos da página
| Motor | Ollama, vLLM, llama.cpp, LM Studio, TGI. |
|---|---|
| Configuração | O Modelfile ou o ficheiro de definições. |
| Comando | A linha a executar. |
| Quantização, contexto, memória | O necessário para caber na máquina. |
Como o usar
Copie a configuração e depois execute o comando indicado em “Utilização”.