Iniciar sessão Publicar

O que é uma configuração de inferência?

O que é?

Uma configuração de inferência é o conjunto de definições necessárias para executar um modelo no seu próprio computador: o motor (Ollama, vLLM, llama.cpp), a quantização, o tamanho do contexto e o comando de arranque.

Quando o usar

  • Executar um LLM localmente, sem enviar dados para a nuvem.
  • Encontrar as definições certas para um hardware concreto (Mac, GPU, servidor).

Campos da página

MotorOllama, vLLM, llama.cpp, LM Studio, TGI.
ConfiguraçãoO Modelfile ou o ficheiro de definições.
ComandoA linha a executar.
Quantização, contexto, memóriaO necessário para caber na máquina.

Como o usar

Copie a configuração e depois execute o comando indicado em “Utilização”.

Ver Configurações de inferência →