Configurações de inferência para LLM locais
Definições prontas a usar para executar um modelo na sua própria máquina: Modelfile do Ollama, comando vLLM, llama.cpp.
Ainda ninguém publicou aqui. E se fosse o primeiro?
O que é uma configuração de inferência?
Uma configuração de inferência é o conjunto de definições necessárias para executar um modelo no seu próprio computador: o motor (Ollama, vLLM, llama.cpp), a quantização, o tamanho do contexto e o comando de arranque.
Guia: Configurações de inferência →