Configuraciones de inferencia para LLM locales
Ajustes listos para ejecutar un modelo en tu equipo: Modelfile de Ollama, comando vLLM, llama.cpp.
contextetech
Mistral 7B on a 16 GB Mac with Ollama
Ollama Modelfile to run Mistral 7B Instruct locally on a 16 GB Mac: Q4…
contextetech
Qwen2.5 7B with vLLM on a 24 GB GPU
Serve Qwen2.5 7B Instruct with vLLM on a 24 GB GPU: OpenAI-compatible API, 8k…
contextetech
llama.cpp server for a GGUF model
Run any GGUF model with the llama.cpp server: OpenAI-compatible API on port…
¿Qué es una configuración de inferencia?
Una configuración de inferencia reúne los ajustes para ejecutar un modelo en tu propio equipo: el motor (Ollama, vLLM, llama.cpp), la cuantización, el tamaño del contexto y el comando de lanzamiento.
Guía: Configs. de inferencia →