Configs d'inférence pour LLM en local
Des réglages prêts à lancer pour faire tourner un modèle chez vous : Modelfile Ollama, commande vLLM, llama.cpp.
contextetech
Qwen2.5 7B avec vLLM sur un GPU de 24 Go
Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API…
contextetech
Serveur llama.cpp pour un modèle GGUF
Lancer n'importe quel modèle GGUF avec le serveur de llama.cpp : API compatible…
contextetech
Mistral 7B sur un Mac 16 Go avec Ollama
Modelfile Ollama pour faire tourner Mistral 7B Instruct en local sur un Mac 16…
Qu'est-ce qu'une config d'inférence ?
Une config d'inférence est l'ensemble des réglages qui permettent de faire tourner un modèle sur sa propre machine : le moteur (Ollama, vLLM, llama.cpp), la quantification, la taille du contexte et la commande de lancement.
Guide : Configs d'inférence →