Qu'est-ce qu'une config d'inférence ?
C'est quoi ?
Une config d'inférence est l'ensemble des réglages qui permettent de faire tourner un modèle sur sa propre machine : le moteur (Ollama, vLLM, llama.cpp), la quantification, la taille du contexte et la commande de lancement.
Quand l'utiliser
- Faire tourner un LLM en local, sans envoyer de données dans le cloud.
- Retrouver les bons réglages pour un matériel précis (Mac, carte graphique, serveur).
Les champs de la fiche
| Moteur | Ollama, vLLM, llama.cpp, LM Studio, TGI. |
|---|---|
| Configuration | Le Modelfile ou le fichier de réglages. |
| Commande | La ligne à lancer. |
| Quantification, contexte, mémoire | Ce qu'il faut pour que ça tienne sur la machine. |
Comment s'en servir
Copiez la configuration, puis lancez la commande indiquée dans « Utilisation ».