Infrastructure : configs d'inférence et stacks IA
Faire tourner un modèle chez soi.
Chat IA privé minimal : Ollama et Open WebUI
La stack la plus simple pour un chat IA privé : Ollama et Open WebUI en…
Qwen2.5 7B avec vLLM sur un GPU de 24 Go
Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API…
Serveur llama.cpp pour un modèle GGUF
Lancer n'importe quel modèle GGUF avec le serveur de llama.cpp : API compatible…
Automatisations locales : n8n et Ollama
Stack docker-compose pour automatiser avec une IA locale : n8n (workflows) et…
Mistral 7B sur un Mac 16 Go avec Ollama
Modelfile Ollama pour faire tourner Mistral 7B Instruct en local sur un Mac 16…
Chat privé sur vos documents : Ollama, Qdrant, Open WebUI
Stack docker-compose pour un chat privé sur vos documents : Ollama (modèle),…
Qu’est-ce que le déploiement d’un modèle IA ?
Le déploiement consiste à installer et configurer un modèle pour le rendre utilisable dans une application, sur un serveur ou sur une machine locale. Cette famille rassemble les ressources nécessaires pour exécuter le modèle, recevoir des requêtes et produire des réponses avec le matériel disponible.