Déployer un modèle IA chez soi
Des LLM, des configs d'inférence et des stacks pour déployer l'IA sur vos propres machines, sans envoyer vos données ailleurs.
Chat IA privé minimal : Ollama et Open WebUI
La stack la plus simple pour un chat IA privé : Ollama et Open WebUI en…
Qwen2.5 7B avec vLLM sur un GPU de 24 Go
Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API…
Serveur llama.cpp pour un modèle GGUF
Lancer n'importe quel modèle GGUF avec le serveur de llama.cpp : API compatible…
Automatisations locales : n8n et Ollama
Stack docker-compose pour automatiser avec une IA locale : n8n (workflows) et…
Mistral 7B sur un Mac 16 Go avec Ollama
Modelfile Ollama pour faire tourner Mistral 7B Instruct en local sur un Mac 16…
Chat privé sur vos documents : Ollama, Qdrant, Open WebUI
Stack docker-compose pour un chat privé sur vos documents : Ollama (modèle),…
Que veut dire déployer un modèle IA ?
Déployer, c'est faire tourner un modèle sur vos propres machines ou serveurs plutôt que d'appeler une API externe : vos données restent chez vous. On choisit un modèle (LLM, embeddings), un moteur (Ollama, vLLM, llama.cpp) et, si besoin, une stack complète en docker-compose.