Déployer un modèle IA chez soi
Des LLM, des configs d'inférence et des stacks pour déployer l'IA sur vos propres machines, sans envoyer vos données ailleurs.
Qwen2.5 7B avec vLLM sur un GPU de 24 Go
Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API…
Chat IA privé minimal : Ollama et Open WebUI
La stack la plus simple pour un chat IA privé : Ollama et Open WebUI en…
Serveur llama.cpp pour un modèle GGUF
Lancer n'importe quel modèle GGUF avec le serveur de llama.cpp : API compatible…
Automatisations locales : n8n et Ollama
Stack docker-compose pour automatiser avec une IA locale : n8n (workflows) et…
Chat privé sur vos documents : Ollama, Qdrant, Open WebUI
Stack docker-compose pour un chat privé sur vos documents : Ollama (modèle),…
Mistral 7B sur un Mac 16 Go avec Ollama
Modelfile Ollama pour faire tourner Mistral 7B Instruct en local sur un Mac 16…
Mistral 7B Instruct v0.3
Fiche de référence du modèle Mistral 7B Instruct v0.3 publié par Mistral AI : 7…
Que veut dire déployer un modèle IA ?
Déployer, c'est faire tourner un modèle sur vos propres machines ou serveurs plutôt que d'appeler une API externe : vos données restent chez vous. On choisit un modèle (LLM, embeddings), un moteur (Ollama, vLLM, llama.cpp) et, si besoin, une stack complète en docker-compose.