Déployer un modèle IA chez soi
Des LLM, des configs d'inférence et des stacks pour déployer l'IA sur vos propres machines, sans envoyer vos données ailleurs.
Qwen2.5 7B avec vLLM sur un GPU de 24 Go
Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API…
Serveur llama.cpp pour un modèle GGUF
Lancer n'importe quel modèle GGUF avec le serveur de llama.cpp : API compatible…
Mistral 7B sur un Mac 16 Go avec Ollama
Modelfile Ollama pour faire tourner Mistral 7B Instruct en local sur un Mac 16…
Que veut dire déployer un modèle IA ?
Déployer, c'est faire tourner un modèle sur vos propres machines ou serveurs plutôt que d'appeler une API externe : vos données restent chez vous. On choisit un modèle (LLM, embeddings), un moteur (Ollama, vLLM, llama.cpp) et, si besoin, une stack complète en docker-compose.