Configurations d'IA : inférence, stacks, embeddings et réglages
Des réglages techniques pour faire tourner ou adapter un modèle : inférence, stacks, embeddings, LoRA, RAG…
Automatisations locales : n8n et Ollama
Stack docker-compose pour automatiser avec une IA locale : n8n (workflows) et…
Chat IA privé minimal : Ollama et Open WebUI
La stack la plus simple pour un chat IA privé : Ollama et Open WebUI en…
Qwen2.5 7B avec vLLM sur un GPU de 24 Go
Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API…
Serveur llama.cpp pour un modèle GGUF
Lancer n'importe quel modèle GGUF avec le serveur de llama.cpp : API compatible…
Embeddings nomic-embed-text en local avec Ollama
nomic-embed-text pour un RAG 100 % local avec Ollama : 768 dimensions, textes…
Mistral 7B sur un Mac 16 Go avec Ollama
Modelfile Ollama pour faire tourner Mistral 7B Instruct en local sur un Mac 16…
Chat privé sur vos documents : Ollama, Qdrant, Open WebUI
Stack docker-compose pour un chat privé sur vos documents : Ollama (modèle),…
Embeddings BGE-M3 pour un RAG sur de longs documents
BGE-M3 pour un RAG sur de longs documents : 1024 dimensions, jusqu'à 8192…
Embeddings multilingual-e5-large pour un RAG en français
multilingual-e5-large pour un RAG en français : 1024 dimensions, 512 tokens,…
Configuration QLoRA pour anonymiser avec Mistral 7B
Configuration QLoRA de départ pour spécialiser Mistral 7B Instruct dans…
Pipeline RAG pour une documentation produit en français
Pipeline RAG pour un assistant qui répond sur la documentation d'un produit en…