Infrastruktur: Inferenz und KI-Stacks
Ein Modell selbst betreiben.
Mistral 7B on a 16 GB Mac with Ollama
Ollama Modelfile to run Mistral 7B Instruct locally on a 16 GB Mac: Q4…
Qwen2.5 7B with vLLM on a 24 GB GPU
Serve Qwen2.5 7B Instruct with vLLM on a 24 GB GPU: OpenAI-compatible API, 8k…
llama.cpp server for a GGUF model
Run any GGUF model with the llama.cpp server: OpenAI-compatible API on port…
Private chat on your documents: Ollama, Qdrant, Open WebUI
docker-compose stack for a private chat on your documents: Ollama (model),…
Minimal private AI chat: Ollama and Open WebUI
The simplest stack for a private AI chat: Ollama and Open WebUI with…
Local automations: n8n and Ollama
docker-compose stack to automate with a local AI: n8n (workflows) and Ollama…
Was ist die Bereitstellung eines KI-Modells?
Bereitstellung bedeutet, ein Modell für den Einsatz in einer Anwendung, auf einem Server oder auf einem lokalen Rechner zu installieren und zu konfigurieren. Diese Familie umfasst Ressourcen, um das Modell auszuführen, Anfragen zu empfangen und mit der verfügbaren Hardware Antworten zu erzeugen.