Serveur llama.cpp pour un modèle GGUF
Lancer n'importe quel modèle GGUF avec le serveur de llama.cpp : API compatible OpenAI sur le port 8080, fonctionne aussi sans carte graphique.
| Modell | modele.gguf |
|---|---|
| Getestete Hardware | Processeur seul ou carte graphique (option -ngl pour y charger des couches) |
Startbefehl
llama-server -m modele.gguf -c 8192 --host 127.0.0.1 --port 8080
Geschätzte Kosten
Eingabe-Tokens pro Aufruf : ≈ 138
| Modell | Pro Aufruf | Pro 1.000 Aufrufe |
|---|---|---|
| Mistral Large · Mistral AI | 0,00006 € | 0,06 € |
| DeepSeek Flash · DeepSeek | 0,00004 € | 0,04 € |
| DeepSeek V4 Pro · DeepSeek | 0,00016 € | 0,16 € |
| GPT-6 Luna · OpenAI | 0,00001 € | 0,01 € |
| GPT-6 Sol · OpenAI | 0,00024 € | 0,24 € |
| Claude Sonnet 5.5 · Anthropic | 0,00024 € | 0,24 € |
| Claude Opus 5.5 · Anthropic | 0,00049 € | 0,49 € |
| Selbst gehostetes Open-Source-Modell (Ollama, vLLM) | 0 € API-Kosten (nur Serverkosten) | |
Nur Eingabekosten, ohne die Antwort des Modells. Öffentliche Standardpreise der Anbieter (Mistral AI, DeepSeek, OpenAI, Anthropic) von USD in Euro umgerechnet zum EZB-Kurs vom 29. September 2026. Schätzung: 1 Token ≈ 3,6 Zeichen.
Common to all 3 regions
Created by the author, no outside source.
Commercial use allowed · credit the author · changes allowed.
Text or data only: no access to files, network or commands.
Hosted in France (Scaleway, Paris). No transfer outside the EU.
European Union · 5/5
No personal data.
No training data: no summary required.
United States · 5/5
No personal data.
No training data: no documentation to publish.
China · 5/5
No personal data.
No training data; AI-generated content published in China must be labelled (2025).
Indicative summary as of 30/09/2026, not a legal certification. Method and sources →
Statistiken
Gefällt mir : 0 · Kommentare : 0
Klicken Sie auf einen Zähler, um ihn ein- oder auszublenden; fahren Sie über das Diagramm für Details. Ein Aufruf pro Besucher und Tag, ohne Bots; Zählung seit dem 30. September 2026.
- Kennung
- contextetech--llama-cpp-serveur-gguf
- Typ
- Inferenz-Konfigurationen
- Datei
- llama-cpp-serveur-gguf.inference.json
- Format
- JSON (application/json)
- Größe
- 562 Bytes
- Kodierung
- UTF-8
- Geschätzte Tokens
- ≈ 156
- Sprache
- Französisch
- Lizenz
- MIT
- Kommerzielle Nutzung
- Erlaubt
- Personenbezogene Daten
- Keine
- Version
- 1.0
- Veröffentlicht am
- 1. Oktober 2026 um 18:55
- Aktualisiert am
- 1. Oktober 2026 um 18:55
- Speicherung
- in der Datenbank
- Nutzungen
- 0
- Gefällt mir
- 0
llama-cpp-serveur-gguf.inference.json
{
"format": "contextetech/inference/v1",
"id": "contextetech/llama-cpp-serveur-gguf",
"description": "Lancer n'importe quel modèle GGUF avec le serveur de llama.cpp : API compatible OpenAI sur le port 8080, fonctionne aussi sans carte graphique.",
"tags": [
"llama-cpp",
"gguf",
"cpu"
],
"license": "MIT",
"language": "fr",
"runtime": "llamacpp",
"model": "modele.gguf",
"config": "",
"command": "llama-server -m modele.gguf -c 8192 --host 127.0.0.1 --port 8080",
"quant": "Q4_K_M",
"contextLength": 8192,
"ramGb": null
}Startbefehl
llama-server -m modele.gguf -c 8192 --host 127.0.0.1 --port 8080
Community
Noch keine Kommentare. Teile deine Erfahrung, sie hilft den Nächsten.