Qwen2.5 7B avec vLLM sur un GPU de 24 Go
Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API compatible OpenAI, contexte 8k, une seule commande.
| Modelo | Qwen/Qwen2.5-7B-Instruct |
|---|---|
| Hardware probado | Carte graphique NVIDIA 24 Go (par exemple RTX 4090 ou L4) |
Comando de lanzamiento
vllm serve Qwen/Qwen2.5-7B-Instruct --max-model-len 8192 --gpu-memory-utilization 0.90 --port 8000
Coste estimado
Tokens de entrada por llamada : ≈ 167
| Modelo | Por llamada | Por 1.000 llamadas |
|---|---|---|
| Mistral Large · Mistral AI | 0,00007 € | 0,07 € |
| DeepSeek Flash · DeepSeek | 0,00004 € | 0,04 € |
| DeepSeek V4 Pro · DeepSeek | 0,00019 € | 0,19 € |
| GPT-6 Luna · OpenAI | 0,00002 € | 0,01 € |
| GPT-6 Sol · OpenAI | 0,00029 € | 0,29 € |
| Claude Sonnet 5.5 · Anthropic | 0,00029 € | 0,29 € |
| Claude Opus 5.5 · Anthropic | 0,00059 € | 0,59 € |
| Modelo de código abierto autoalojado (Ollama, vLLM) | 0 € de API (solo el coste del servidor) | |
Solo coste de entrada, sin la respuesta del modelo. Precios públicos estándar de los proveedores (Mistral AI, DeepSeek, OpenAI, Anthropic) convertidos de USD a euros al tipo del BCE del 29 de septiembre de 2026. Estimación: 1 token ≈ 3,6 caracteres.
Common to all 3 regions
Sources under a compatible licence.
Sources : Modèle Qwen/Qwen2.5-7B-Instruct, licence Apache 2.0 (fiche Hugging Face)
Commercial use allowed · credit the author · changes allowed.
Text or data only: no access to files, network or commands.
Hosted in France (Scaleway, Paris). No transfer outside the EU.
European Union · 5/5
No personal data.
No training data: no summary required.
United States · 5/5
No personal data.
No training data: no documentation to publish.
China · 5/5
No personal data.
No training data; AI-generated content published in China must be labelled (2025).
Indicative summary as of 30/09/2026, not a legal certification. Method and sources →
Estadísticas
Me gusta : 0 · Comentarios : 0
Haz clic en un contador para mostrarlo u ocultarlo; pasa el ratón por el gráfico para ver el detalle. Una visita por visitante y día, sin robots; recuento iniciado el 30 de septiembre de 2026.
- Identificador
- contextetech--qwen2-5-7b-vllm-gpu-24go
- Tipo
- Configs. de inferencia
- Archivo
- qwen2-5-7b-vllm-gpu-24go.inference.json
- Formato
- JSON (application/json)
- Tamaño
- 581 bytes
- Codificación
- UTF-8
- Tokens estimados
- ≈ 161
- Idioma
- Francés
- Licencia
- MIT
- Uso comercial
- Permitido
- Datos personales
- Ninguno
- Versión
- 1.0
- Publicado el
- 1 de octubre de 2026 a las 18:55
- Actualizado el
- 1 de octubre de 2026 a las 18:55
- Almacenamiento
- en base de datos
- Usos
- 0
- Me gusta
- 0
qwen2-5-7b-vllm-gpu-24go.inference.json
{
"format": "contextetech/inference/v1",
"id": "contextetech/qwen2-5-7b-vllm-gpu-24go",
"description": "Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API compatible OpenAI, contexte 8k, une seule commande.",
"tags": [
"vllm",
"qwen",
"gpu"
],
"license": "MIT",
"language": "fr",
"runtime": "vllm",
"model": "Qwen/Qwen2.5-7B-Instruct",
"config": "",
"command": "vllm serve Qwen/Qwen2.5-7B-Instruct --max-model-len 8192 --gpu-memory-utilization 0.90 --port 8000",
"quant": "bf16",
"contextLength": 8192,
"ramGb": 24
}Comando de lanzamiento
vllm serve Qwen/Qwen2.5-7B-Instruct --max-model-len 8192 --gpu-memory-utilization 0.90 --port 8000
Comunidad
Aún no hay comentarios. Comparte tu opinión, ayudará a los siguientes.