DE
Anmelden Veröffentlichen
contextetech /

Qwen2.5 7B avec vLLM sur un GPU de 24 Go

v1
Französisch Lizenz: MIT Veröffentlicht am aktualisiert gestern 0 Nutzungen

Servir Qwen2.5 7B Instruct avec vLLM sur une carte graphique de 24 Go : API compatible OpenAI, contexte 8k, une seule commande.

ModellQwen/Qwen2.5-7B-Instruct
Getestete HardwareCarte graphique NVIDIA 24 Go (par exemple RTX 4090 ou L4)

Startbefehl

vllm serve Qwen/Qwen2.5-7B-Instruct --max-model-len 8192 --gpu-memory-utilization 0.90 --port 8000

Community

Noch keine Kommentare. Teile deine Erfahrung, sie hilft den Nächsten.