Czym jest konfiguracja inferencji?
Co to jest?
Konfiguracja inferencji to zestaw ustawień potrzebnych do uruchomienia modelu na własnym komputerze: silnik (Ollama, vLLM, llama.cpp), kwantyzacja, rozmiar kontekstu i polecenie uruchomienia.
Kiedy go używać
- Uruchomić LLM lokalnie, bez wysyłania danych do chmury.
- Znaleźć właściwe ustawienia dla konkretnego sprzętu (Mac, GPU, serwer).
Pola strony
| Silnik | Ollama, vLLM, llama.cpp, LM Studio, TGI. |
|---|---|
| Konfiguracja | Modelfile lub plik ustawień. |
| Polecenie | Linia do uruchomienia. |
| Kwantyzacja, kontekst, pamięć | To, czego potrzeba, by zmieścić się na maszynie. |
Jak go używać
Skopiuj konfigurację, a następnie uruchom polecenie podane w zakładce „Użycie”.