Czym jest ewaluacja LLM?
Co to jest?
Ewaluacja to zestaw przypadków testowych (wejście i oczekiwana odpowiedź) z metodą oceniania. Mierzy, czy model, prompt, kontekst lub agent dobrze wykonuje swoją pracę.
Kiedy go używać
- Porównać dwa prompty lub modele na tych samych przypadkach.
- Sprawdzić, czy zmiana niczego nie zepsuła.
Pola strony
| Oceniany zasób | Testowana strona z katalogu (opcjonalnie). |
|---|---|
| Metoda oceniania | Zawiera, dokładnie, wyrażenie regularne lub ocena przez model. |
| Próg zaliczenia | Odsetek zaliczonych przypadków do osiągnięcia. |
| Przypadki testowe | Wejścia i oczekiwane odpowiedzi. |
Jak go używać
Zakładka „Użycie”: pobierz JSONL z przypadkami; przykład w Pythonie oblicza wynik.