Zaloguj się Opublikuj

Czym jest ewaluacja LLM?

Co to jest?

Ewaluacja to zestaw przypadków testowych (wejście i oczekiwana odpowiedź) z metodą oceniania. Mierzy, czy model, prompt, kontekst lub agent dobrze wykonuje swoją pracę.

Kiedy go używać

  • Porównać dwa prompty lub modele na tych samych przypadkach.
  • Sprawdzić, czy zmiana niczego nie zepsuła.

Pola strony

Oceniany zasóbTestowana strona z katalogu (opcjonalnie).
Metoda ocenianiaZawiera, dokładnie, wyrażenie regularne lub ocena przez model.
Próg zaliczeniaOdsetek zaliczonych przypadków do osiągnięcia.
Przypadki testoweWejścia i oczekiwane odpowiedzi.

Jak go używać

Zakładka „Użycie”: pobierz JSONL z przypadkami; przykład w Pythonie oblicza wynik.

Przeglądaj: Ewaluacje →