Wat is een LLM-evaluatie?
Wat is het?
Een evaluatie is een set testgevallen (invoer en verwacht antwoord) met een scoremethode. Ze meet of een model, prompt, context of agent zijn werk doet.
Wanneer te gebruiken
- Twee prompts of modellen op dezelfde gevallen vergelijken.
- Controleren dat een wijziging niets kapot heeft gemaakt.
De velden van de pagina
| Geëvalueerde resource | De geteste pagina uit de catalogus (optioneel). |
|---|---|
| Scoremethode | Bevat, exact, reguliere expressie of beoordeeld door een model. |
| Slaagdrempel | Het aandeel geslaagde gevallen dat gehaald moet worden. |
| Testgevallen | Invoer en verwachte antwoorden. |
Hoe gebruik je het
Tabblad “Gebruik”: download de JSONL met de gevallen; het Python-voorbeeld berekent de score.