Vad är en utvärdering av en LLM?
Vad är det?
En utvärdering är en uppsättning testfall (indata och förväntat svar) med en poängmetod. Den mäter om en modell, prompt, kontext eller agent gör sitt jobb.
När den ska användas
- Jämföra två prompter eller modeller på samma fall.
- Kontrollera att en ändring inte har förstört något.
Sidans fält
| Utvärderad resurs | Den testade sidan i katalogen (valfritt). |
|---|---|
| Poängmetod | Innehåller, exakt, reguljärt uttryck eller bedömd av en modell. |
| Godkänd-gräns | Andelen godkända fall som ska nås. |
| Testfall | Indata och förväntade svar. |
Hur den används
Fliken ”Användning”: ladda ner JSONL-filen med fallen; Python-exemplet räknar ut poängen.