Connexion Publier

Qu'est-ce qu'une évaluation de LLM ?

C'est quoi ?

Une évaluation est un jeu de cas de test (entrée et réponse attendue) avec une méthode de notation. Elle mesure si un modèle, un prompt, un contexte ou un agent fait bien son travail.

Quand l'utiliser

  • Comparer deux prompts ou deux modèles sur les mêmes cas.
  • Vérifier qu'une modification n'a rien cassé.

Les champs de la fiche

Ressource évaluéeLa fiche du catalogue testée (facultatif).
Méthode de notationContient, exacte, expression régulière ou notée par un modèle.
Seuil de réussiteLe pourcentage de cas réussis à atteindre.
Cas de testLes entrées et les réponses attendues.

Comment s'en servir

Onglet « Utiliser » : téléchargez le JSONL des cas ; l'exemple Python calcule le score.

Voir les Évaluations →