Fonctions de récompense pour l'apprentissage par renforcement
Des fonctions et des grilles qui notent les réponses d'un modèle pour l'entraîner par renforcement.
Personne n'a encore publié ici. Et si c'était vous ?
Qu'est-ce qu'une fonction de récompense ?
Une fonction de récompense note la réponse d'un modèle pendant un entraînement par renforcement : le modèle apprend à produire les réponses qui obtiennent la meilleure note. Elle peut être vérifiable (du code qui contrôle un résultat), une grille d'évaluation ou la consigne d'un modèle juge.
Guide : Récompenses (RL) →