Connexion Publier

Fonctions de récompense pour l'apprentissage par renforcement

Des fonctions et des grilles qui notent les réponses d'un modèle pour l'entraîner par renforcement.

0 résultat(s)
Personne n'a encore publié ici. Et si c'était vous ?

Qu'est-ce qu'une fonction de récompense ?

Une fonction de récompense note la réponse d'un modèle pendant un entraînement par renforcement : le modèle apprend à produire les réponses qui obtiennent la meilleure note. Elle peut être vérifiable (du code qui contrôle un résultat), une grille d'évaluation ou la consigne d'un modèle juge.

Guide : Récompenses (RL) →