Funciones de recompensa para el aprendizaje por refuerzo
Funciones y rúbricas que puntúan las respuestas de un modelo para entrenarlo por refuerzo.
Nadie ha publicado aquí todavía. ¿Y si fueras tú?
¿Qué es una función de recompensa?
A reward function scores a model's answer during reinforcement learning: the model learns to produce the answers that get the best score. It can be verifiable (code that checks a result), a rubric or the instructions for a judge model.
Guía: Recompensas (RL) →