Iniciar sesión Publicar

Funciones de recompensa para el aprendizaje por refuerzo

Funciones y rúbricas que puntúan las respuestas de un modelo para entrenarlo por refuerzo.

0 resultado(s)
Nadie ha publicado aquí todavía. ¿Y si fueras tú?

¿Qué es una función de recompensa?

A reward function scores a model's answer during reinforcement learning: the model learns to produce the answers that get the best score. It can be verifiable (code that checks a result), a rubric or the instructions for a judge model.

Guía: Recompensas (RL) →