Funções de recompensa para a aprendizagem por reforço
Funções e grelhas que avaliam as respostas de um modelo para o treinar por aprendizagem por reforço.
Ainda ninguém publicou aqui. E se fosse o primeiro?
O que é uma função de recompensa?
Uma função de recompensa avalia a resposta de um modelo durante a aprendizagem por reforço: o modelo aprende a dar as respostas que obtêm a melhor pontuação. Pode ser verificável (código que confirma um resultado), uma grelha de avaliação ou as instruções de um modelo avaliador.
Guia: Recompensas (RL) →