Iniciar sessão Publicar

Funções de recompensa para a aprendizagem por reforço

Funções e grelhas que avaliam as respostas de um modelo para o treinar por aprendizagem por reforço.

0 resultado(s)
Ainda ninguém publicou aqui. E se fosse o primeiro?

O que é uma função de recompensa?

Uma função de recompensa avalia a resposta de um modelo durante a aprendizagem por reforço: o modelo aprende a dar as respostas que obtêm a melhor pontuação. Pode ser verificável (código que confirma um resultado), uma grelha de avaliação ou as instruções de um modelo avaliador.

Guia: Recompensas (RL) →