Iniciar sessão Publicar

O que é uma função de recompensa?

O que é?

Uma função de recompensa avalia a resposta de um modelo durante a aprendizagem por reforço: o modelo aprende a dar as respostas que obtêm a melhor pontuação. Pode ser verificável (código que confirma um resultado), uma grelha de avaliação ou as instruções de um modelo avaliador.

Quando o usar

  • Treinar um modelo em tarefas cujo resultado se pode verificar: matemática, formato JSON, testes de código.
  • Orientar um comportamento (tom, extensão, recusas) com uma grelha.
  • Fazer avaliar as respostas por outro modelo quando a qualidade não se mede com código.

Campos da página

TipoVerificável (código), grelha ou modelo avaliador.
LinguagemA linguagem de programação, por exemplo Python.
Função, grelha ou instruçõesA própria recompensa.
Exemplos avaliadosRespostas com a pontuação esperada, para verificar a recompensa.

Como o usar

Separador “Utilização”: descarregue a função ou a grelha e ligue-a à sua ferramenta de aprendizagem por reforço.

Ver Recompensas (RL) →