O que é uma função de recompensa?
O que é?
Uma função de recompensa avalia a resposta de um modelo durante a aprendizagem por reforço: o modelo aprende a dar as respostas que obtêm a melhor pontuação. Pode ser verificável (código que confirma um resultado), uma grelha de avaliação ou as instruções de um modelo avaliador.
Quando o usar
- Treinar um modelo em tarefas cujo resultado se pode verificar: matemática, formato JSON, testes de código.
- Orientar um comportamento (tom, extensão, recusas) com uma grelha.
- Fazer avaliar as respostas por outro modelo quando a qualidade não se mede com código.
Campos da página
| Tipo | Verificável (código), grelha ou modelo avaliador. |
|---|---|
| Linguagem | A linguagem de programação, por exemplo Python. |
| Função, grelha ou instruções | A própria recompensa. |
| Exemplos avaliados | Respostas com a pontuação esperada, para verificar a recompensa. |
Como o usar
Separador “Utilização”: descarregue a função ou a grelha e ligue-a à sua ferramenta de aprendizagem por reforço.