Belöningsfunktioner för förstärkningsinlärning
Funktioner och bedömningsmatriser som betygsätter en modells svar för att träna den med förstärkningsinlärning.
Ingen har publicerat här ännu. Varför inte du?
Vad är en belöningsfunktion?
En belöningsfunktion bedömer en modells svar under förstärkningsinlärning: modellen lär sig ge de svar som får bäst poäng. Den kan vara verifierbar (kod som kontrollerar ett resultat), en bedömningsmatris eller instruktionerna till en bedömarmodell.
Guide: Belöningar (RL) →