Vad är en belöningsfunktion?
Vad är det?
En belöningsfunktion bedömer en modells svar under förstärkningsinlärning: modellen lär sig ge de svar som får bäst poäng. Den kan vara verifierbar (kod som kontrollerar ett resultat), en bedömningsmatris eller instruktionerna till en bedömarmodell.
När den ska användas
- Träna en modell på uppgifter vars resultat kan kontrolleras: matematik, JSON-format, kodtester.
- Styra ett beteende (ton, längd, avböjanden) med en bedömningsmatris.
- Låta en annan modell bedöma svaren när kvaliteten inte kan mätas med kod.
Sidans fält
| Typ | Verifierbar (kod), bedömningsmatris eller bedömarmodell. |
|---|---|
| Språk | Programmeringsspråket, till exempel Python. |
| Funktion, matris eller instruktioner | Själva belöningen. |
| Bedömda exempel | Svar med förväntad poäng, för att kontrollera belöningen. |
Hur den används
Fliken ”Användning”: ladda ner funktionen eller matrisen och koppla den till ditt verktyg för förstärkningsinlärning.