Belohnungsfunktionen für Verstärkungslernen
Funktionen und Bewertungsraster, die die Antworten eines Modells bewerten, um es per Verstärkungslernen zu trainieren.
Hier hat noch niemand veröffentlicht. Wie wäre es mit dir?
Was ist eine Belohnungsfunktion?
A reward function scores a model's answer during reinforcement learning: the model learns to produce the answers that get the best score. It can be verifiable (code that checks a result), a rubric or the instructions for a judge model.
Anleitung: Belohnungen (RL) →