Anmelden Veröffentlichen

Belohnungsfunktionen für Verstärkungslernen

Funktionen und Bewertungsraster, die die Antworten eines Modells bewerten, um es per Verstärkungslernen zu trainieren.

0 Ergebnis(se)
Hier hat noch niemand veröffentlicht. Wie wäre es mit dir?

Was ist eine Belohnungsfunktion?

A reward function scores a model's answer during reinforcement learning: the model learns to produce the answers that get the best score. It can be verifiable (code that checks a result), a rubric or the instructions for a judge model.

Anleitung: Belohnungen (RL) →