Zaloguj się Opublikuj

Funkcje nagrody do uczenia przez wzmacnianie

Funkcje i rubryki oceniające odpowiedzi modelu, aby trenować go uczeniem przez wzmacnianie.

Wyniki: 0
Nikt jeszcze nic tu nie opublikował. Może Ty?

Czym jest funkcja nagrody?

Funkcja nagrody ocenia odpowiedź modelu podczas uczenia ze wzmocnieniem: model uczy się dawać odpowiedzi, które dostają najlepszą ocenę. Może być weryfikowalna (kod sprawdzający wynik), być kartą oceny lub instrukcjami dla modelu oceniającego.

Przewodnik: Nagrody (RL) →