Zaloguj się Opublikuj

Czym jest funkcja nagrody?

Co to jest?

Funkcja nagrody ocenia odpowiedź modelu podczas uczenia ze wzmocnieniem: model uczy się dawać odpowiedzi, które dostają najlepszą ocenę. Może być weryfikowalna (kod sprawdzający wynik), być kartą oceny lub instrukcjami dla modelu oceniającego.

Kiedy go używać

  • Trenować model na zadaniach, których wynik da się sprawdzić: matematyka, format JSON, testy kodu.
  • Kierować zachowaniem (ton, długość, odmowy) za pomocą karty oceny.
  • Zlecić ocenę odpowiedzi innemu modelowi, gdy jakości nie da się zmierzyć kodem.

Pola strony

TypWeryfikowalna (kod), karta oceny lub model oceniający.
JęzykJęzyk programowania, na przykład Python.
Funkcja, karta lub instrukcjeSama nagroda.
Ocenione przykładyOdpowiedzi z oczekiwaną oceną, aby sprawdzić nagrodę.

Jak go używać

Zakładka „Użycie”: pobierz funkcję lub kartę i podłącz ją do swojego narzędzia do uczenia ze wzmocnieniem.

Przeglądaj: Nagrody (RL) →