Czym jest funkcja nagrody?
Co to jest?
Funkcja nagrody ocenia odpowiedź modelu podczas uczenia ze wzmocnieniem: model uczy się dawać odpowiedzi, które dostają najlepszą ocenę. Może być weryfikowalna (kod sprawdzający wynik), być kartą oceny lub instrukcjami dla modelu oceniającego.
Kiedy go używać
- Trenować model na zadaniach, których wynik da się sprawdzić: matematyka, format JSON, testy kodu.
- Kierować zachowaniem (ton, długość, odmowy) za pomocą karty oceny.
- Zlecić ocenę odpowiedzi innemu modelowi, gdy jakości nie da się zmierzyć kodem.
Pola strony
| Typ | Weryfikowalna (kod), karta oceny lub model oceniający. |
|---|---|
| Język | Język programowania, na przykład Python. |
| Funkcja, karta lub instrukcje | Sama nagroda. |
| Ocenione przykłady | Odpowiedzi z oczekiwaną oceną, aby sprawdzić nagrodę. |
Jak go używać
Zakładka „Użycie”: pobierz funkcję lub kartę i podłącz ją do swojego narzędzia do uczenia ze wzmocnieniem.