Czym jest red teaming AI?
Co to jest?
Red teaming polega na celowym atakowaniu asystenta AI, aby znaleźć jego słabe punkty, zanim zrobią to użytkownicy: obchodzenie reguł, wycieki danych, wstrzyknięcia promptu, obietnice, których nie może składać.
Kiedy go używać
- Przed wdrożeniem asystenta.
- Po każdej zmianie modelu lub promptu, aby sprawdzić, czy nadal jest odporny.
Pola strony
| Testowany asystent | Rodzaj testowanego asystenta. |
|---|---|
| Ataki | Wysłana wiadomość, jej kategoria i oczekiwana odpowiedź. |
Jak go używać
Pobierz plik JSONL i powtórz każdy atak na swoim asystencie za pomocą przykładu w Pythonie.