Vad är red teaming för AI?
Vad är det?
Red teaming innebär att man medvetet angriper en AI-assistent för att hitta dess svagheter innan användarna gör det: kringgå reglerna, dataläckor, promptinjektion, löften den inte får ge.
När den ska användas
- Innan en assistent tas i drift.
- Efter varje byte av modell eller prompt, för att kontrollera att den fortfarande håller.
Sidans fält
| Testad assistent | Vilken sorts assistent som testas. |
|---|---|
| Attacker | Meddelandet som skickas, dess kategori och det förväntade svaret. |
Hur den används
Ladda ner JSONL-filen och kör varje attack mot din assistent igen med Python-exemplet.