Qu'est-ce que le red teaming d'une IA ?
C'est quoi ?
Le red teaming consiste à attaquer volontairement un assistant IA pour trouver ses failles avant les utilisateurs : contournement des règles, fuite de données, injection de prompt, promesses qu'il ne devrait pas faire.
Quand l'utiliser
- Avant la mise en production d'un assistant.
- Après chaque changement de modèle ou de prompt, pour vérifier qu'il résiste toujours.
Les champs de la fiche
| Assistant visé | Le type d'assistant testé. |
|---|---|
| Attaques | Le message envoyé, sa catégorie et la réponse attendue. |
Comment s'en servir
Téléchargez le fichier JSONL et rejouez chaque attaque sur votre assistant avec l'exemple Python.