O que é o red teaming de IA?
O que é?
O red teaming consiste em atacar deliberadamente um assistente de IA para encontrar as suas falhas antes dos utilizadores: contornar as regras, fugas de dados, injeção de prompt, promessas que não pode fazer.
Quando o usar
- Antes de pôr um assistente em produção.
- Depois de cada mudança de modelo ou de prompt, para verificar que continua a resistir.
Campos da página
| Assistente visado | O tipo de assistente testado. |
|---|---|
| Ataques | A mensagem enviada, a sua categoria e a resposta esperada. |
Como o usar
Descarregue o ficheiro JSONL e volte a executar cada ataque contra o seu assistente com o exemplo em Python.