O que é uma avaliação de LLM?
O que é?
Uma avaliação é um conjunto de casos de teste (entrada e resposta esperada) com um método de pontuação. Mede se um modelo, prompt, contexto ou agente faz o seu trabalho.
Quando o usar
- Comparar dois prompts ou modelos nos mesmos casos.
- Verificar que uma alteração não estragou nada.
Campos da página
| Recurso avaliado | A página do catálogo testada (opcional). |
|---|---|
| Método de pontuação | Contém, exato, expressão regular ou avaliado por um modelo. |
| Limiar de aprovação | A proporção de casos aprovados a atingir. |
| Casos de teste | Entradas e respostas esperadas. |
Como o usar
Separador “Utilização”: descarregue o JSONL dos casos; o exemplo em Python calcula a pontuação.