Iniciar sessão Publicar

O que é uma avaliação de LLM?

O que é?

Uma avaliação é um conjunto de casos de teste (entrada e resposta esperada) com um método de pontuação. Mede se um modelo, prompt, contexto ou agente faz o seu trabalho.

Quando o usar

  • Comparar dois prompts ou modelos nos mesmos casos.
  • Verificar que uma alteração não estragou nada.

Campos da página

Recurso avaliadoA página do catálogo testada (opcional).
Método de pontuaçãoContém, exato, expressão regular ou avaliado por um modelo.
Limiar de aprovaçãoA proporção de casos aprovados a atingir.
Casos de testeEntradas e respostas esperadas.

Como o usar

Separador “Utilização”: descarregue o JSONL dos casos; o exemplo em Python calcula a pontuação.

Ver Avaliações →