Ewaluacje i benchmarki LLM
Zestawy testowe i benchmarki do mierzenia jakości modelu, promptu lub agenta.
Czym jest ewaluacja LLM?
Ewaluacja to zestaw przypadków testowych (wejście i oczekiwana odpowiedź) z metodą oceniania. Mierzy, czy model, prompt, kontekst lub agent dobrze wykonuje swoją pracę.
Przewodnik: Ewaluacje →