En standardisert test for å sammenligne hvor god AI-modeller er på bestemte oppgaver - som en eksamen for AI.

MMLU tester generell kunnskap, HumanEval tester koding - modeller rangeres etter score.

Kilde: Stanford HELM →

Relaterte begreper