← Maskinlæring
Benchmark
En standardisert test for å sammenligne hvor god AI-modeller er på bestemte oppgaver - som en eksamen for AI.
MMLU tester generell kunnskap, HumanEval tester koding - modeller rangeres etter score.
En standardisert test for å sammenligne hvor god AI-modeller er på bestemte oppgaver - som en eksamen for AI.
MMLU tester generell kunnskap, HumanEval tester koding - modeller rangeres etter score.