En avansert benchmark for å teste AI-modellers evne til å forstå og resonnere over multimodale oppgaver (tekst, bilder, diagrammer). MMMU-Pro er vanskeligere enn standard MMMU og brukes til å sammenligne ytelsen til toppmodeller som GPT-5.2 og Gemini 3 Flash.
Gemini 3 Flash oppnådde 81,2% på MMMU-Pro benchmark, noe som betyr at den korrekt løste over 4 av 5 komplekse multimodale oppgaver.