Direct naar de inhoud
ModelCompass powered by Wux AI
Terug
Benchmark · bron: Artificial Analysis score in %

MMLU-Pro

Grote kennistest met ruim 12.000 pittige meerkeuzevragen over 14 vakgebieden (recht, economie, natuurkunde…). Meet brede kennis en redeneren.

Wat meet deze benchmark?

MMLU-Pro (Massive Multitask Language Understanding – Professional) is een grote kennistest met ruim 12.000 meerkeuzevragen uit 14 vakgebieden — van recht en economie tot natuurkunde en geneeskunde. Het is dé standaardtest voor brede kennis en begrip.

Hoe werkt het?

Elke vraag heeft tien antwoordopties (de originele MMLU had er vier), waardoor gokken nauwelijks loont. Het model moet naar het juiste antwoord redeneren; de score is het percentage correct beantwoorde vragen.

Hoe lees je de score?

Percentage goed: 100% is foutloos. Topmodellen zitten rond de 80-90% — vergelijkbaar met een menselijke expert binnen diens eigen vakgebied.

Alle uitslagen

46 modellen met een MMLU-Pro-score, van hoog naar laag. Klik een model voor alle details.

1 GPT-5.2OpenAI 🇺🇸Verenigde Staten 87.4% 2 GPT-5.2 ChatOpenAI 🇺🇸Verenigde Staten 87.4% 3 GPT-5OpenAI 🇺🇸Verenigde Staten 87.1% 4 GPT-5.1OpenAI 🇺🇸Verenigde Staten 87% 5 Gemini 2.5 Pro Preview 06-05Google 🇺🇸Verenigde Staten 86.2% 6 Gemini 2.5 ProGoogle 🇺🇸Verenigde Staten 86.2% 7 GPT-5.1-CodexOpenAI 🇺🇸Verenigde Staten 86% 8 o3OpenAI 🇺🇸Verenigde Staten 85.3% 9 o1OpenAI 🇺🇸Verenigde Staten 84.1% 10 Gemini 2.5 Pro Preview 05-06Google 🇺🇸Verenigde Staten 83.7% 11 o4 Mini HighOpenAI 🇺🇸Verenigde Staten 83.2% 12 o4 MiniOpenAI 🇺🇸Verenigde Staten 83.2% 13 GPT-5 MiniOpenAI 🇺🇸Verenigde Staten 82.8% 14 GPT-5.1-Codex-MiniOpenAI 🇺🇸Verenigde Staten 82% 15 Llama 4 MaverickMeta 🇺🇸Verenigde Staten 80.9% 16 gpt-oss-120bOpenAI 🇺🇸Verenigde Staten 80.8% 17 GPT-4.1OpenAI 🇺🇸Verenigde Staten 80.6% 18 o3 Mini HighOpenAI 🇺🇸Verenigde Staten 79.1% 19 o3 MiniOpenAI 🇺🇸Verenigde Staten 79.1% 20 GPT-5 NanoOpenAI 🇺🇸Verenigde Staten 78% 21 Mistral Medium 3Mistral AI 🇫🇷Frankrijk 76% 22 Gemini 2.5 Flash LiteGoogle 🇺🇸Verenigde Staten 75.9% 23 Olmo 3 32B ThinkAllenAI 🇺🇸Verenigde Staten 75.9% 24 Llama 4 ScoutMeta 🇺🇸Verenigde Staten 75.2% 25 gpt-oss-20bOpenAI 🇺🇸Verenigde Staten 74.8% 26 GPT-4o (2024-11-20)OpenAI 🇺🇸Verenigde Staten 74.8% 27 Phi 4Microsoft 🇺🇸Verenigde Staten 71.4% 28 Llama 3.3 70B InstructMeta 🇺🇸Verenigde Staten 71.3% 29 Command ACohere 🇨🇦Canada 71.2% 30 GPT-4 TurboOpenAI 🇺🇸Verenigde Staten 69.4% 31 Mistral Medium 3.1Mistral AI 🇫🇷Frankrijk 68.3% 32 Gemma 3 27BGoogle 🇺🇸Verenigde Staten 66.9% 33 Reka Flash 3Reka 🇺🇸Verenigde Staten 66.9% 34 Mistral Small 3Mistral AI 🇫🇷Frankrijk 65.2% 35 GPT-4o-mini (2024-07-18)OpenAI 🇺🇸Verenigde Staten 64.8% 36 GPT-4o-miniOpenAI 🇺🇸Verenigde Staten 64.8% 37 SabaMistral AI 🇫🇷Frankrijk 61.1% 38 Gemma 3 12BGoogle 🇺🇸Verenigde Staten 59.5% 39 Hermes 3 70B InstructNous Research 🇺🇸Verenigde Staten 57.1% 40 Llama 3.1 8B InstructMeta 🇺🇸Verenigde Staten 47.6% 41 GPT-3.5 Turbo InstructOpenAI 🇺🇸Verenigde Staten 46.2% 42 GPT-3.5 TurboOpenAI 🇺🇸Verenigde Staten 46.2% 43 Granite 4.0 MicroIBM 🇺🇸Verenigde Staten 44.7% 44 Gemma 3 4BGoogle 🇺🇸Verenigde Staten 41.7% 45 Llama 3.2 3B InstructMeta 🇺🇸Verenigde Staten 34.7% 46 Llama 3.2 1B InstructMeta 🇺🇸Verenigde Staten 20%
Kleur = niveau: Topklasse Professioneel Standaard Lichtgewicht