Mistral Medium 3
Mistral Medium 3 is a high-performance enterprise-grade language model designed to deliver frontier-level capabilities at significantly reduced operational cost. It balances state-of-the-art reasoning and multimodal performance with 8× l…
Loont de prijs?
Je betaalt veel voor weinig extra kwaliteit — er zijn voordeligere alternatieven.
Goed voor
- Het lezen van afbeeldingen en scans
Minder geschikt voor
- Zwaar programmeerwerk
Onderstaande gegevens zijn bedoeld voor wie de techniek wil doorgronden: ruwe benchmarkscores, gemeten snelheid/latency, prijsopbouw en databronnen. Niet nodig om een goede keuze te maken.
Benchmarks
Klik op een benchmark voor uitleg en alle uitslagen per model; het ?-knopje geeft een korte uitleg.
| Intelligence Index | 12.5 |
| Samengestelde slimheidsscore van Artificial Analysis: het gemiddelde over vele tests voor redeneren, kennis, wiskunde en code. Hoger = slimmer. Alle uitslagen & uitleg → | |
| Coding Index | geen data |
| Gemiddelde van programmeertests: hoe goed het model code schrijft, begrijpt en verbetert. Alle uitslagen & uitleg → | |
| Math Index | 30.3 |
| Gemiddelde van wiskundetests: rekenen, algebra en wiskundig redeneren. Alle uitslagen & uitleg → | |
| Agentic Index | geen data |
| Hoe goed het model zelfstandig meerstaps-taken uitvoert met tools (bestanden openen, zoeken, acties uitvoeren). Alle uitslagen & uitleg → | |
| MMLU-Pro | 76% |
| Grote kennistest met ruim 12.000 pittige meerkeuzevragen over 14 vakgebieden (recht, economie, natuurkunde…). Meet brede kennis en redeneren. Alle uitslagen & uitleg → | |
| GPQA Diamond | 57.8% |
| Zeer moeilijke wetenschapsvragen op PhD-niveau (biologie, natuur- en scheikunde). Zelfs menselijke experts halen hier maar ~65%. Alle uitslagen & uitleg → | |
| Humanity's Last Exam | 4.1% |
| De zwaarste kennistest die er is: duizenden extreem moeilijke vragen over honderden onderwerpen. Lage percentages zijn hier normaal. Alle uitslagen & uitleg → | |
| LiveCodeBench | 40% |
| Verse programmeeropgaven die pas ná de training van het model zijn verschenen — meet écht kunnen programmeren in plaats van onthouden. Alle uitslagen & uitleg → | |
| SciCode | 33.1% |
| Programmeeropgaven uit echte wetenschappelijke onderzoekspapers — combineert code en vakkennis. Alle uitslagen & uitleg → | |
| AIME (wiskunde) | 30.3% |
| Vragen van de Amerikaanse wiskunde-olympiade voor scholieren. Meet geavanceerd wiskundig redeneren. Alle uitslagen & uitleg → | |
| IFBench (instructievolgen) | 39.3% |
| Meet hoe precies het model instructies opvolgt, zoals eisen aan lengte, opmaak of vorm van het antwoord. Alle uitslagen & uitleg → | |
| τ²-bench (agent-taken) | 24.3% |
| Realistische klantenservice-scenario's (vluchten omboeken, abonnementen wijzigen) waarin het model zelfstandig regels moet volgen en tools gebruiken. Alle uitslagen & uitleg → | |
| Terminal-Bench (agent-taken) | 3.8% |
| Opdrachten die het model zelfstandig in een computerterminal moet uitvoeren — een zware test voor agent-vaardigheden. Alle uitslagen & uitleg → | |
Prestaties (gemeten)
| Output-snelheid | geen data |
| Time-to-first-token (latency) | geen data |
| Snelheidsbron | inschatting o.b.v. modelklasse |
Design Arena (ELO)
Head-to-head ranglijst waarin modellen het tegen elkaar opnemen op praktijktaken (websites, code, UI, datavisualisatie). Hogere ELO = vaker gewonnen.
| Gemiddelde ELO | 1080 |
| 3d | ELO 1129 · rang 74 |
| codecategories | ELO 1094 · rang 93 |
| uicomponent | ELO 1051 · rang 93 |
| dataviz | ELO 1055 · rang 96 |
Technische specificaties
| Model-ID | mistralai/mistral-medium-3 |
| Contextvenster | 131.072 tokens |
| Kennis bijgewerkt tot | 2025-03-31 |
| Uitgebracht | 7 mei 2025 |
| Invoer | tekst, beeld, bestanden |
| Redeneren (reasoning) | nee |
| Populariteitsscore | 43/100 |
| Databronnen | openrouter, artificial_analysis, design_arena |