Terug
Benchmark · bron: Artificial Analysis score in %
Terminal-Bench (agent-taken)
Opdrachten die het model zelfstandig in een computerterminal moet uitvoeren — een zware test voor agent-vaardigheden.
Wat meet deze benchmark?
Terminal-Bench laat een model zelfstandig opdrachten uitvoeren in een computerterminal: bestanden bewerken, software installeren, fouten opsporen en oplossen.
Hoe werkt het?
Het model krijgt een doel en een echte (gesimuleerde) terminal. Na afloop controleert een script of het doel daadwerkelijk is bereikt — half werk telt niet.
Hoe lees je de score?
Percentage volledig afgeronde taken. Een zware test: hoge scores wijzen op een model dat je met meerstaps technisch werk kunt vertrouwen.
Alle uitslagen
85 modellen met een Terminal-Bench (agent-taken)-score, van hoog naar laag. Klik een model voor alle details.
1
Claude Opus 5Anthropic
🇺🇸Verenigde Staten
89.1%
2
Grok 4.6xAI (Grok)
🇺🇸Verenigde Staten
88.4%
3
GPT-5.6 SolOpenAI
🇺🇸Verenigde Staten
88%
4
GPT-5.6 TerraOpenAI
🇺🇸Verenigde Staten
88%
5
Gemini 3.7 FlashGoogle
🇺🇸Verenigde Staten
85.8%
6
Kimi K3Moonshot AI
🇨🇳China
85%
7
Claude Fable 5Anthropic
🇺🇸Verenigde Staten
84.6%
8
GPT-5.5OpenAI
🇺🇸Verenigde Staten
84.3%
9
Qwen3.8 MaxAlibaba (Qwen)
🇨🇳China
81.3%
10
GPT-5.6 LunaOpenAI
🇺🇸Verenigde Staten
80.9%
11
Claude Sonnet 5Anthropic
🇺🇸Verenigde Staten
80.5%
12
Muse Spark 1.2Meta
🌐Onbekend
80.1%
13
Qwen3.8 27BAlibaba (Qwen)
🇨🇳China
79.8%
14
DeepSeek V4 Flash LatestDeepSeek
🇨🇳China
78.7%
15
DeepSeek V4 Pro 0423DeepSeek
🇨🇳China
78.7%
16
DeepSeek V4 Flash 0423DeepSeek
🇨🇳China
78.7%
17
GLM 5.2Z.ai
🇨🇳China
77.9%
18
GLM 5.2 (free)Z.ai
🇨🇳China
77.9%
19
Qwen3.7 MaxAlibaba (Qwen)
🇨🇳China
74.5%
20
Gemini 3.1 Pro PreviewGoogle
🇺🇸Verenigde Staten
73.8%
21
Kimi K2.6Moonshot AI
🇨🇳China
65.9%
22
MiniMax M3MiniMax
🇨🇳China
65.2%
23
Solar Pro 4Upstage
🇰🇷Zuid-Korea
57.3%
24
InklingThinkingmachines
🌐Onbekend
55.1%
25
Inkling (free)Thinkingmachines
🌐Onbekend
55.1%
26
Inkling SmallThinkingmachines
🌐Onbekend
55.1%
27
Inkling Small (free)Thinkingmachines
🌐Onbekend
55.1%
28
Gemini 3.5 Flash LiteGoogle
🇺🇸Verenigde Staten
53.6%
29
GPT-5.3-CodexOpenAI
🇺🇸Verenigde Staten
53%
30
GPT-5.1OpenAI
🇺🇸Verenigde Staten
52.4%
31
Mistral Medium 3.5Mistral AI
🇫🇷Frankrijk
50.6%
32
LongCat 2.0Meituan
🌐Onbekend
50.2%
33
GPT-5.2OpenAI
🇺🇸Verenigde Staten
47%
34
GPT-5.2 ChatOpenAI
🇺🇸Verenigde Staten
47%
35
Gemma 4 31BGoogle
🇺🇸Verenigde Staten
43.4%
36
Gemma 4 31B (free)Google
🇺🇸Verenigde Staten
43.4%
37
Grok 4.3xAI (Grok)
🇺🇸Verenigde Staten
39.7%
38
Gemma 4 26B A4BGoogle
🇺🇸Verenigde Staten
39%
39
Gemma 4 26B A4B (free)Google
🇺🇸Verenigde Staten
39%
40
Grok 4.20xAI (Grok)
🇺🇸Verenigde Staten
37.9%
41
o3OpenAI
🇺🇸Verenigde Staten
37.1%
42
North Mini Code (free)Cohere
🇨🇦Canada
35.6%
43
GPT-5OpenAI
🇺🇸Verenigde Staten
35.2%
44
GPT-5.1-CodexOpenAI
🇺🇸Verenigde Staten
34.8%
45
GPT-5.1-Codex-MiniOpenAI
🇺🇸Verenigde Staten
33.3%
46
Gemini 3.1 Flash LiteGoogle
🇺🇸Verenigde Staten
31.1%
47
Gemini 3.1 Flash Lite PreviewGoogle
🇺🇸Verenigde Staten
31.1%
48
GPT-5 MiniOpenAI
🇺🇸Verenigde Staten
28.8%
49
Gemini 2.5 Pro Preview 06-05Google
🇺🇸Verenigde Staten
28.5%
50
Gemini 2.5 ProGoogle
🇺🇸Verenigde Staten
28.5%
51
gpt-oss-120bOpenAI
🇺🇸Verenigde Staten
26.2%
52
Nemotron 3.5 LightningNVIDIA
🇺🇸Verenigde Staten
24.3%
53
Nemotron 3.5 Lightning (free)NVIDIA
🇺🇸Verenigde Staten
24.3%
54
Mistral Small 4Mistral AI
🇫🇷Frankrijk
21%
55
Trinity Large ThinkingArcee AI
🇺🇸Verenigde Staten
20.6%
56
o4 Mini HighOpenAI
🇺🇸Verenigde Staten
15.2%
57
o4 MiniOpenAI
🇺🇸Verenigde Staten
15.2%
58
gpt-oss-20bOpenAI
🇺🇸Verenigde Staten
13.9%
59
Mistral Medium 3.1Mistral AI
🇫🇷Frankrijk
13.9%
60
GPT-4.1OpenAI
🇺🇸Verenigde Staten
13.6%
61
o1OpenAI
🇺🇸Verenigde Staten
12.9%
62
GPT-5 NanoOpenAI
🇺🇸Verenigde Staten
12.1%
63
GPT-4o (2024-11-20)OpenAI
🇺🇸Verenigde Staten
8.3%
64
Llama 4 MaverickMeta
🇺🇸Verenigde Staten
7.9%
65
o3 Mini HighOpenAI
🇺🇸Verenigde Staten
6.8%
66
o3 MiniOpenAI
🇺🇸Verenigde Staten
6.8%
67
Nemotron 3 Nano Omni (free)NVIDIA
🇺🇸Verenigde Staten
6.7%
68
GPT-4o-mini (2024-07-18)OpenAI
🇺🇸Verenigde Staten
5.6%
69
GPT-4o-miniOpenAI
🇺🇸Verenigde Staten
5.6%
70
Llama 3.3 70B InstructMeta
🇺🇸Verenigde Staten
4.9%
71
Gemini 2.5 Flash LiteGoogle
🇺🇸Verenigde Staten
4.5%
72
Gemma 3 27BGoogle
🇺🇸Verenigde Staten
4.5%
73
Mistral Medium 3Mistral AI
🇫🇷Frankrijk
3.8%
74
Phi 4Microsoft
🇺🇸Verenigde Staten
3.8%
75
Llama 4 ScoutMeta
🇺🇸Verenigde Staten
3.7%
76
Granite 4.1 8BIBM
🇺🇸Verenigde Staten
3.4%
77
Olmo 3 32B ThinkAllenAI
🇺🇸Verenigde Staten
1.5%
78
Llama 3.1 8B InstructMeta
🇺🇸Verenigde Staten
1.5%
79
Granite 4.0 MicroIBM
🇺🇸Verenigde Staten
1.5%
80
Command ACohere
🇨🇦Canada
0.8%
81
Claude 3 HaikuAnthropic
🇺🇸Verenigde Staten
0.8%
82
Gemma 3 4BGoogle
🇺🇸Verenigde Staten
0.4%
83
Gemma 3 12BGoogle
🇺🇸Verenigde Staten
0%
84
Reka Flash 3Reka
🇺🇸Verenigde Staten
0%
85
Llama 3.2 1B InstructMeta
🇺🇸Verenigde Staten
0%
Kleur = niveau:
Topklasse
Professioneel
Standaard
Lichtgewicht