Direct naar de inhoud
ModelCompass powered by Wux AI
Terug
Benchmark · bron: Artificial Analysis score in %

τ²-bench (agent-taken)

Realistische klantenservice-scenario's (vluchten omboeken, abonnementen wijzigen) waarin het model zelfstandig regels moet volgen en tools gebruiken.

Wat meet deze benchmark?

τ²-bench simuleert realistische klantenservice-gesprekken — vliegtickets omboeken, telecomabonnementen wijzigen — waarin het model zelfstandig tools moet gebruiken en bedrijfsregels moet volgen.

Hoe werkt het?

Het model praat met een gesimuleerde klant en moet taken écht uitvoeren via systemen, binnen de regels ("geen terugbetaling zonder bon"). De score is het percentage succesvol afgeronde scenario's.

Hoe lees je de score?

Percentage geslaagde scenario's. De beste voorspeller voor hoe betrouwbaar een model is als zelfstandige (klantenservice-)assistent.

Alle uitslagen

64 modellen met een τ²-bench (agent-taken)-score, van hoog naar laag. Klik een model voor alle details.

1 GLM 5.2Z.ai 🇨🇳China 99.1% 2 GLM 5.2 (free)Z.ai 🇨🇳China 99.1% 3 Claude Fable 5Anthropic 🇺🇸Verenigde Staten 98.5% 4 Grok 4.3xAI (Grok) 🇺🇸Verenigde Staten 97.7% 5 Kimi K2.6Moonshot AI 🇨🇳China 95.9% 6 Gemini 3.1 Pro PreviewGoogle 🇺🇸Verenigde Staten 95.6% 7 Qwen3.7 MaxAlibaba (Qwen) 🇨🇳China 94.7% 8 Mistral Medium 3.5Mistral AI 🇫🇷Frankrijk 94.2% 9 GPT-5.5OpenAI 🇺🇸Verenigde Staten 93.9% 10 Grok 4.20xAI (Grok) 🇺🇸Verenigde Staten 93% 11 Trinity Large ThinkingArcee AI 🇺🇸Verenigde Staten 90.1% 12 MiniMax M3MiniMax 🇨🇳China 88.9% 13 GPT-5.6 TerraOpenAI 🇺🇸Verenigde Staten 86.3% 14 GPT-5.3-CodexOpenAI 🇺🇸Verenigde Staten 86% 15 GPT-5.6 SolOpenAI 🇺🇸Verenigde Staten 85.1% 16 GPT-5.2OpenAI 🇺🇸Verenigde Staten 84.8% 17 GPT-5.2 ChatOpenAI 🇺🇸Verenigde Staten 84.8% 18 GPT-5OpenAI 🇺🇸Verenigde Staten 84.8% 19 GPT-5.1-CodexOpenAI 🇺🇸Verenigde Staten 83% 20 GPT-5.1OpenAI 🇺🇸Verenigde Staten 81.9% 21 o3OpenAI 🇺🇸Verenigde Staten 80.7% 22 GPT-5 MiniOpenAI 🇺🇸Verenigde Staten 71.1% 23 gpt-oss-120bOpenAI 🇺🇸Verenigde Staten 65.8% 24 GPT-5.1-Codex-MiniOpenAI 🇺🇸Verenigde Staten 62.9% 25 o1OpenAI 🇺🇸Verenigde Staten 62.6% 26 gpt-oss-20bOpenAI 🇺🇸Verenigde Staten 60.2% 27 Gemma 4 31BGoogle 🇺🇸Verenigde Staten 59.9% 28 Gemma 4 31B (free)Google 🇺🇸Verenigde Staten 59.9% 29 o4 Mini HighOpenAI 🇺🇸Verenigde Staten 55.6% 30 o4 MiniOpenAI 🇺🇸Verenigde Staten 55.6% 31 Gemini 2.5 Pro Preview 06-05Google 🇺🇸Verenigde Staten 54.1% 32 Gemini 2.5 ProGoogle 🇺🇸Verenigde Staten 54.1% 33 GPT-4.1OpenAI 🇺🇸Verenigde Staten 47.1% 34 Nemotron 3 Nano Omni (free)NVIDIA 🇺🇸Verenigde Staten 45.3% 35 Gemma 4 26B A4BGoogle 🇺🇸Verenigde Staten 43.6% 36 Gemma 4 26B A4B (free)Google 🇺🇸Verenigde Staten 43.6% 37 Mistral Small 4Mistral AI 🇫🇷Frankrijk 41.2% 38 Mistral Medium 3.1Mistral AI 🇫🇷Frankrijk 40.6% 39 North Mini Code (free)Cohere 🇨🇦Canada 37.4% 40 GPT-5 NanoOpenAI 🇺🇸Verenigde Staten 36.5% 41 Gemini 3.1 Flash LiteGoogle 🇺🇸Verenigde Staten 31.3% 42 Gemini 3.1 Flash Lite PreviewGoogle 🇺🇸Verenigde Staten 31.3% 43 o3 Mini HighOpenAI 🇺🇸Verenigde Staten 28.7% 44 o3 MiniOpenAI 🇺🇸Verenigde Staten 28.7% 45 Granite 4.1 8BIBM 🇺🇸Verenigde Staten 27.8% 46 Llama 3.3 70B InstructMeta 🇺🇸Verenigde Staten 26.6% 47 GPT-4o (2024-11-20)OpenAI 🇺🇸Verenigde Staten 25.1% 48 Mistral Medium 3Mistral AI 🇫🇷Frankrijk 24.3% 49 Llama 3.2 3B InstructMeta 🇺🇸Verenigde Staten 21.1% 50 Claude 3 HaikuAnthropic 🇺🇸Verenigde Staten 21.1% 51 Mistral Small 3Mistral AI 🇫🇷Frankrijk 19.6% 52 Gemini 2.5 Flash LiteGoogle 🇺🇸Verenigde Staten 18.4% 53 Llama 4 MaverickMeta 🇺🇸Verenigde Staten 17.8% 54 Llama 3.1 8B InstructMeta 🇺🇸Verenigde Staten 16.4% 55 Llama 4 ScoutMeta 🇺🇸Verenigde Staten 15.5% 56 Command ACohere 🇨🇦Canada 15.2% 57 Granite 4.0 MicroIBM 🇺🇸Verenigde Staten 12.6% 58 Gemma 3 12BGoogle 🇺🇸Verenigde Staten 10.8% 59 Gemma 3 27BGoogle 🇺🇸Verenigde Staten 10.5% 60 Gemma 3 4BGoogle 🇺🇸Verenigde Staten 5% 61 Olmo 3 32B ThinkAllenAI 🇺🇸Verenigde Staten 0% 62 Phi 4Microsoft 🇺🇸Verenigde Staten 0% 63 Reka Flash 3Reka 🇺🇸Verenigde Staten 0% 64 Llama 3.2 1B InstructMeta 🇺🇸Verenigde Staten 0%
Kleur = niveau: Topklasse Professioneel Standaard Lichtgewicht