BenchLeader

τ²-Bench Telecom (AA)

Artificial Analysis' τ²-Bench telecom run. Shown for reference.

Published by
Artificial Analysis
Category
Agents & tools
Index weight
Reference only
Models
392
Data as of
9 Sept 2026

Source: Artificial Analysis (artificialanalysis.ai). Data taken from the public leaderboard.

Top 15
  1. 1GLM-5.299.1%
  2. 2JT-35B-Flash99.1%
  3. 3GLM-4.7-Flash98.8%
  4. 4Claude Fable 598.5%
  5. 5GLM-5-Turbo98.5%
  6. 6GLM-5V-Turbo98.5%
  7. 7Step 3.7 Flash98.5%
  8. 8GLM-598.3%
  9. 9GLM-5.197.7%
  10. 10Qwen3.6 Plus97.7%
  11. 11Grok 4.397.7%
  12. 12GLM-597.4%
  13. 13GLM-5.197.1%
  14. 14Grok 4.2096.5%
  15. 15DeepSeek V4 Pro96.2%
392 of 392
#
1GLM-5.2Zhipu AIopen99.1%GLM-5.2 (max)57.4
2JT-35B-FlashChina Mobile99.1%52.1
3GLM-4.7-FlashZhipu AIopen98.8%50.0
4Claude Fable 5Anthropic98.5%Claude Fable 5 (with fallback)70.4
5GLM-5-TurboZhipu AI98.5%58.1
6GLM-5V-TurboZhipu AI98.5%GLM 5V Turbo57.2
7Step 3.7 FlashStepFunopen98.5%Step 3.7 Flash54.6
8GLM-5Zhipu AIopen98.3%GLM-559.0
9GLM-5.1Zhipu AIopen97.7%GLM-5.160.1
10Qwen3.6 PlusAlibabaopen97.7%Qwen3.6 Plus59.0
11Grok 4.3xAI97.7%Grok 4.3 (high)57.8
12GLM-5Zhipu AIopen97.4%54.5
13GLM-5.1Zhipu AIopen97.1%52.6
14Grok 4.20xAI96.5%030957.9
15DeepSeek V4 ProDeepSeekopen96.2%042459.7
16Qwen3 6Alibaba95.9%62.0
17Kimi K2.6Moonshot AIopen95.9%Kimi K2.660.6
18Kimi K2.5Moonshot AIopen95.9%Kimi K2.556.1
19GLM-4.7Zhipu AIopen95.9%GLM-4.754.9
20Gemini 3.1 ProGoogle95.6%63.9
21Gemini 3.5 FlashGoogle95.6%63.9
22DeepSeek V4 FlashDeepSeekopen95.6%high, 042059.3
23Qwen3.5 397B-A17BAlibabaopen95.6%Qwen3.5 397B A17B58.6
24Gemini 3.5 FlashGoogle95.3%Gemini 3.5 Flash60.7
25MiniMax-M2.5MiniMaxopen95.3%MiniMax-M2.553.5
26Qwen3.6 35B-A3BAlibabaopen95.3%Qwen3.6 35B A3B53.2
27Mimo v2 ProXiaomi95.0%60.5
28DeepSeek V4 FlashDeepSeekopen95.0%042059.1
29MiMo-V2-FlashXiaomiopen95.0%53.4
30Qwen3 7Alibaba94.7%58.9
31Claude Opus 4.8Anthropic94.4%Claude Opus 4.8 (max)64.7
32Step 3.5 FlashStepFunopen94.4%020254.9
33DeepSeek V4 FlashDeepSeekopen94.4%48.4
34DeepSeek V4 ProDeepSeekopen94.2%high, 042460.0
35MiMo-V2.5-ProXiaomiopen94.2%59.0
36Qwen3.6 27BAlibabaopen94.2%Qwen3.6 27B53.2
37Mistral Medium 3.5Mistral AI94.2%Mistral Medium 3.550.8
38GLM-4.7Zhipu AIopen94.2%50.4
39GPT-5.5OpenAI93.9%GPT-5.5 (xhigh)66.6
40Qwen3.5 27BAlibabaopen93.9%Qwen3.5 27B55.4
41Kimi K2.6Moonshot AIopen93.9%55.3
42Qwen3.5 122B-A10BAlibabaopen93.6%Qwen3.5 122B A10B56.0
43Qwen3.6 27BAlibabaopen93.6%50.7
44Grok 4.1xAI93.3%55.9
45MiMo-V2-FlashXiaomiopen93.3%feb-202653.3
46Tri-21B-ThinkTrillion Labsopen93.3%44.0
47GPT-5.5OpenAI93.0%66.3
48Qwen3.7 PlusAlibaba93.0%Qwen3.7 Plus59.7
49Kimi K2 ThinkingMoonshot AIopen93.0%52.8
50JT-MINIChina Mobile93.0%43.6
51Nova 2.0 Pro PreviewAmazon92.7%52.3
52Ring-2.6-1TAnt Group92.4%51.1
53Claude Opus 4.6Anthropic92.1%63.1
54GPT-5.2 CodexOpenAI92.1%GPT-5.2 Codex (xhigh)60.7
55Qwen3.5-4BAlibaba92.1%Qwen3.5 4B47.1
56GPT-5.5OpenAI91.8%64.9
57GLM-4.7-FlashZhipu AIopen91.8%41.3
58Muse SparkMeta91.5%65.4
59Grok 4.3xAI91.2%60.7
60Mimo v2 OmniXiaomi91.2%59.1