τ²-Bench Telecom (AA)
Artificial Analysis' τ²-Bench telecom run. Shown for reference.
- Published by
- Artificial Analysis
- Category
- Agents & tools
- Index weight
- Reference only
- Models
- 392
- Data as of
- 9 Sept 2026
Source: Artificial Analysis (artificialanalysis.ai). Data taken from the public leaderboard.
- 1GLM-5.299.1%
- 2JT-35B-Flash99.1%
- 3GLM-4.7-Flash98.8%
- 4Claude Fable 598.5%
- 5GLM-5-Turbo98.5%
- 6GLM-5V-Turbo98.5%
- 7Step 3.7 Flash98.5%
- 8GLM-598.3%
- 9GLM-5.197.7%
- 10Qwen3.6 Plus97.7%
- 11Grok 4.397.7%
- 12GLM-597.4%
- 13GLM-5.197.1%
- 14Grok 4.2096.5%
- 15DeepSeek V4 Pro96.2%
392 of 392
| # | |||||
|---|---|---|---|---|---|
| 1 | 99.1% | GLM-5.2 (max) | 57.4 | – | |
| 2 | JT-35B-FlashChina Mobile | 99.1% | – | 52.1 | – |
| 3 | 98.8% | – | 50.0 | – | |
| 4 | 98.5% | Claude Fable 5 (with fallback) | 70.4 | – | |
| 5 | 98.5% | – | 58.1 | – | |
| 6 | 98.5% | GLM 5V Turbo | 57.2 | – | |
| 7 | 98.5% | Step 3.7 Flash | 54.6 | – | |
| 8 | 98.3% | GLM-5 | 59.0 | – | |
| 9 | 97.7% | GLM-5.1 | 60.1 | – | |
| 10 | 97.7% | Qwen3.6 Plus | 59.0 | – | |
| 11 | 97.7% | Grok 4.3 (high) | 57.8 | – | |
| 12 | 97.4% | – | 54.5 | – | |
| 13 | 97.1% | – | 52.6 | – | |
| 14 | 96.5% | 0309 | 57.9 | – | |
| 15 | 96.2% | 0424 | 59.7 | – | |
| 16 | 95.9% | – | 62.0 | – | |
| 17 | 95.9% | Kimi K2.6 | 60.6 | – | |
| 18 | 95.9% | Kimi K2.5 | 56.1 | – | |
| 19 | 95.9% | GLM-4.7 | 54.9 | – | |
| 20 | 95.6% | – | 63.9 | – | |
| 21 | 95.6% | – | 63.9 | – | |
| 22 | 95.6% | high, 0420 | 59.3 | – | |
| 23 | 95.6% | Qwen3.5 397B A17B | 58.6 | – | |
| 24 | 95.3% | Gemini 3.5 Flash | 60.7 | – | |
| 25 | 95.3% | MiniMax-M2.5 | 53.5 | – | |
| 26 | 95.3% | Qwen3.6 35B A3B | 53.2 | – | |
| 27 | Mimo v2 ProXiaomi | 95.0% | – | 60.5 | – |
| 28 | 95.0% | 0420 | 59.1 | – | |
| 29 | MiMo-V2-FlashXiaomiopen | 95.0% | – | 53.4 | – |
| 30 | 94.7% | – | 58.9 | – | |
| 31 | 94.4% | Claude Opus 4.8 (max) | 64.7 | – | |
| 32 | 94.4% | 0202 | 54.9 | – | |
| 33 | 94.4% | – | 48.4 | – | |
| 34 | 94.2% | high, 0424 | 60.0 | – | |
| 35 | MiMo-V2.5-ProXiaomiopen | 94.2% | – | 59.0 | – |
| 36 | 94.2% | Qwen3.6 27B | 53.2 | – | |
| 37 | 94.2% | Mistral Medium 3.5 | 50.8 | – | |
| 38 | 94.2% | – | 50.4 | – | |
| 39 | 93.9% | GPT-5.5 (xhigh) | 66.6 | – | |
| 40 | 93.9% | Qwen3.5 27B | 55.4 | – | |
| 41 | 93.9% | – | 55.3 | – | |
| 42 | 93.6% | Qwen3.5 122B A10B | 56.0 | – | |
| 43 | 93.6% | – | 50.7 | – | |
| 44 | 93.3% | – | 55.9 | – | |
| 45 | MiMo-V2-FlashXiaomiopen | 93.3% | feb-2026 | 53.3 | – |
| 46 | Tri-21B-ThinkTrillion Labsopen | 93.3% | – | 44.0 | – |
| 47 | 93.0% | – | 66.3 | – | |
| 48 | 93.0% | Qwen3.7 Plus | 59.7 | – | |
| 49 | 93.0% | – | 52.8 | – | |
| 50 | JT-MINIChina Mobile | 93.0% | – | 43.6 | – |
| 51 | 92.7% | – | 52.3 | – | |
| 52 | Ring-2.6-1TAnt Group | 92.4% | – | 51.1 | – |
| 53 | 92.1% | – | 63.1 | – | |
| 54 | 92.1% | GPT-5.2 Codex (xhigh) | 60.7 | – | |
| 55 | 92.1% | Qwen3.5 4B | 47.1 | – | |
| 56 | 91.8% | – | 64.9 | – | |
| 57 | 91.8% | – | 41.3 | – | |
| 58 | 91.5% | – | 65.4 | – | |
| 59 | 91.2% | – | 60.7 | – | |
| 60 | Mimo v2 OmniXiaomi | 91.2% | – | 59.1 | – |