Kagi LLM Benchmark
Kagi's unpublished reasoning, coding and instruction questions.
- Published by
- Kagi LLM Benchmark
- Category
- Reasoning
- Index weight
- 0.5
- Models
- 135
- Data as of
- 9 Sept 2026
Kagi (kagi.com).
- 1Claude Fable 591.4%
- 2Claude Fable 588.8%
- 3GPT-5.588.8%
- 4Claude Opus 4.888.8%
- 5Claude Opus 4.683.6%
- 6Grok 4.583.5%
- 7Claude Opus 4.780.7%
- 8Claude Opus 4.580.2%
- 9Gemini 3 Pro80.1%
- 10Kimi K2.578.5%
- 11GPT-5 Pro76.8%
- 12GLM-575.0%
- 13Grok 4.2075.0%
- 14GPT-4o75.0%
- 15Claude Opus 474.3%
135 of 135
| # | |||||
|---|---|---|---|---|---|
| 1 | 91.4% | – | – | – | |
| 2 | 88.8% | – | 70.4 | – | |
| 3 | 88.8% | – | 66.6 | – | |
| 4 | 88.8% | – | – | – | |
| 5 | 83.6% | – | 62.3 | – | |
| 6 | 83.5% | – | 63.4 | – | |
| 7 | 80.7% | – | – | – | |
| 8 | 80.2% | – | 60.6 | – | |
| 9 | 80.1% | – | 61.6 | – | |
| 10 | 78.5% | – | 55.3 | – | |
| 11 | 76.8% | – | 60.7 | – | |
| 12 | 75.0% | – | 57.0 | – | |
| 13 | 75.0% | – | 54.3 | – | |
| 14 | 75.0% | – | 42.3 | – | |
| 15 | 74.3% | – | 54.4 | – | |
| 16 | 73.7% | – | – | – | |
| 17 | 73.6% | grok-4 | 57.2 | – | |
| 18 | 73.3% | – | 65.5 | – | |
| 19 | 73.3% | – | 61.5 | – | |
| 20 | 73.0% | – | 54.0 | – | |
| 21 | 72.7% | gpt-5 | 59.5 | – | |
| 22 | 72.5% | – | 52.7 | – | |
| 23 | 72.4% | – | 63.1 | – | |
| 24 | 72.1% | – | 54.1 | – | |
| 25 | 70.7% | – | 58.0 | – | |
| 26 | 70.3% | – | 58.1 | – | |
| 27 | 70.3% | – | 55.8 | – | |
| 28 | 70.3% | – | 54.1 | – | |
| 29 | 69.4% | – | 51.7 | – | |
| 30 | 69.4% | deepseek-r1 | 48.9 | – | |
| 31 | 69.0% | – | – | – | |
| 32 | 67.6% | o3 | 60.3 | – | |
| 33 | 67.6% | – | 54.9 | – | |
| 34 | 67.2% | – | 54.3 | – | |
| 35 | 67.0% | – | 65.3 | – | |
| 36 | 66.7% | – | 51.0 | – | |
| 37 | Ring 1tUnknown | 66.4% | inclusionai/ring-1t | 48.0 | – |
| 38 | 66.1% | – | 53.0 | – | |
| 39 | 64.4% | – | – | – | |
| 40 | 63.8% | – | 63.4 | – | |
| 41 | 63.8% | – | 56.1 | – | |
| 42 | 63.5% | – | 55.4 | – | |
| 43 | 63.3% | – | 48.4 | – | |
| 44 | 62.6% | – | 57.4 | – | |
| 45 | 62.3% | stepfun-ai/step3 | 51.9 | – | |
| 46 | 62.2% | – | 51.1 | – | |
| 47 | 61.3% | – | 52.0 | – | |
| 48 | 61.3% | grok-3 | 50.0 | – | |
| 49 | Cogito v2 Llama 405BUnknown | 61.1% | – | – | – |
| 50 | 60.0% | – | – | – | |
| 51 | 59.8% | – | 42.9 | – | |
| 52 | 59.6% | – | 50.7 | – | |
| 53 | 58.6% | – | 47.6 | – | |
| 54 | Cogito v2 Deepseek 671BUnknown | 58.4% | – | – | – |
| 55 | 57.9% | – | 52.3 | – | |
| 56 | 57.9% | – | 50.2 | – | |
| 57 | 57.8% | minimax/minimax-m2 | 55.1 | – | |
| 58 | Ling 1tUnknown | 57.8% | inclusionai/ling-1t | 45.1 | – |
| 59 | 57.4% | – | 51.0 | – | |
| 60 | 56.8% | – | 48.1 | – |