IFBench
Precise instruction following on unseen constraints. Run by Artificial Analysis.
- Published by
- Artificial Analysis
- Category
- Instruction following
- Index weight
- 1.0
- Models
- 401
- Data as of
- 9 Sept 2026
Source: Artificial Analysis (artificialanalysis.ai). Data taken from the public leaderboard.
- 1Grok 4.383.3%
- 2Grok 4.2082.9%
- 3MiniMax-M382.9%
- 4Nemotron 3 Ultra 550B A55B81.4%
- 5Grok 4.381.3%
- 6Grok 4.381.0%
- 7Qwen3 780.5%
- 8Nemotron Cascade 2 30B A3B80.4%
- 9MiMo-V2.5-Pro79.9%
- 10Nova 2.0 Pro Preview79.6%
- 11DeepSeek V4 Flash79.2%
- 12Nova 2.0 Pro Preview79.0%
- 13Qwen3.5 397B-A17B78.8%
- 14Gemini 3 Flash78.0%
- 15Qwen3.7 Plus78.0%
401 of 401
| # | |||||
|---|---|---|---|---|---|
| 1 | 83.3% | – | 60.7 | – | |
| 2 | 82.9% | 0309 | 57.9 | – | |
| 3 | 82.9% | MiniMax-M3 | 56.9 | – | |
| 4 | 81.4% | Nemotron 3 Ultra | 58.3 | – | |
| 5 | 81.3% | Grok 4.3 (high) | 57.8 | – | |
| 6 | 81.0% | – | 59.5 | – | |
| 7 | 80.5% | – | 58.9 | – | |
| 8 | 80.4% | Nemotron Cascade 2 30B A3B | 51.0 | – | |
| 9 | MiMo-V2.5-ProXiaomiopen | 79.9% | – | 59.0 | – |
| 10 | 79.6% | – | 51.3 | – | |
| 11 | 79.2% | 0420 | 59.1 | – | |
| 12 | 79.0% | – | 52.3 | – | |
| 13 | 78.8% | Qwen3.5 397B A17B | 58.6 | – | |
| 14 | 78.0% | – | 61.5 | – | |
| 15 | 78.0% | Qwen3.7 Plus | 59.7 | – | |
| 16 | 77.6% | GPT-5.2 Codex (xhigh) | 60.7 | – | |
| 17 | 77.2% | – | 54.3 | – | |
| 18 | 77.1% | – | 63.9 | – | |
| 19 | 76.6% | – | 62.0 | – | |
| 20 | 76.5% | 0424 | 59.7 | – | |
| 21 | 76.3% | Gemini 3.5 Flash | 60.7 | – | |
| 22 | 76.3% | GLM-5.1 | 60.1 | – | |
| 23 | 76.0% | Kimi K2.6 | 60.6 | – | |
| 24 | 75.9% | – | 65.4 | – | |
| 25 | 75.9% | GPT-5.4 nano (xhigh) | 53.9 | – | |
| 26 | 75.8% | GPT-5.5 (xhigh) | 66.6 | – | |
| 27 | 75.7% | MiniMax-M2.7 | 56.5 | – | |
| 28 | 75.7% | Qwen3.5 122B A10B | 56.0 | – | |
| 29 | 75.6% | Gemma 4 31B | 55.4 | – | |
| 30 | 75.6% | Qwen3.5 27B | 55.4 | – | |
| 31 | 75.4% | GPT-5.2 (xhigh) | 61.5 | – | |
| 32 | 75.4% | GPT-5 mini (high) | 55.8 | – | |
| 33 | 75.4% | GPT-5.3 Codex (xhigh) | 62.4 | – | |
| 34 | 75.2% | Qwen3.6 Plus | 59.0 | – | |
| 35 | 74.6% | – | 63.9 | – | |
| 36 | 74.2% | GPT-5 Codex (high) | 58.1 | – | |
| 37 | 74.0% | GPT-5.4 (xhigh) | 63.4 | – | |
| 38 | 74.0% | – | 53.9 | – | |
| 39 | 73.5% | Gemma 4 12B | 52.1 | – | |
| 40 | 73.5% | high, 0420 | 59.3 | – | |
| 41 | 73.3% | GLM-5.2 (max) | 57.4 | – | |
| 42 | 73.3% | GPT-5.4 mini (xhigh) | 54.8 | – | |
| 43 | 73.2% | – | 58.1 | – | |
| 44 | 73.1% | GPT-5 (high) | 59.5 | – | |
| 45 | 72.9% | GPT-5.1 (high) | 59.4 | – | |
| 46 | 72.7% | GPT-5.6 Sol (max) | 65.3 | – | |
| 47 | 72.5% | Qwen3.5 35B A3B | 53.4 | – | |
| 48 | 72.5% | Gemma 4 26B A4B | 54.0 | – | |
| 49 | 72.3% | GLM-5 | 59.0 | – | |
| 50 | 72.3% | MiniMax-M2 | 55.1 | – | |
| 51 | MiMo-V2-FlashXiaomiopen | 71.8% | feb-2026 | 53.3 | – |
| 52 | 71.6% | – | 66.3 | – | |
| 53 | 71.6% | MiniMax-M2.5 | 53.5 | – | |
| 54 | 71.5% | – | 60.4 | – | |
| 55 | 71.5% | Nemotron 3 Super | 53.6 | – | |
| 56 | 71.4% | o3 | 60.3 | – | |
| 57 | 71.3% | high, 0424 | 60.0 | – | |
| 58 | 71.2% | GPT-5.6 Terra (max) | 62.3 | – | |
| 59 | 71.2% | Solar Pro 3 | 44.6 | – | |
| 60 | 71.2% | – | 54.5 | – |