EQ-Bench 4
Emotional intelligence in multi-turn role-play, judged pairwise into an Elo-style rating.
- Published by
- EQ-Bench
- Category
- Human preference
- Index weight
- 0.5
- Models
- 27
- Data as of
- 9 Sept 2026
MIT — EQ-Bench.
- 1Claude Opus 51385
- 2Claude Fable 51340
- 3Kimi K31339
- 4GPT-5.51315
- 5Claude Opus 4.71311
- 6Claude Opus 4.81281
- 7GPT-5.41272
- 8Muse Spark 1.11260
- 9GPT-5.6 Sol1250
- 10Claude Sonnet 51236
- 11GPT-5.6 Terra1234
- 12Claude Opus 4.61223
- 13GLM-5.21222
- 14MiMo-V2.5-Pro1208
- 15Claude Sonnet 4.61207
27 of 27
| # | |||||
|---|---|---|---|---|---|
| 1 | 1385 | – | 70.0 | – | |
| 2 | 1340 | – | 70.4 | – | |
| 3 | 1339 | kimi-k3 | 66.5 | – | |
| 4 | 1315 | gpt-5.5 | 66.6 | – | |
| 5 | 1311 | – | 65.5 | – | |
| 6 | 1281 | – | 64.7 | – | |
| 7 | 1272 | gpt-5.4 | 63.4 | – | |
| 8 | 1260 | – | 64.9 | – | |
| 9 | 1250 | – | 65.3 | – | |
| 10 | 1236 | – | 61.2 | – | |
| 11 | 1234 | – | 62.3 | – | |
| 12 | 1223 | – | 63.1 | – | |
| 13 | 1222 | glm-5.2 | 57.4 | – | |
| 14 | MiMo-V2.5-ProXiaomiopen | 1208 | – | 59.0 | – |
| 15 | 1207 | – | 60.3 | – | |
| 16 | 1202 | kimi-k2.6 | 60.6 | – | |
| 17 | 1166 | – | 59.7 | – | |
| 18 | 1156 | – | 56.6 | – | |
| 19 | 1150 | minimax-m3 | 56.9 | – | |
| 20 | 1142 | – | 63.9 | – | |
| 21 | 1120 | – | 55.4 | – | |
| 22 | 1110 | – | 58.9 | – | |
| 23 | 1087 | – | 60.7 | – | |
| 24 | 1075 | grok-4.3 | 57.8 | – | |
| 25 | 1064 | – | 47.9 | – | |
| 26 | 1026 | – | 53.2 | – | |
| 27 | 993 | – | 50.8 | – |