BenchLeader

EQ-Bench 4

Emotional intelligence in multi-turn role-play, judged pairwise into an Elo-style rating.

Published by
EQ-Bench
Category
Human preference
Index weight
0.5
Models
27
Data as of
9 Sept 2026

MIT — EQ-Bench.

27 of 27
#
1Claude Opus 5Anthropic138570.0
2Claude Fable 5Anthropic134070.4
3Kimi K3Moonshot AIopen1339kimi-k366.5
4GPT-5.5OpenAI1315gpt-5.566.6
5Claude Opus 4.7Anthropic131165.5
6Claude Opus 4.8Anthropic128164.7
7GPT-5.4OpenAI1272gpt-5.463.4
8Muse Spark 1.1Meta126064.9
9GPT-5.6 SolOpenAI125065.3
10Claude Sonnet 5Anthropic123661.2
11GPT-5.6 TerraOpenAI123462.3
12Claude Opus 4.6Anthropic122363.1
13GLM-5.2Zhipu AIopen1222glm-5.257.4
14MiMo-V2.5-ProXiaomiopen120859.0
15Claude Sonnet 4.6Anthropic120760.3
16Kimi K2.6Moonshot AIopen1202kimi-k2.660.6
17DeepSeek V4 ProDeepSeekopen116659.7
18GPT-5.6 LunaOpenAI115656.6
19MiniMax-M3MiniMaxopen1150minimax-m356.9
20Gemini 3.1 ProGoogle114263.9
21Gemma-4-31B-ITNVIDIAopen112055.4
22Qwen3 7Alibaba111058.9
23Gemini 3.5 FlashGoogle108760.7
24Grok 4.3xAI1075grok-4.357.8
25Claude Haiku 4.5Anthropic106447.9
26Qwen3.6 27BAlibabaopen102653.2
27Mistral Medium 3.5Mistral AI99350.8