BenchLeader

Gemini 4 Argon vs Qwen3.8 Max

Verdict
  • Gemini 4 Argon (high) leads on quality: 70.0 vs 64.2.
  • Gemini 4 Argon (high) is stronger in agents & tools, coding, composite, human preference, knowledge, maths, reasoning.
  • Qwen3.8 Max (max) is stronger in long context, multimodal.
  • Qwen3.8 Max (max) is 1.3× cheaper ($3.00 vs $4.00 per 1M blended).
MetricGemini 4 Argon (high)Qwen3.8 Max (max)
BenchLeader Index70.064.2
Agents & tools score67.558.2
Coding score72.164.6
Composite score89.270.7
Human preference score73.268.0
Knowledge score75.762.7
Long context score65.065.4
Maths score71.965.1
Reasoning score82.072.2
Multimodal score–66.2
Blended price $/M$4.00$3.00
Output speed–37 tok/s
Time to first answer–58.9 s
Context window1M1M
Terminal-Bench–27.0%
SciCode61.8%53.2%
APEX-Agents–63.3%
ProofBench–58.0%
Epoch Capabilities Index–156.4
LMArena Text15251483
LMArena Hard Prompts15511504
LMArena Coding15621524
LMArena WebDev16781672
LMArena Vision–1314
LMArena Agent9.32.3
LiveBench–78.5%
LiveBench Reasoning–88.2%
LiveBench Coding–72.9%
LiveBench Agentic Coding–64.7%
LiveBench Mathematics–91.3%
LiveBench Data Analysis–78.4%
LiveBench Language–79.7%
LiveBench Instruction Following–74.1%
AA Intelligence Index v4.3.252.645.4
AA-LCR79.7%80.3%
MMMU-Pro–82.8%
AA-Omniscience42.412.0
GPQA Diamond (AA)–92.8%
Humanity's Last Exam (AA)57.1%43.1%
SciCode (AA)61.8%53.2%
LiveCodeBench–87.8%
MMLU-Pro–88.6%
IOI100.0%68.9%
LegalBench88.3%83.6%
CorpFin–65.8%
TaxEval–75.5%
Terminal-Bench 2.1 (Vals)–67.4%
SWE-bench (Vals)–85.6%
GPQA Diamond (Vals)–93.7%
Vals Index68.948.3
CritPt27.1%20.0%
GDPval-AA v2.156.3%58.6%
τ³-Banking (AA)–51.3%
ITBench SRE (AA)–40.3%
Analyst Agent (AA)–45.0%
APEX-Agents (AA)–42.4%
BioMysteryBench76.3%–
Code Migration68.2%24.0%
CUA-bench4.8%–
CyberBench77.9%28.6%
Excel Modeling Benchmark75.2%60.1%
Finance Agent v265.4%50.6%
Harvey's Legal Agent Benchmark19.6%10.4%
Legal Research Bench54.8%47.6%
MedCode58.8%40.7%
MedScribe87.4%85.0%
MMMU-Pro (Vals)–88.0%
MortgageTax–64.0%
MysteryMechanism45.5%23.9%
ProgramBench2.5%0.0%
Public Benefits Bench69.8%67.1%
SAGE53.6%51.3%
SkillsBench–42.0%
SREBench44.3%–
Tax Agent Bench76.2%66.0%
Terminal-Bench 4.0 (Vals)57.6%34.3%
Terminal-Bench Science44.3%1.4%
Vals Multimodal Index–65.4%
Vibe Code Bench 1-100–12.8%
Vibe Code Bench v1.191.9%64.7%
LMArena Maths15281497
LMArena Creative Writing15191470
LMArena Instruction Following15291474
LMArena Multi-turn15531492
LMArena Longer Queries15451492
FrontierSWE55.0%–
Terminal-Bench 4.0 (AA)57.1%38.9%
Terminal-Bench 2.1 (AA)–88.8%
AutomationBench77.5%56.2%
GDP.pdf21.8%22.8%
MLCR–20.0%
EnterpriseOps-Gym–47.6%
AA-Omniscience: accuracy49.9%31.9%
AA-Omniscience: non-hallucination84.9%71.2%
AA-Briefcase v1.114881617

Data as of 2026-10-11. Best configuration of each model; every score links to its source on the model pages.

Gemini 4 Argon vs Qwen3.8 Max: questions

Is Gemini 4 Argon better than Qwen3.8 Max?
Gemini 4 Argon (high) leads on quality: 70.0 vs 64.2. The BenchLeader Index combines every independent quality benchmark; Gemini 4 Argon (high) is ahead overall as of 2026-10-11, but check the category scores for your use.
Is Gemini 4 Argon better than Qwen3.8 Max for coding?
Gemini 4 Argon scores higher in coding (72 vs 65 on the category index, where 50 is average).
Is Gemini 4 Argon better than Qwen3.8 Max for agentic tasks?
Gemini 4 Argon scores higher in agentic tasks (68 vs 58 on the category index, where 50 is average).
Which is cheaper, Gemini 4 Argon or Qwen3.8 Max?
Qwen3.8 Max is cheaper: $3.00 against $4.00 per million tokens, blended at three input tokens per output token.
Which has the larger context window?
Both accept 1M tokens of context.