BenchLeader

Claude Opus 4.7 vs Gemini 4 Argon

Verdict
  • Gemini 4 Argon (high) leads on quality: 70.0 vs 63.7.
  • Claude Opus 4.7 is stronger in multimodal.
  • Gemini 4 Argon (high) is stronger in coding, human preference, knowledge, maths, reasoning, composite, long context.
  • Gemini 4 Argon (high) is 2.5× cheaper ($4.00 vs $10.00 per 1M blended).
MetricClaude Opus 4.7Gemini 4 Argon (high)
BenchLeader Index63.770.0
Agents & tools score67.567.5
Coding score61.672.1
Human preference score68.673.2
Knowledge score62.375.7
Maths score67.171.9
Multimodal score66.8–
Reasoning score65.382.0
Composite score–89.2
Long context score–65.0
Blended price $/M$10.00$4.00
Output speed81 tok/s–
Time to first answer1.5 s–
Context window1M1M
Humanity's Last Exam36.2%–
Terminal-Bench80.2%–
SimpleBench61.7%–
SciCode–61.8%
WeirdML76.4%–
FrontierCode38.5%–
GSO-Bench44.1%–
Epoch Capabilities Index156.3–
LMArena Text14941525
LMArena Hard Prompts15191551
LMArena Coding15471562
LMArena WebDev15551678
LMArena Vision1316–
LMArena Agent–9.3
AA Intelligence Index v4.3.2–52.6
AA-LCR–79.7%
AA-Omniscience–42.4
Humanity's Last Exam (AA)–57.1%
SciCode (AA)–61.8%
AIME (Vals)96.3%–
LiveCodeBench85.1%–
MMLU-Pro89.9%–
IOI–100.0%
LegalBench85.3%88.3%
CorpFin66.1%–
TaxEval75.3%–
Terminal-Bench 2.1 (Vals)68.5%–
SWE-bench (Vals)82.0%–
GPQA Diamond (Vals)90.2%–
Vals Index–68.9
HiL-Bench41.7%–
EQ-Bench 41311–
Kagi LLM Benchmark73.3%–
CritPt–27.1%
GDPval-AA v2.1–56.3%
BioMysteryBench–76.3%
CaseLaw v268.4%–
Code Migration43.9%68.2%
CUA-bench–4.8%
CyberBench–77.9%
Excel Modeling Benchmark63.7%75.2%
Finance Agent v251.5%65.4%
Harvey's Legal Agent Benchmark6.7%19.6%
Legal Research Bench38.5%54.8%
MedCode54.9%58.8%
MedScribe83.0%87.4%
MMMU-Pro (Vals)85.5%–
MortgageTax70.3%–
MysteryMechanism–45.5%
ProgramBench0.0%2.5%
Public Benefits Bench–69.8%
SAGE56.1%53.6%
SREBench–44.3%
Tax Agent Bench63.9%76.2%
Terminal-Bench 2.0 (Vals)68.5%–
Terminal-Bench 4.0 (Vals)–57.6%
Terminal-Bench Science–44.3%
Vals Multimodal Index67.4%–
Vibe Code Bench v1.171.0%91.9%
SWE Atlas: Codebase QnA40.3%–
SWE Atlas: Refactoring48.6%–
SWE Atlas: Test Writing38.5%–
LMArena Maths14921528
LMArena Creative Writing14831519
LMArena Instruction Following14931529
LMArena Multi-turn15141553
LMArena Longer Queries15081545
LMArena Search1212–
LMArena Document1494–
Mystery Game Puzzles13.0%–
ExploitBench26.5%–
ForecastBench60.3%–
GBAEval43.8%–
ALE-Bench1323.0–
Vending-Bench 210936.8–
Blueprint-Bench 224.5%–
FrontierSWE–55.0%
Terminal-Bench 4.0 (AA)–57.1%
AutomationBench–77.5%
GDP.pdf–21.8%
AA-Omniscience: accuracy–49.9%
AA-Omniscience: non-hallucination–84.9%
AA-Briefcase v1.1–1488

Data as of 2026-10-11. Best configuration of each model; every score links to its source on the model pages.

Claude Opus 4.7 vs Gemini 4 Argon: questions

Is Claude Opus 4.7 better than Gemini 4 Argon?
Gemini 4 Argon (high) leads on quality: 70.0 vs 63.7. The BenchLeader Index combines every independent quality benchmark; Gemini 4 Argon (high) is ahead overall as of 2026-10-11, but check the category scores for your use.
Is Claude Opus 4.7 better than Gemini 4 Argon for coding?
Gemini 4 Argon scores higher in coding (72 vs 62 on the category index, where 50 is average).
Is Claude Opus 4.7 better than Gemini 4 Argon for agentic tasks?
They are level in agentic tasks (68 each).
Which is cheaper, Claude Opus 4.7 or Gemini 4 Argon?
Gemini 4 Argon is cheaper: $4.00 against $10.00 per million tokens, blended at three input tokens per output token.
Which has the larger context window?
Both accept 1M tokens of context.