Battles
Every battle is a real run: the published task suite for that category, both contestants, a panel of blind position-swapped judges, raw outputs downloadable. No battle, no verdict.
Everyday chat · tested 12 Aug 2026
ChatGPTvsClaude
5–2
ChatGPT leads
p=0.4531 · 11 ties · κ=0.308
Everyday chat · tested 12 Aug 2026
ClaudevsGemini
2–4
Gemini leads
p=0.6875 · 12 ties · κ=0.652
Writing · tested 12 Aug 2026
ClaudevsGemini
1–4
Gemini leads
p=0.375 · 13 ties · κ=0.483
Writing · tested 7 Aug 2026
ClaudevsChatGPT
5–4
Claude leads
p=1 · 9 ties · κ=0.426
Everyday chat · tested 7 Aug 2026
ChatGPTvsGemini
3–1
ChatGPT leads
p=0.625 · 14 ties · κ=0.174
Images · tested 17 Jul 2026
GeminivsGPT Image (in ChatGPT)
2–4
GPT Image (in ChatGPT) leads
p=0.6875 · 4 ties
If you write code
These compare things you reach through an API key, and the tasks behind them are programming tasks. Which AI is best at which job →
Best-value API · tested 12 Aug 2026
Kimi K3vsGPT-5.6 Terra
6–3
Kimi K3 leads
p=0.5078 · 21 ties · κ=0.432
Best-value API · tested 12 Aug 2026
Qwen3.7 MaxvsClaude Opus 4.6
9–5
Qwen3.7 Max leads
p=0.424 · 16 ties · κ=0.651
Best free · tested 12 Aug 2026
GLM 5.2vsGemini 3.5 Flash
3–4
Gemini 3.5 Flash leads
p=1 · 23 ties · κ=0.575
Best free · tested 12 Aug 2026
Grok 4.5vsGemini 3.5 Flash
2–4
Gemini 3.5 Flash leads
p=0.6875 · 24 ties · κ=0.186
Best-value API · tested 12 Aug 2026
GLM 5.2vsGPT-5.6 Terra
3–2
GLM 5.2 leads
p=1 · 25 ties · κ=0.228
Best-value API · tested 12 Aug 2026
GLM 5.2vsGrok 4.5
2–5
Grok 4.5 leads
p=0.4531 · 23 ties · κ=0.101
Best-value API · tested 12 Aug 2026
GPT-5.6 TerravsGrok 4.5
4–4
Dead heat
p=1 · 22 ties · κ=0.355
Best-value API · tested 10 Aug 2026
Grok 4.5vsClaude Opus 4.6
10–5
Grok 4.5 leads
p=0.3018 · 15 ties · κ=0.649
Best-value API · tested 10 Aug 2026
Kimi K3vsClaude Opus 4.6
11–3
Kimi K3 leads
p=0.0574 · 16 ties · κ=0.579
Best free · tested 7 Aug 2026
Gemini 3.5 FlashvsDeepSeek V4 Flash
9–2
Gemini 3.5 Flash leads
p=0.0654 · 19 ties · κ=0.507
Best-value API · tested 7 Aug 2026
DeepSeek V4 ProvsGPT-5.6 Terra
4–7
GPT-5.6 Terra leads
p=0.5488 · 19 ties · κ=0.179
Best-value API · tested 7 Aug 2026
GLM 5.2vsClaude Opus 4.6
8–3
GLM 5.2 leads
p=0.2266 · 19 ties · κ=0.55
Coding · tested 7 Aug 2026
CursorvsGitHub Copilot
1–4
GitHub Copilot leads
p=0.375 · 13 ties · κ=0.71