Head-to-head comparisons

250 staged pairs · catalog 2026-09-14 · verdicts gated on price×intelligence dominance

Agnes 2.5 Pro Alpha vs GPT-5.6 Terra (low)

Agnes 2.5 Pro Alpha vs Qwen3.8 27B (medium)

Agnes 3.0 Flash vs DeepSeek V4 Pro 0813 (Reasoning, Max Effort)

Agnes 3.0 Flash vs Grok 4.6 (low)

Agnes 3.0 Flash vs Ling-3.0-flash-VL

Agnes 3.0 Flash vs Qwen3.8-Flash-Next

Celeris-1 vs Hermes 3 - Llama-3.1 70B

Celeris-1 vs Phi-4 Mini Instruct

Claude 4.5 Haiku (Non-reasoning) vs Gemma 4 31B (Reasoning)

Claude 4.5 Haiku (Non-reasoning) vs Kimi K2 0905

Claude 4.5 Haiku (Reasoning) vs GLM-4.7 (Non-reasoning)

Claude 4.5 Haiku (Reasoning) vs Qwen3.5 122B A10B (Non-reasoning)

Claude 4.5 Sonnet (Non-reasoning) vs Qwen3.5 27B (Non-reasoning)

Claude 4.5 Sonnet (Non-reasoning) vs Qwen3.5 35B A3B (Reasoning)

Claude 4.5 Sonnet (Reasoning) vs GPT-5.4 nano (xhigh)

Claude 4.5 Sonnet (Reasoning) vs MiniMax-M2.1

Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) vs GPT-6 Astra (high)

Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) vs GPT-6 Astra (xhigh)

Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) vs Claude Opus 5 (Adaptive Reasoning, High Effort)

Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) vs GPT-6 Astra (low)

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) vs Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)

Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) vs Claude Opus 5 (Adaptive Reasoning, Max Effort)

Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) vs Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)

Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) vs Muse Spark 1.3 (max)

Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) vs GPT-6 Astra (xhigh)

Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) vs Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)

Claude Opus 4.5 (Non-reasoning) vs Gemini 3.5 Flash (minimal)

Claude Opus 4.5 (Non-reasoning) vs Kimi K2.6 (Non-reasoning)

Claude Opus 4.5 (Reasoning) vs Claude Sonnet 5 (Non-reasoning, High Effort)

Claude Opus 4.5 (Reasoning) vs MiniMax-M3

Claude Opus 4.6 (Adaptive Reasoning, Max Effort) vs Claude Sonnet 5 (Adaptive Reasoning, High Effort)

Claude Opus 4.6 (Adaptive Reasoning, Max Effort) vs Kimi K2.6

Claude Opus 4.6 (Non-reasoning, High Effort) vs Kimi K2.7 Code

Claude Opus 4.6 (Non-reasoning, High Effort) vs MiMo-V2.5-Pro

Claude Opus 4.7 (Adaptive Reasoning, Max Effort) vs Gemini 3.8 Flash (high)

Claude Opus 4.7 (Adaptive Reasoning, Max Effort) vs Qwen3.8 Max

Claude Opus 4.7 (Non-reasoning, High Effort) vs DeepSeek V4 Pro (Reasoning, Max Effort)

Claude Opus 4.7 (Non-reasoning, High Effort) vs GPT-5.5 (low)

Claude Opus 5 (Adaptive Reasoning, High Effort) vs Muse Spark 1.3 (max)

Claude Opus 5 (Adaptive Reasoning, Low Effort) vs Gemini 3.7 Flash (medium)

Claude Opus 5 (Adaptive Reasoning, Low Effort) vs Muse Spark 1.2 (xhigh)

Claude Opus 5 (Adaptive Reasoning, Max Effort) vs GPT-6 Astra (high)

Claude Opus 5 (Adaptive Reasoning, Max Effort) vs GPT-6 Astra (medium)

Claude Opus 5 (Adaptive Reasoning, Max Effort) vs Muse Spark 1.3 (max)

Claude Opus 5 (Adaptive Reasoning, Medium Effort) vs GLM-5.3 (max)

Claude Opus 5 (Adaptive Reasoning, Medium Effort) vs Muse Spark 1.3 (xhigh)

Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) vs GPT-6 Astra (medium)

Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) vs GPT-5.5 (low)

Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) vs GPT-5.6 Terra (medium)

Claude Sonnet 4.6 (Non-reasoning, High Effort) vs Claude Sonnet 5 (Adaptive Reasoning, Low Effort)

Claude Sonnet 4.6 (Non-reasoning, High Effort) vs GPT-5.4 mini (xhigh)

Claude Sonnet 4.6 (Non-reasoning, Low Effort) vs GPT-5.5 (Non-reasoning)

Claude Sonnet 4.6 (Non-reasoning, Low Effort) vs Nemotron 3 Ultra 550B A55B (Reasoning)

Claude Sonnet 5 (Adaptive Reasoning, High Effort) vs GPT-5.6 Luna (high)

Claude Sonnet 5 (Adaptive Reasoning, Low Effort) vs GPT-5.1 (high)

Claude Sonnet 5 (Adaptive Reasoning, Max Effort) vs GPT-5.5 (xhigh)

Claude Sonnet 5 (Adaptive Reasoning, Max Effort) vs GPT-5.6 Terra (xhigh)

Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) vs Claude Sonnet 5 (Non-reasoning, High Effort)

Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) vs Qwen3.6 Max Preview

Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) vs GPT-5.6 Luna (xhigh)

Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) vs GPT-5.6 Terra (high)

Command A vs Llama 3.1 Nemotron Instruct 70B

Command A vs Mistral Small 3.2

Command A+ vs Gemma 4 31B (Non-reasoning)

Command A+ vs Qwen3.5 9B (Reasoning)

DeepSeek R1 Distill Llama 70B vs Qwen3 VL 30B A3B Instruct

DeepSeek R1 Distill Llama 70B vs Qwen3 VL 8B (Reasoning)

DeepSeek V4.1 Flash (Reasoning, Max Effort) vs Gemini 3.7 Flash (high)

DeepSeek V4.1 Flash (Reasoning, Max Effort) vs GPT-5.6 Sol (medium)

DeepSeek V4 Flash 0731 (Reasoning, Max Effort) vs Gemini 3.6 Flash (high)

DeepSeek V4 Flash 0731 (Reasoning, Max Effort) vs Kimi K3 (low)

DeepSeek V4 Flash Vision (Reasoning, Max Effort) vs GPT-5.6 Luna (xhigh)

DeepSeek V4 Flash Vision (Reasoning, Max Effort) vs Grok 4.6 (low)

DeepSeek V4 Pro 0813 (Reasoning, Max Effort) vs Gemini 3.7 Flash (low)

DeepSeek V4 Pro (Non-reasoning) vs GPT-5 (low)

DeepSeek V4 Pro (Non-reasoning) vs GPT-5 mini (medium)

DeepSeek V4 Pro (Reasoning, High Effort) vs Gemini 3.1 Pro Preview

DeepSeek V4 Pro (Reasoning, High Effort) vs Qwen3.7 Max

DeepSeek V4 Pro (Reasoning, Max Effort) vs Kimi K2.6

Devstral 2 vs Gemma 4 12B (Non-reasoning)

Devstral 2 vs Qwen3 235B A22B (Reasoning)

Devstral Small 2 vs GPT-4o (Nov '24)

Devstral Small 2 vs LFM2.5-2.6B

Gemini 2.5 Flash-Lite (Non-reasoning) vs Mistral Small 3

Gemini 2.5 Flash-Lite (Non-reasoning) vs Nova Lite

Gemini 2.5 Flash-Lite (Reasoning) vs GLM-4.6V (Non-reasoning)

Gemini 2.5 Flash-Lite (Reasoning) vs Nova 2.0 Lite (Non-reasoning)

Gemini 2.5 Flash (Non-reasoning) vs Mistral Medium 3.1

Gemini 2.5 Flash (Non-reasoning) vs Qwen3 VL 235B A22B Instruct

Gemini 2.5 Flash (Reasoning) vs Gemma 4 26B A4B (Non-reasoning)

Gemini 2.5 Flash (Reasoning) vs Qwen3.5 4B (Reasoning)

Gemini 2.5 Pro vs o4-mini (high)

Gemini 2.5 Pro vs Step 3.5 Flash

Gemini 3.1 Flash-Lite vs Qwen3.5 122B A10B (Reasoning)

Gemini 3.1 Flash-Lite vs Qwen3 Max

Gemini 3.1 Pro Preview vs GPT-5.2 (xhigh)

Gemini 3.5 Flash (high) vs Gemini 3.5 Flash (medium)

Gemini 3.5 Flash (high) vs GPT-5.3 Codex (xhigh)

Gemini 3.5 Flash-Lite vs GLM-5.2 (Non-reasoning)

Gemini 3.5 Flash-Lite vs MiniMax-M2.5

Gemini 3.5 Flash (medium) vs GPT-5.6 Sol (low)

Gemini 3.5 Flash (minimal) vs GLM-5.1 (Non-reasoning)

Gemini 3.6 Flash (high) vs GPT-5.5 (medium)

Gemini 3.7 Flash (high) vs Grok 4.5 (high)

Gemini 3.7 Flash (low) vs GPT-5.5 (high)

Gemini 3.7 Flash (medium) vs GPT-5.6 Sol (medium)

Gemini 3.8 Flash (high) vs GLM-5.3-Flash

Gemini 3 Flash Preview (Non-reasoning) vs Muse Glimmer (high)

Gemini 3 Flash Preview (Non-reasoning) vs Qwen3.5 122B A10B (Non-reasoning)

Gemini 3 Flash Preview (Reasoning) vs Inkling Small

Gemini 3 Flash Preview (Reasoning) vs Kimi K2.7 Code

Gemma 4 12B (Non-reasoning) vs Llama 4 Maverick

Gemma 4 12B (Reasoning) vs Grok 4.20 0309 v2 (Non-reasoning)

Gemma 4 12B (Reasoning) vs Nova 2.0 Pro Preview (medium)

Gemma 4 26B A4B (Non-reasoning) vs Qwen3.5 9B (Non-reasoning)

Gemma 4 31B (Non-reasoning) vs Nova 2.0 Pro Preview (medium)

Gemma 4 31B (Reasoning) vs Ling-3.0-flash-VL

Gemma 4 31B (Reasoning) vs Qwen3 Max

Gemma 4 E4B (Non-reasoning) vs Hermes 4 - Llama-3.1 405B (Reasoning)

Gemma 4 E4B (Non-reasoning) vs Qwen3 30B A3B 2507 Instruct

Gemma 4 E4B (Reasoning) vs Nova 2.0 Lite (Non-reasoning)

Gemma 4 E4B (Reasoning) vs NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)

GLM-4.5-Air vs GPT-5.4 mini (Non-Reasoning)

GLM-4.5-Air vs Qwen3 Next 80B A3B (Reasoning)

GLM-4.5V (Non-reasoning) vs GPT-4o mini

GLM-4.5V (Non-reasoning) vs NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)

GLM-4.5V (Reasoning) vs Llama 3.3 Instruct 70B

GLM-4.5V (Reasoning) vs Qwen3 30B A3B (Reasoning)

GLM-4.6 (Non-reasoning) vs GLM-4.7-Flash (Reasoning)

GLM-4.6 (Non-reasoning) vs Mistral Medium 3.5

GLM-4.6 (Reasoning) vs MiMo-V2.5-Pro (Non-reasoning)

GLM-4.6 (Reasoning) vs MiniMax-M2

GLM-4.6V (Non-reasoning) vs GPT-4o (Nov '24)

GLM-4.6V (Reasoning) vs GPT-5 (minimal)

GLM-4.6V (Reasoning) vs Qwen3 Next 80B A3B (Reasoning)

GLM-4.7-Flash (Non-reasoning) vs gpt-oss-120b (low)

GLM-4.7-Flash (Non-reasoning) vs Qwen3.5 4B (Non-reasoning)

GLM-4.7-Flash (Reasoning) vs Qwen3.5 35B A3B (Non-reasoning)

GLM-4.7 (Non-reasoning) vs GPT-5 mini (high)

GLM-4.7 (Reasoning) vs GPT-5.6 Terra (Non-reasoning)

GLM-4.7 (Reasoning) vs Kimi K2 Thinking

GLM-5.1 (Non-reasoning) vs Grok 4.3 (low)

GLM-5.1 (Reasoning) vs MiMo-V2.5-Pro

GLM-5.1 (Reasoning) vs Qwen3.8 27B (low)

GLM-5.2 (max) vs GPT-5.4 (xhigh)

GLM-5.2 (max) vs GPT-5.5 (xhigh)

GLM-5.2 (Non-reasoning) vs Qwen3.8 27B (Non-reasoning)

GLM-5.3-Flash vs GPT-5.6 Sol (high)

GLM-5.3-Flash vs Muse Spark 1.3 (max)

GLM-5.3-Flash vs Qwen3.8-Flash-Next

GLM-5.3 (max) vs Grok 4.6 (high)

GLM-5 (Non-reasoning) vs GPT-5.6 Luna (low)

GLM-5 (Non-reasoning) vs Qwen3.6 27B (Reasoning)

GLM-5 (Reasoning) vs GPT-5.6 Terra (low)

GLM-5 (Reasoning) vs Solar Pro 4

GPT-4.1 mini vs gpt-oss-120b (low)

GPT-4.1 mini vs Qwen3 Coder Next

GPT-4.1 nano vs Ling-flash-2.0

GPT-4.1 nano vs Solar Pro 3

GPT-4.1 vs Kimi K2

GPT-4.1 vs Nova 2.0 Pro Preview (low)

GPT-4 Turbo vs GPT-5 nano (minimal)

GPT-4 Turbo vs Mistral Small 3.2

GPT-4o (Aug '24) vs Llama 3.3 Instruct 70B

GPT-4o (Aug '24) vs Qwen3 Omni 30B A3B (Reasoning)

GPT-4o (May '24) vs Mistral Small 3.1

GPT-4o (May '24) vs Qwen3 VL 8B Instruct

GPT-4o mini vs Mistral Small 3

GPT-5.1 (high) vs Ling-3.0-flash-VL

GPT-5.1 (Non-reasoning) vs Qwen3.5 9B (Non-reasoning)

GPT-5.1 (Non-reasoning) vs Qwen3 VL 235B A22B (Reasoning)

GPT-5.2 (Non-reasoning) vs GPT-5.6 Luna (Non-reasoning)

GPT-5.2 (Non-reasoning) vs Step 3.5 Flash 2603

GPT-5.2 (xhigh) vs GPT-5.6 Terra (medium)

GPT-5.3 Codex (xhigh) vs GPT-5.6 Luna (high)

GPT-5.4 (low) vs Grok Build 0.1 0616

GPT-5.4 (low) vs Qwen3.8 27B (medium)

GPT-5.4 mini (medium) vs Qwen3.6 27B (Non-reasoning)

GPT-5.4 mini (medium) vs Step 3.7 Flash

GPT-5.4 mini (Non-Reasoning) vs o3-mini (high)

GPT-5.4 mini (xhigh) vs Grok 4.3 (low)

GPT-5.4 nano (medium) vs o3

GPT-5.4 nano (medium) vs Qwen3.6 27B (Non-reasoning)

GPT-5.4 nano (Non-Reasoning) vs HyperNova 60B 2605 (high, based on gpt-oss-120b)

GPT-5.4 nano (Non-Reasoning) vs Nova 2.0 Lite (low)

GPT-5.4 nano (xhigh) vs Qwen3.5 397B A17B (Non-reasoning)

GPT-5.4 (Non-reasoning) vs MiMo-V2.5-Pro (Non-reasoning)

GPT-5.4 (Non-reasoning) vs Muse Glimmer (high)

GPT-5.4 (xhigh) vs Grok 4.5 (high)

GPT-5.5 (high) vs GPT-5.6 Terra (xhigh)

GPT-5.5 Instant (June 2026) vs Qwen3.6 Plus

GPT-5.5 Instant (June 2026) vs Qwen3.8 27B (low)

GPT-5.5 (medium) vs Qwen3.8 27B (xhigh)

GPT-5.5 (Non-reasoning) vs MiniMax-M2.7

GPT-5.6 Luna (low) vs Qwen3.5 397B A17B (Non-reasoning)

GPT-5.6 Luna (medium) vs Grok 4.3 (high)

GPT-5.6 Luna (medium) vs Inkling (xhigh)

GPT-5.6 Luna (Non-reasoning) vs o4-mini (high)

GPT-5.6 Sol (high) vs Grok 4.6 (medium)

GPT-5.6 Sol (low) vs Qwen3.8 27B (xhigh)

GPT-5.6 Sol (Non-reasoning) vs Qwen3.6 Max Preview

GPT-5.6 Sol (Non-reasoning) vs Solar Pro 4

GPT-5.6 Sol (xhigh) vs Grok 4.6 (xhigh)

GPT-5.6 Sol (xhigh) vs Kimi K3 (max)

GPT-5.6 Terra (high) vs Kimi K3 (low)

GPT-5.6 Terra (Non-reasoning) vs MiMo-V2.5

GPT-5 (high) vs GPT-5 (medium)

GPT-5 (high) vs MiniMax-M2.7

GPT-5 (low) vs MiniMax-M2.1

GPT-5 (medium) vs Qwen3.5 27B (Reasoning)

GPT-5 mini (high) vs Ring-2.6-1T

GPT-5 mini (medium) vs Qwen3.5 Omni Plus

GPT-5 mini (minimal) vs Mistral Medium 3.1

GPT-5 mini (minimal) vs Nova 2.0 Pro Preview (Non-reasoning)

GPT-5 (minimal) vs Mercury 2

GPT-5 nano (high) vs North Mini Code

GPT-5 nano (high) vs Qwen3.5 4B (Reasoning)

GPT-5 nano (medium) vs Nova 2.0 Lite (medium)

GPT-5 nano (medium) vs o3-mini

GPT-5 nano (minimal) vs Qwen3 32B (Reasoning)

GPT-6 Astra (low) vs Muse Spark 1.3 (xhigh)

gpt-oss-120b (high) vs Qwen3.5 Omni Flash

gpt-oss-120b (high) vs Seed-OSS-36B-Instruct

gpt-oss-20b (high) vs Granite 4.2 3B

gpt-oss-20b (high) vs Llama Nemotron Super 49B v1.5 (Reasoning)

gpt-oss-20b (low) vs Nova 2.0 Pro Preview (Non-reasoning)

gpt-oss-20b (low) vs Qwen3 Coder Next

Granite 3.3 8B (Non-reasoning) vs Ministral 3 3B

Granite 3.3 8B (Non-reasoning) vs Mistral 7B Instruct

Granite 4.0 H Small vs Ministral 3 14B

Granite 4.0 H Small vs Qwen3 Omni 30B A3B Instruct

Granite 4.1 8B vs Llama 3.1 Instruct 70B

Granite 4.1 8B vs Qwen3 30B A3B (Non-reasoning)

Granite 4.2 30B vs Grok 3 mini Reasoning (high)

Granite 4.2 30B vs Mistral Medium 3.5

Granite 4.2 3B vs Nova Premier

Granite 4.2 8B vs Nova 2.0 Lite (low)

Granite 4.2 8B vs Qwen3 Coder 480B A35B Instruct

Grok 3 mini Reasoning (high) vs Grok 4.3 (Non-reasoning)

Grok 4.20 0309 v2 (Non-reasoning) vs Grok 4.3 (Non-reasoning)

Grok 4.20 0309 v2 (Reasoning) vs Inkling (xhigh)

Grok 4.20 0309 v2 (Reasoning) vs Qwen3.7 Plus

Grok 4.3 (high) vs Ling 3.0 Flash

Grok 4.3 (medium) vs Ling-3.0-flash-VL

Grok 4.3 (medium) vs Ling 3.0 Flash

Grok 4.6 (high) vs Grok 4.6 (xhigh)

Grok 4.6 (medium) vs Kimi K3 (max)

Grok Build 0.1 0616 vs Quasar 438B (max, based on GLM-5.2)

Hermes 3 - Llama-3.1 70B vs Ministral 3 14B

Hermes 4 - Llama-3.1 405B (Non-reasoning) vs Llama Nemotron Super 49B v1.5 (Non-reasoning)

Every model card links its own comparisons; the 3D observatory is at /. Generated page — do not hand-edit.

Model names are trademarks of their respective owners. Not affiliated with, endorsed by, or sponsored by any provider or measurement service. Sources, attribution & corrections.