250 staged pairs · catalog 2026-09-14 · verdicts gated on price×intelligence dominance
Agnes 2.5 Pro Alpha vs GPT-5.6 Terra (low)
Agnes 2.5 Pro Alpha vs Qwen3.8 27B (medium)
Agnes 3.0 Flash vs DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
Agnes 3.0 Flash vs Grok 4.6 (low)
Agnes 3.0 Flash vs Ling-3.0-flash-VL
Agnes 3.0 Flash vs Qwen3.8-Flash-Next
Celeris-1 vs Hermes 3 - Llama-3.1 70B
Celeris-1 vs Phi-4 Mini Instruct
Claude 4.5 Haiku (Non-reasoning) vs Gemma 4 31B (Reasoning)
Claude 4.5 Haiku (Non-reasoning) vs Kimi K2 0905
Claude 4.5 Haiku (Reasoning) vs GLM-4.7 (Non-reasoning)
Claude 4.5 Haiku (Reasoning) vs Qwen3.5 122B A10B (Non-reasoning)
Claude 4.5 Sonnet (Non-reasoning) vs Qwen3.5 27B (Non-reasoning)
Claude 4.5 Sonnet (Non-reasoning) vs Qwen3.5 35B A3B (Reasoning)
Claude 4.5 Sonnet (Reasoning) vs GPT-5.4 nano (xhigh)
Claude 4.5 Sonnet (Reasoning) vs MiniMax-M2.1
Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) vs GPT-6 Astra (high)
Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) vs GPT-6 Astra (xhigh)
Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) vs Claude Opus 5 (Adaptive Reasoning, High Effort)
Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) vs GPT-6 Astra (low)
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) vs Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) vs Claude Opus 5 (Adaptive Reasoning, Max Effort)
Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) vs Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) vs Muse Spark 1.3 (max)
Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) vs GPT-6 Astra (xhigh)
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) vs Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
Claude Opus 4.5 (Non-reasoning) vs Gemini 3.5 Flash (minimal)
Claude Opus 4.5 (Non-reasoning) vs Kimi K2.6 (Non-reasoning)
Claude Opus 4.5 (Reasoning) vs Claude Sonnet 5 (Non-reasoning, High Effort)
Claude Opus 4.5 (Reasoning) vs MiniMax-M3
Claude Opus 4.6 (Adaptive Reasoning, Max Effort) vs Claude Sonnet 5 (Adaptive Reasoning, High Effort)
Claude Opus 4.6 (Adaptive Reasoning, Max Effort) vs Kimi K2.6
Claude Opus 4.6 (Non-reasoning, High Effort) vs Kimi K2.7 Code
Claude Opus 4.6 (Non-reasoning, High Effort) vs MiMo-V2.5-Pro
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) vs Gemini 3.8 Flash (high)
Claude Opus 4.7 (Adaptive Reasoning, Max Effort) vs Qwen3.8 Max
Claude Opus 4.7 (Non-reasoning, High Effort) vs DeepSeek V4 Pro (Reasoning, Max Effort)
Claude Opus 4.7 (Non-reasoning, High Effort) vs GPT-5.5 (low)
Claude Opus 5 (Adaptive Reasoning, High Effort) vs Muse Spark 1.3 (max)
Claude Opus 5 (Adaptive Reasoning, Low Effort) vs Gemini 3.7 Flash (medium)
Claude Opus 5 (Adaptive Reasoning, Low Effort) vs Muse Spark 1.2 (xhigh)
Claude Opus 5 (Adaptive Reasoning, Max Effort) vs GPT-6 Astra (high)
Claude Opus 5 (Adaptive Reasoning, Max Effort) vs GPT-6 Astra (medium)
Claude Opus 5 (Adaptive Reasoning, Max Effort) vs Muse Spark 1.3 (max)
Claude Opus 5 (Adaptive Reasoning, Medium Effort) vs GLM-5.3 (max)
Claude Opus 5 (Adaptive Reasoning, Medium Effort) vs Muse Spark 1.3 (xhigh)
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) vs GPT-6 Astra (medium)
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) vs GPT-5.5 (low)
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) vs GPT-5.6 Terra (medium)
Claude Sonnet 4.6 (Non-reasoning, High Effort) vs Claude Sonnet 5 (Adaptive Reasoning, Low Effort)
Claude Sonnet 4.6 (Non-reasoning, High Effort) vs GPT-5.4 mini (xhigh)
Claude Sonnet 4.6 (Non-reasoning, Low Effort) vs GPT-5.5 (Non-reasoning)
Claude Sonnet 4.6 (Non-reasoning, Low Effort) vs Nemotron 3 Ultra 550B A55B (Reasoning)
Claude Sonnet 5 (Adaptive Reasoning, High Effort) vs GPT-5.6 Luna (high)
Claude Sonnet 5 (Adaptive Reasoning, Low Effort) vs GPT-5.1 (high)
Claude Sonnet 5 (Adaptive Reasoning, Max Effort) vs GPT-5.5 (xhigh)
Claude Sonnet 5 (Adaptive Reasoning, Max Effort) vs GPT-5.6 Terra (xhigh)
Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) vs Claude Sonnet 5 (Non-reasoning, High Effort)
Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) vs Qwen3.6 Max Preview
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) vs GPT-5.6 Luna (xhigh)
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) vs GPT-5.6 Terra (high)
Command A vs Llama 3.1 Nemotron Instruct 70B
Command A vs Mistral Small 3.2
Command A+ vs Gemma 4 31B (Non-reasoning)
Command A+ vs Qwen3.5 9B (Reasoning)
DeepSeek R1 Distill Llama 70B vs Qwen3 VL 30B A3B Instruct
DeepSeek R1 Distill Llama 70B vs Qwen3 VL 8B (Reasoning)
DeepSeek V4.1 Flash (Reasoning, Max Effort) vs Gemini 3.7 Flash (high)
DeepSeek V4.1 Flash (Reasoning, Max Effort) vs GPT-5.6 Sol (medium)
DeepSeek V4 Flash 0731 (Reasoning, Max Effort) vs Gemini 3.6 Flash (high)
DeepSeek V4 Flash 0731 (Reasoning, Max Effort) vs Kimi K3 (low)
DeepSeek V4 Flash Vision (Reasoning, Max Effort) vs GPT-5.6 Luna (xhigh)
DeepSeek V4 Flash Vision (Reasoning, Max Effort) vs Grok 4.6 (low)
DeepSeek V4 Pro 0813 (Reasoning, Max Effort) vs Gemini 3.7 Flash (low)
DeepSeek V4 Pro (Non-reasoning) vs GPT-5 (low)
DeepSeek V4 Pro (Non-reasoning) vs GPT-5 mini (medium)
DeepSeek V4 Pro (Reasoning, High Effort) vs Gemini 3.1 Pro Preview
DeepSeek V4 Pro (Reasoning, High Effort) vs Qwen3.7 Max
DeepSeek V4 Pro (Reasoning, Max Effort) vs Kimi K2.6
Devstral 2 vs Gemma 4 12B (Non-reasoning)
Devstral 2 vs Qwen3 235B A22B (Reasoning)
Devstral Small 2 vs GPT-4o (Nov '24)
Devstral Small 2 vs LFM2.5-2.6B
Gemini 2.5 Flash-Lite (Non-reasoning) vs Mistral Small 3
Gemini 2.5 Flash-Lite (Non-reasoning) vs Nova Lite
Gemini 2.5 Flash-Lite (Reasoning) vs GLM-4.6V (Non-reasoning)
Gemini 2.5 Flash-Lite (Reasoning) vs Nova 2.0 Lite (Non-reasoning)
Gemini 2.5 Flash (Non-reasoning) vs Mistral Medium 3.1
Gemini 2.5 Flash (Non-reasoning) vs Qwen3 VL 235B A22B Instruct
Gemini 2.5 Flash (Reasoning) vs Gemma 4 26B A4B (Non-reasoning)
Gemini 2.5 Flash (Reasoning) vs Qwen3.5 4B (Reasoning)
Gemini 2.5 Pro vs o4-mini (high)
Gemini 2.5 Pro vs Step 3.5 Flash
Gemini 3.1 Flash-Lite vs Qwen3.5 122B A10B (Reasoning)
Gemini 3.1 Flash-Lite vs Qwen3 Max
Gemini 3.1 Pro Preview vs GPT-5.2 (xhigh)
Gemini 3.5 Flash (high) vs Gemini 3.5 Flash (medium)
Gemini 3.5 Flash (high) vs GPT-5.3 Codex (xhigh)
Gemini 3.5 Flash-Lite vs GLM-5.2 (Non-reasoning)
Gemini 3.5 Flash-Lite vs MiniMax-M2.5
Gemini 3.5 Flash (medium) vs GPT-5.6 Sol (low)
Gemini 3.5 Flash (minimal) vs GLM-5.1 (Non-reasoning)
Gemini 3.6 Flash (high) vs GPT-5.5 (medium)
Gemini 3.7 Flash (high) vs Grok 4.5 (high)
Gemini 3.7 Flash (low) vs GPT-5.5 (high)
Gemini 3.7 Flash (medium) vs GPT-5.6 Sol (medium)
Gemini 3.8 Flash (high) vs GLM-5.3-Flash
Gemini 3 Flash Preview (Non-reasoning) vs Muse Glimmer (high)
Gemini 3 Flash Preview (Non-reasoning) vs Qwen3.5 122B A10B (Non-reasoning)
Gemini 3 Flash Preview (Reasoning) vs Inkling Small
Gemini 3 Flash Preview (Reasoning) vs Kimi K2.7 Code
Gemma 4 12B (Non-reasoning) vs Llama 4 Maverick
Gemma 4 12B (Reasoning) vs Grok 4.20 0309 v2 (Non-reasoning)
Gemma 4 12B (Reasoning) vs Nova 2.0 Pro Preview (medium)
Gemma 4 26B A4B (Non-reasoning) vs Qwen3.5 9B (Non-reasoning)
Gemma 4 31B (Non-reasoning) vs Nova 2.0 Pro Preview (medium)
Gemma 4 31B (Reasoning) vs Ling-3.0-flash-VL
Gemma 4 31B (Reasoning) vs Qwen3 Max
Gemma 4 E4B (Non-reasoning) vs Hermes 4 - Llama-3.1 405B (Reasoning)
Gemma 4 E4B (Non-reasoning) vs Qwen3 30B A3B 2507 Instruct
Gemma 4 E4B (Reasoning) vs Nova 2.0 Lite (Non-reasoning)
Gemma 4 E4B (Reasoning) vs NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)
GLM-4.5-Air vs GPT-5.4 mini (Non-Reasoning)
GLM-4.5-Air vs Qwen3 Next 80B A3B (Reasoning)
GLM-4.5V (Non-reasoning) vs GPT-4o mini
GLM-4.5V (Non-reasoning) vs NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)
GLM-4.5V (Reasoning) vs Llama 3.3 Instruct 70B
GLM-4.5V (Reasoning) vs Qwen3 30B A3B (Reasoning)
GLM-4.6 (Non-reasoning) vs GLM-4.7-Flash (Reasoning)
GLM-4.6 (Non-reasoning) vs Mistral Medium 3.5
GLM-4.6 (Reasoning) vs MiMo-V2.5-Pro (Non-reasoning)
GLM-4.6 (Reasoning) vs MiniMax-M2
GLM-4.6V (Non-reasoning) vs GPT-4o (Nov '24)
GLM-4.6V (Reasoning) vs GPT-5 (minimal)
GLM-4.6V (Reasoning) vs Qwen3 Next 80B A3B (Reasoning)
GLM-4.7-Flash (Non-reasoning) vs gpt-oss-120b (low)
GLM-4.7-Flash (Non-reasoning) vs Qwen3.5 4B (Non-reasoning)
GLM-4.7-Flash (Reasoning) vs Qwen3.5 35B A3B (Non-reasoning)
GLM-4.7 (Non-reasoning) vs GPT-5 mini (high)
GLM-4.7 (Reasoning) vs GPT-5.6 Terra (Non-reasoning)
GLM-4.7 (Reasoning) vs Kimi K2 Thinking
GLM-5.1 (Non-reasoning) vs Grok 4.3 (low)
GLM-5.1 (Reasoning) vs MiMo-V2.5-Pro
GLM-5.1 (Reasoning) vs Qwen3.8 27B (low)
GLM-5.2 (max) vs GPT-5.4 (xhigh)
GLM-5.2 (max) vs GPT-5.5 (xhigh)
GLM-5.2 (Non-reasoning) vs Qwen3.8 27B (Non-reasoning)
GLM-5.3-Flash vs GPT-5.6 Sol (high)
GLM-5.3-Flash vs Muse Spark 1.3 (max)
GLM-5.3-Flash vs Qwen3.8-Flash-Next
GLM-5.3 (max) vs Grok 4.6 (high)
GLM-5 (Non-reasoning) vs GPT-5.6 Luna (low)
GLM-5 (Non-reasoning) vs Qwen3.6 27B (Reasoning)
GLM-5 (Reasoning) vs GPT-5.6 Terra (low)
GLM-5 (Reasoning) vs Solar Pro 4
GPT-4.1 mini vs gpt-oss-120b (low)
GPT-4.1 mini vs Qwen3 Coder Next
GPT-4.1 nano vs Ling-flash-2.0
GPT-4.1 nano vs Solar Pro 3
GPT-4.1 vs Kimi K2
GPT-4.1 vs Nova 2.0 Pro Preview (low)
GPT-4 Turbo vs GPT-5 nano (minimal)
GPT-4 Turbo vs Mistral Small 3.2
GPT-4o (Aug '24) vs Llama 3.3 Instruct 70B
GPT-4o (Aug '24) vs Qwen3 Omni 30B A3B (Reasoning)
GPT-4o (May '24) vs Mistral Small 3.1
GPT-4o (May '24) vs Qwen3 VL 8B Instruct
GPT-4o mini vs Mistral Small 3
GPT-5.1 (high) vs Ling-3.0-flash-VL
GPT-5.1 (Non-reasoning) vs Qwen3.5 9B (Non-reasoning)
GPT-5.1 (Non-reasoning) vs Qwen3 VL 235B A22B (Reasoning)
GPT-5.2 (Non-reasoning) vs GPT-5.6 Luna (Non-reasoning)
GPT-5.2 (Non-reasoning) vs Step 3.5 Flash 2603
GPT-5.2 (xhigh) vs GPT-5.6 Terra (medium)
GPT-5.3 Codex (xhigh) vs GPT-5.6 Luna (high)
GPT-5.4 (low) vs Grok Build 0.1 0616
GPT-5.4 (low) vs Qwen3.8 27B (medium)
GPT-5.4 mini (medium) vs Qwen3.6 27B (Non-reasoning)
GPT-5.4 mini (medium) vs Step 3.7 Flash
GPT-5.4 mini (Non-Reasoning) vs o3-mini (high)
GPT-5.4 mini (xhigh) vs Grok 4.3 (low)
GPT-5.4 nano (medium) vs o3
GPT-5.4 nano (medium) vs Qwen3.6 27B (Non-reasoning)
GPT-5.4 nano (Non-Reasoning) vs HyperNova 60B 2605 (high, based on gpt-oss-120b)
GPT-5.4 nano (Non-Reasoning) vs Nova 2.0 Lite (low)
GPT-5.4 nano (xhigh) vs Qwen3.5 397B A17B (Non-reasoning)
GPT-5.4 (Non-reasoning) vs MiMo-V2.5-Pro (Non-reasoning)
GPT-5.4 (Non-reasoning) vs Muse Glimmer (high)
GPT-5.4 (xhigh) vs Grok 4.5 (high)
GPT-5.5 (high) vs GPT-5.6 Terra (xhigh)
GPT-5.5 Instant (June 2026) vs Qwen3.6 Plus
GPT-5.5 Instant (June 2026) vs Qwen3.8 27B (low)
GPT-5.5 (medium) vs Qwen3.8 27B (xhigh)
GPT-5.5 (Non-reasoning) vs MiniMax-M2.7
GPT-5.6 Luna (low) vs Qwen3.5 397B A17B (Non-reasoning)
GPT-5.6 Luna (medium) vs Grok 4.3 (high)
GPT-5.6 Luna (medium) vs Inkling (xhigh)
GPT-5.6 Luna (Non-reasoning) vs o4-mini (high)
GPT-5.6 Sol (high) vs Grok 4.6 (medium)
GPT-5.6 Sol (low) vs Qwen3.8 27B (xhigh)
GPT-5.6 Sol (Non-reasoning) vs Qwen3.6 Max Preview
GPT-5.6 Sol (Non-reasoning) vs Solar Pro 4
GPT-5.6 Sol (xhigh) vs Grok 4.6 (xhigh)
GPT-5.6 Sol (xhigh) vs Kimi K3 (max)
GPT-5.6 Terra (high) vs Kimi K3 (low)
GPT-5.6 Terra (Non-reasoning) vs MiMo-V2.5
GPT-5 (high) vs GPT-5 (medium)
GPT-5 (high) vs MiniMax-M2.7
GPT-5 (low) vs MiniMax-M2.1
GPT-5 (medium) vs Qwen3.5 27B (Reasoning)
GPT-5 mini (high) vs Ring-2.6-1T
GPT-5 mini (medium) vs Qwen3.5 Omni Plus
GPT-5 mini (minimal) vs Mistral Medium 3.1
GPT-5 mini (minimal) vs Nova 2.0 Pro Preview (Non-reasoning)
GPT-5 (minimal) vs Mercury 2
GPT-5 nano (high) vs North Mini Code
GPT-5 nano (high) vs Qwen3.5 4B (Reasoning)
GPT-5 nano (medium) vs Nova 2.0 Lite (medium)
GPT-5 nano (medium) vs o3-mini
GPT-5 nano (minimal) vs Qwen3 32B (Reasoning)
GPT-6 Astra (low) vs Muse Spark 1.3 (xhigh)
gpt-oss-120b (high) vs Qwen3.5 Omni Flash
gpt-oss-120b (high) vs Seed-OSS-36B-Instruct
gpt-oss-20b (high) vs Granite 4.2 3B
gpt-oss-20b (high) vs Llama Nemotron Super 49B v1.5 (Reasoning)
gpt-oss-20b (low) vs Nova 2.0 Pro Preview (Non-reasoning)
gpt-oss-20b (low) vs Qwen3 Coder Next
Granite 3.3 8B (Non-reasoning) vs Ministral 3 3B
Granite 3.3 8B (Non-reasoning) vs Mistral 7B Instruct
Granite 4.0 H Small vs Ministral 3 14B
Granite 4.0 H Small vs Qwen3 Omni 30B A3B Instruct
Granite 4.1 8B vs Llama 3.1 Instruct 70B
Granite 4.1 8B vs Qwen3 30B A3B (Non-reasoning)
Granite 4.2 30B vs Grok 3 mini Reasoning (high)
Granite 4.2 30B vs Mistral Medium 3.5
Granite 4.2 3B vs Nova Premier
Granite 4.2 8B vs Nova 2.0 Lite (low)
Granite 4.2 8B vs Qwen3 Coder 480B A35B Instruct
Grok 3 mini Reasoning (high) vs Grok 4.3 (Non-reasoning)
Grok 4.20 0309 v2 (Non-reasoning) vs Grok 4.3 (Non-reasoning)
Grok 4.20 0309 v2 (Reasoning) vs Inkling (xhigh)
Grok 4.20 0309 v2 (Reasoning) vs Qwen3.7 Plus
Grok 4.3 (high) vs Ling 3.0 Flash
Grok 4.3 (medium) vs Ling-3.0-flash-VL
Grok 4.3 (medium) vs Ling 3.0 Flash
Grok 4.6 (high) vs Grok 4.6 (xhigh)
Grok 4.6 (medium) vs Kimi K3 (max)
Grok Build 0.1 0616 vs Quasar 438B (max, based on GLM-5.2)
Hermes 3 - Llama-3.1 70B vs Ministral 3 14B
Hermes 4 - Llama-3.1 405B (Non-reasoning) vs Llama Nemotron Super 49B v1.5 (Non-reasoning)
Every model card links its own comparisons; the 3D observatory is at /. Generated page — do not hand-edit.
Model names are trademarks of their respective owners. Not affiliated with, endorsed by, or sponsored by any provider or measurement service. Sources, attribution & corrections.