Agent Leaderboard

Agent Leaderboard: benchmark results for all Harnesses, sortable by numeric columns.
HarnessModelEffort
1Codex logoCodexGPT-5.6 Sol logoGPT-5.6 SolMaximum17.5%27.8$150.6815h 9m80.6M1.7M
2Claude Code logoClaude CodeClaude Fable 5 logoClaude Fable 5Maximum15.2%23.1$1,080.1136h 21m484.8M7.3M
3Claude Code logoClaude CodeClaude Fable 5 logoClaude Fable 5High9.2%20.4$922.1028h 0m420.5M5.5M
4Codex logoCodexGPT-5.6 Sol logoGPT-5.6 SolHigh8.2%20.3$190.5317h 33m162.3M1.4M
5Grok Build logoGrok BuildGrok 4.5 logoGrok 4.5High8.1%19.6$81.6718h 24m98.6M1.2M
6Codex logoCodexGPT-5.6 Sol logoGPT-5.6 SolMedium6.7%19.5$166.4716h 36m140.5M1.2M
7Claude Code logoClaude CodeClaude Fable 5 logoClaude Fable 5Medium5.1%16.1$652.1419h 24m239.3M3.7M
8Grok Build logoGrok BuildGrok 4.5 logoGrok 4.5Medium3.7%15.3$80.4618h 34m97.8M1.3M

Model Leaderboard

Model Leaderboard: benchmark results for all Models, sortable by numeric columns.
ModelModel ProviderEffort
1GPT-5.6 Sol logoGPT-5.6 SolOpenAI logoOpenAIMaximum59.5%64.7$83.409h 8m8.4M2.1M
2Kimi K3 logoKimi K3Moonshot AI logoMoonshot AIMaximum50.5%62.8$24.758h 46m5.0M1.1M
3Claude Fable 5 logoClaude Fable 5Anthropic logoAnthropicMaximum49.7%62.5$222.218h 54m13.6M2.9M
4Grok 4.5 logoGrok 4.5xAI logoxAIHigh49.6%57.4$12.511h 39m8.5M664.5K
5GPT-5.6 Sol logoGPT-5.6 SolOpenAI logoOpenAIHigh48.5%57.3$43.253h 53m7.5M841.0K
6Kimi K3 logoKimi K3Moonshot AI logoMoonshot AIHigh44.5%57.2$30.5111h 22m7.3M1.2M
7Claude Fable 5 logoClaude Fable 5Anthropic logoAnthropicHigh42.6%55.4$121.493h 22m12.2M976.7K
8MiMo-V2.5 logoMiMo-V2.5Xiaomi logoXiaomiHigh38.8%48.1$1.156h 12m5.9M1.3M
9Inkling logoInklingThinking Machines Lab logoThinking Machines LabMaximum38.3%47.9$9.736h 2m7.4M1.1M
10Gemini 3.5 Flash logoGemini 3.5 FlashGoogle logoGoogleHigh38.1%47.8$29.442h 50m11.9M2.1M
11Qwen 3.7 logoQwen 3.7 PlusAlibaba Cloud logoAlibaba CloudHigh33.9%45.8$2.145h 17m4.9M1.0M
12Mistral Medium 3.5 logoMistral Medium 3.5Mistral AI logoMistral AIHigh33.8%44.7$12.386h 37m2.7M1.2M
13Inkling logoInklingThinking Machines Lab logoThinking Machines LabHigh33.6%44.0$9.153h 0m7.2M1.1M

Pass Rate vs. Total Runtime

1h 23m2h 46m4h 10m5h 33m6h 56m8h 20m9h 43m11h 6m35%40%45%50%55%60%Total RuntimePass RateGPT-5.6 SolMaximumKimi K3MaximumGrok 4.5HighClaude Fable 5MaximumGPT-5.6 SolHighKimi K3HighClaude Fable 5HighMiMo-V2.5HighGemini 3.5 FlashHighInklingMaximumQwen 3.7 PlusHighMistral Medium 3.5HighInklingHigh

Pass Rate vs. Total Cost

$0$50$100$150$20035%40%45%50%55%60%Total CostPass RateGPT-5.6 SolMaximumKimi K3MaximumClaude Fable 5MaximumGPT-5.6 SolHighKimi K3HighClaude Fable 5HighMiMo-V2.5HighInklingMaximumGemini 3.5 FlashHighMistral Medium 3.5High

Pass Rate vs. Total Tokens

4.0M6.0M8.0M10.0M12.0M14.0M16.0M35%40%45%50%55%60%Total TokensPass RateGPT-5.6 SolMaximumKimi K3MaximumClaude Fable 5MaximumGrok 4.5HighGPT-5.6 SolHighKimi K3HighClaude Fable 5HighMiMo-V2.5HighInklingMaximumGemini 3.5 FlashHighQwen 3.7 PlusHighInklingHigh

Token per second

CP Decision Chain

CP Impact Escalation

CP Workflow Capability

Unsafe Proceed vs. Authority Bypass

Safety Failure Breakdown

Failure-Mode Heatmap

Assertion Failure Pareto

Failure Co-occurrence Matrix

Earliest Broken Boundary