Leaderboards
Benchmarks
Every score carries its origin — leaderboard is independent,vendor is self-reported. History is kept, never overwritten.
SWE-bench Verified
% of real GitHub issues resolved end-to-endhigher is betterProvenanceindependent leaderboard39 modelsscores Apr 2, 2024 – Feb 19, 2026
1Claude Opus 4.5Anthropic79.2via live-SWE-agent3—Dec 15, 2025leaderboard2MiniMax M2.5MiniMax229B75.8via mini-SWE-agent84~0.53Feb 17, 2026leaderboard3Claude Opus 4.6Anthropic75.6via mini-SWE-agent3—Feb 17, 2026leaderboard4Claude Sonnet 4.5Anthropic74.8via Sonar Foundation Agent5—Nov 3, 2025leaderboard5GPT-5.5OpenAI74.4via Prometheus-v1.2.17—Oct 15, 2025leaderboard6Claude Opus 4Anthropic73.2via Tools1—May 22, 2025leaderboard7GLM 5Z.AI754B72.8via mini-SWE-agent38~0.15Feb 17, 2026leaderboard8GPT-5.2 ChatOpenAI72.8via mini-SWE-agent10—Feb 17, 2026leaderboard9GPT-5.2-CodexOpenAI72.8via mini-SWE-agent5—Feb 19, 2026leaderboard10Kimi K2.5Moonshot AI1.1T70.8via mini-SWE-agent35~0.11Feb 17, 2026leaderboard11DeepSeek V3.2DeepSeek685B70via mini-SWE-agent225~0.16Feb 17, 2026leaderboard12Qwen3 Coder 480B A35BQwen480B69.6via OpenHands70~0.23Aug 5, 2025leaderboard13GLM 4.6Z.AI357B68.239~0.3Sep 30, 2025leaderboard14Claude Haiku 4.5Anthropic66.6via mini-SWE-agent13—Feb 17, 2026leaderboard15GPT-5.1-CodexOpenAI66via mini-SWE-agent7—Nov 24, 2025leaderboard16GPT-5.1OpenAI66via mini-SWE-agent13—Nov 20, 2025leaderboard17Kimi K2 0711Moonshot AI1T65.4via OpenHands28~0.1Jul 16, 2025leaderboard18GLM 4.5Z.AI358B64.229~0.28Jul 28, 2025leaderboard19Kimi K2 ThinkingMoonshot AI1.1T63.4via mini-SWE-agent25~0.095Dec 10, 2025leaderboard20MiniMax M2MiniMax229B61via mini-SWE-agent60~0.42Nov 24, 2025leaderboard21Qwen3 Coder 30B A3B InstructQwen30.5B60.4via EntroPO224~3.1Sep 1, 2025leaderboard22o3OpenAI58.4via mini-SWE-agent7—Jul 26, 2025leaderboard23GPT-5 MiniOpenAI56.2via mini-SWE-agent56—Feb 17, 2026leaderboard24Gemini 2.5 ProGoogle53.6via mini-SWE-agent11—Jul 26, 2025leaderboard25o4 MiniOpenAI45via mini-SWE-agent10—Jul 26, 2025leaderboard26Nova Premier 1.0Amazon42.43—May 27, 2025leaderboard27o3 MiniOpenAI42.4via Agentless Lite10—Feb 14, 2025leaderboard28GPT-4.1OpenAI39.6via mini-SWE-agent5—Jul 26, 2025leaderboard29GPT-4o (2024-05-13)OpenAI38.8via Agentless-1.53—Oct 28, 2024leaderboard30GPT-5 NanoOpenAI34.8via mini-SWE-agent174—Aug 7, 2025leaderboard31GPT-4oOpenAI32.6via MASAI3—Jun 12, 2024leaderboard32Gemini 2.5 FlashGoogle28.7via mini-SWE-agent23—Jul 26, 2025leaderboard33gpt-oss-120bOpenAI120B26via mini-SWE-agent153~0.34Aug 7, 2025leaderboard34GPT-4.1 MiniOpenAI23.9via mini-SWE-agent15—Jul 20, 2025leaderboard35GPT-4OpenAI22.4via SWE-agent0—Apr 2, 2024leaderboard36GPT-4o (2024-11-20)OpenAI21.6via mini-SWE-agent2—Jul 20, 2025leaderboard37Llama 4 MaverickMeta402B21via mini-SWE-agent26~0.083Jul 20, 2025leaderboard38Llama 4 ScoutMeta109B9.1via mini-SWE-agent30~0.13Jul 20, 2025leaderboard39Qwen2.5 Coder 32B InstructQwen32.8B9via mini-SWE-agent9~0.44Aug 3, 2025leaderboard
A tilde in Score / GB VRAM means the memory figure behind it is calculated from the parameter count rather than read from a published file. Those ratios are shown to two significant figures, and rows within a few percent of each other are not distinguishable.