Senior SWE-Bench
Overview
Tasks
Agents
Contributors
Blog
Dataset on GitHub
Dataset on Harbor Hub
Archived leaderboards
/
Leaderboard July 29, 2026
Leaderboard July 29, 2026
Frozen snapshot of Senior SWE-Bench leaderboard from 2026-07-29 with default view settings. Numbers here never change.
#
Model
Effort
Tasteful Solve Rate
Basic Solve Rate
Steps
Output tokens
Output $
Total $
1
Claude Fable 5
max
29.1%
46.5%
159
290.2K
$14.51
$200.32
2
Claude Opus 5
xhigh
28.2%
51.8%
158
93.2K
$2.33
$119.32
3
Claude Opus 4.8
max
25.0%
39.8%
132
115.2K
$2.88
$67.32
4
GPT-5.6 Sol
xhigh
24.4%
54.7%
49
31.1K
$0.93
$29.03
5
Claude Sonnet 5
max
17.4%
39.5%
333
445.5K
$6.68
$194.20
6
Grok 4.5
high
17.2%
49.4%
80
22.9K
$0.14
$13.74
7
GPT-5.5
xhigh
15.9%
56.8%
88
35.9K
$1.08
$49.29
8
Claude Opus 4.7
max
13.8%
39.1%
158
97.6K
$2.44
$82.82
9
MiniMax M3
adaptive
13.8%
35.6%
370
85.3K
$0.10
$17.75
10
GPT-5.4
xhigh
13.6%
48.9%
82
50.5K
$0.76
$28.42
11
GLM-5.2
max
13.1%
32.1%
214
66.0K
$0.09
$8.40
12
Kimi K3
max
12.9%
35.3%
241
59.2K
$0.89
$81.53
13
Kimi K2.6
default
9.4%
24.7%
222
513.1K
$1.75
$13.63
14
Claude Sonnet 4.6
high
9.3%
30.2%
175
61.1K
$0.92
$58.10
15
Gemini 3.1 Pro
high
6.8%
26.1%
90
19.4K
$0.23
$7.83
16
Gemini 3.5 Flash
medium
3.4%
20.5%
255
85.0K
$0.76
$68.06