BenchMark·Hub

SWE-bench Test

A已审核Benchmark
代码仓库级代码SWE-bench 家族未知

发布方:Princeton

热度5.1▼ 0.3

SWE-bench Test

swe-bench / resolved · 24 行结果

排名模型子项分数Metric时间
#1Claude 4.5 Opus
AnthropicSonar Foundation Agent + Claude 4.5 Opus
SWE-bench Test
swe-bench
52.6%resolved2025-12-19
#2Multiple
AnthropicSalesforce AI Research SAGE (bash-only)
SWE-bench Test
swe-bench
44.3%resolved2025-10-27
#3Undisclosed
Atlassian Rovo Dev (2025-06-05)
SWE-bench Test
swe-bench
42%resolved2025-06-05
#4Undisclosed
Amazon Q Developer Agent (v20250405-dev)
SWE-bench Test
swe-bench
37.1%resolved2025-05-22
#5Claude 3.7 Sonnet
AnthropicSWE-agent 1.0 (Claude 3.7 Sonnet)
SWE-bench Test
swe-bench
33.8%resolved2025-02-27
#6Undisclosed
Amazon Q Developer Agent (v20241202-dev)
SWE-bench Test
swe-bench
30%resolved2025-01-31
#7CodeAct v2.1 (claude-3-5-sonnet-20241022)
AnthropicOpenHands + CodeAct v2.1 (claude-3-5-sonnet-20241022)
SWE-bench Test
swe-bench
29.4%resolved2024-11-03
#8Claude 3.5-Sonnet-20241022
AnthropicAutoCodeRover-v2.0 (Claude-3.5-Sonnet-20241022)
SWE-bench Test
swe-bench
24.9%resolved2024-11-21
#9Undisclosed
Honeycomb
SWE-bench Test
swe-bench
22.1%resolved2024-08-20
#10Undisclosed
Amazon Q Developer Agent (v20240719-dev)
SWE-bench Test
swe-bench
19.8%resolved2024-07-21
#11Undisclosed
Factory Code Droid
SWE-bench Test
swe-bench
19.3%resolved2024-06-17
#12GPT-4o
OpenAIAutoCodeRover (v20240620) + GPT 4o (2024-05-13)
SWE-bench Test
swe-bench
18.8%resolved2024-06-28
#13Claude 3.5 Sonnet
AnthropicSWE-agent + Claude 3.5 Sonnet
SWE-bench Test
swe-bench
18.1%resolved2024-06-20
#14GPT-4o
OpenAIAppMap Navie + GPT 4o (2024-05-13)
SWE-bench Test
swe-bench
14.6%resolved2024-06-15
#15Undisclosed
Amazon Q Developer Agent (v20240430-dev)
SWE-bench Test
swe-bench
13.8%resolved2024-05-09
#16GPT-4 (1106)
OpenAISWE-agent + GPT 4 (1106)
SWE-bench Test
swe-bench
12.5%resolved2024-04-02
#17GPT-4o
OpenAISWE-agent + GPT 4o (2024-05-13)
SWE-bench Test
swe-bench
12%resolved2024-07-28
#18Claude 3 Opus
AnthropicSWE-agent + Claude 3 Opus
SWE-bench Test
swe-bench
10.5%resolved2024-04-02
#19Claude 3 Opus
AnthropicRAG + Claude 3 Opus
SWE-bench Test
swe-bench
3.8%resolved2024-04-02
#20Claude 2
AnthropicRAG + Claude 2
SWE-bench Test
swe-bench
2%resolved2023-10-10
#21GPT-4 (1106)
OpenAIRAG + GPT 4 (1106)
SWE-bench Test
swe-bench
1.3%resolved2024-04-02
#22SWE-Llama 13B
MetaRAG + SWE-Llama 13B
SWE-bench Test
swe-bench
0.7%resolved2023-10-10
#23SWE-Llama 7B
MetaRAG + SWE-Llama 7B
SWE-bench Test
swe-bench
0.7%resolved2023-10-10
#24GPT-3.5
OpenAIRAG + ChatGPT 3.5
SWE-bench Test
swe-bench
0.2%resolved2023-10-10
24 条结果 · 当前 1-24
1 / 1