热度5.1▼ 0.3
SWE-bench Test
swe-bench / resolved · 24 行结果
| 排名 | 模型 | 子项 | 分数 | Metric | 时间 |
|---|---|---|---|---|---|
| #1 | Claude 4.5 Opus AnthropicSonar Foundation Agent + Claude 4.5 Opus | SWE-bench Test swe-bench | 52.6% | resolved | 2025-12-19 |
| #2 | Multiple AnthropicSalesforce AI Research SAGE (bash-only) | SWE-bench Test swe-bench | 44.3% | resolved | 2025-10-27 |
| #3 | Undisclosed Atlassian Rovo Dev (2025-06-05) | SWE-bench Test swe-bench | 42% | resolved | 2025-06-05 |
| #4 | Undisclosed Amazon Q Developer Agent (v20250405-dev) | SWE-bench Test swe-bench | 37.1% | resolved | 2025-05-22 |
| #5 | Claude 3.7 Sonnet AnthropicSWE-agent 1.0 (Claude 3.7 Sonnet) | SWE-bench Test swe-bench | 33.8% | resolved | 2025-02-27 |
| #6 | Undisclosed Amazon Q Developer Agent (v20241202-dev) | SWE-bench Test swe-bench | 30% | resolved | 2025-01-31 |
| #7 | CodeAct v2.1 (claude-3-5-sonnet-20241022) AnthropicOpenHands + CodeAct v2.1 (claude-3-5-sonnet-20241022) | SWE-bench Test swe-bench | 29.4% | resolved | 2024-11-03 |
| #8 | Claude 3.5-Sonnet-20241022 AnthropicAutoCodeRover-v2.0 (Claude-3.5-Sonnet-20241022) | SWE-bench Test swe-bench | 24.9% | resolved | 2024-11-21 |
| #9 | Undisclosed Honeycomb | SWE-bench Test swe-bench | 22.1% | resolved | 2024-08-20 |
| #10 | Undisclosed Amazon Q Developer Agent (v20240719-dev) | SWE-bench Test swe-bench | 19.8% | resolved | 2024-07-21 |
| #11 | Undisclosed Factory Code Droid | SWE-bench Test swe-bench | 19.3% | resolved | 2024-06-17 |
| #12 | GPT-4o OpenAIAutoCodeRover (v20240620) + GPT 4o (2024-05-13) | SWE-bench Test swe-bench | 18.8% | resolved | 2024-06-28 |
| #13 | Claude 3.5 Sonnet AnthropicSWE-agent + Claude 3.5 Sonnet | SWE-bench Test swe-bench | 18.1% | resolved | 2024-06-20 |
| #14 | GPT-4o OpenAIAppMap Navie + GPT 4o (2024-05-13) | SWE-bench Test swe-bench | 14.6% | resolved | 2024-06-15 |
| #15 | Undisclosed Amazon Q Developer Agent (v20240430-dev) | SWE-bench Test swe-bench | 13.8% | resolved | 2024-05-09 |
| #16 | GPT-4 (1106) OpenAISWE-agent + GPT 4 (1106) | SWE-bench Test swe-bench | 12.5% | resolved | 2024-04-02 |
| #17 | GPT-4o OpenAISWE-agent + GPT 4o (2024-05-13) | SWE-bench Test swe-bench | 12% | resolved | 2024-07-28 |
| #18 | Claude 3 Opus AnthropicSWE-agent + Claude 3 Opus | SWE-bench Test swe-bench | 10.5% | resolved | 2024-04-02 |
| #19 | Claude 3 Opus AnthropicRAG + Claude 3 Opus | SWE-bench Test swe-bench | 3.8% | resolved | 2024-04-02 |
| #20 | Claude 2 AnthropicRAG + Claude 2 | SWE-bench Test swe-bench | 2% | resolved | 2023-10-10 |
| #21 | GPT-4 (1106) OpenAIRAG + GPT 4 (1106) | SWE-bench Test swe-bench | 1.3% | resolved | 2024-04-02 |
| #22 | SWE-Llama 13B MetaRAG + SWE-Llama 13B | SWE-bench Test swe-bench | 0.7% | resolved | 2023-10-10 |
| #23 | SWE-Llama 7B MetaRAG + SWE-Llama 7B | SWE-bench Test swe-bench | 0.7% | resolved | 2023-10-10 |
| #24 | GPT-3.5 OpenAIRAG + ChatGPT 3.5 | SWE-bench Test swe-bench | 0.2% | resolved | 2023-10-10 |
24 条结果 · 当前 1-24
1 / 1