热度5.0▼ 0.1
SWE-bench Multilingual
swe-bench / resolved · 13 行结果
| 排名 | 模型 | 子项 | 分数 | Metric | 时间 |
|---|---|---|---|---|---|
| #1 | Gemini 3 Flash Google DeepMind | SWE-bench Multilingual swe-bench | 72.7% | resolved | 2026-02-13 |
| #2 | Claude 4.6 Opus Anthropic | SWE-bench Multilingual swe-bench | 72% | resolved | 2026-02-13 |
| #3 | Claude 4.5 Opus Anthropic | SWE-bench Multilingual swe-bench | 70.7% | resolved | 2026-02-13 |
| #4 | GLM 5 Z.ai | SWE-bench Multilingual swe-bench | 69.7% | resolved | 2026-02-13 |
| #5 | Gemini 3 Pro Google DeepMind | SWE-bench Multilingual swe-bench | 68.7% | resolved | 2026-02-13 |
| #6 | MiniMax M2.5 Minimax | SWE-bench Multilingual swe-bench | 68.3% | resolved | 2026-02-16 |
| #7 | Kimi K2.5 Moonshot AI | SWE-bench Multilingual swe-bench | 67.3% | resolved | 2026-02-13 |
| #8 | Claude 4.5 Sonnet Anthropic | SWE-bench Multilingual swe-bench | 67% | resolved | 2026-02-13 |
| #9 | GPT 5.2 OpenAIGPT 5.2 (high) | SWE-bench Multilingual swe-bench | 66.7% | resolved | 2026-02-13 |
| #10 | GPT 5.2 Codex OpenAI | SWE-bench Multilingual swe-bench | 66.3% | resolved | 2026-02-20 |
| #11 | Claude 4.5 Haiku Anthropic | SWE-bench Multilingual swe-bench | 64.7% | resolved | 2026-02-13 |
| #12 | DeepSeek V3.2 DeepSeek | SWE-bench Multilingual swe-bench | 59% | resolved | 2026-02-13 |
| #13 | GPT 5 mini OpenAI | SWE-bench Multilingual swe-bench | 39.7% | resolved | 2026-02-13 |
13 条结果 · 当前 1-13
1 / 1