Coding Model 能力天梯(统一 Agent)
只比较使用同一 mini-SWE-agent v2.0.0 的模型,减少 Agent Harness 与模型能力混淆。
方法版本 v1.0.0
来源复核 2026/7/20 12:55:24
源内最新评测 2026-02-26
| 排名 | 基础模型(统一 Agent) | Resolved | 评测日期 | 证据 |
|---|---|---|---|---|
| #1 | claude-4-5-opus claude-4-5-opus · mini-SWE-agent | 76.80% | 2026-02-17 | A 级 |
| #2 | gemini-3-flash-preview gemini-3-flash-preview · mini-SWE-agent | 75.80% | 2026-02-17 | A 级 |
| #3 | minimax-m2.5 minimax-m2.5 · mini-SWE-agent | 75.80% | 2026-02-17 | A 级 |
| #4 | claude-opus-4-6 claude-opus-4-6 · mini-SWE-agent | 75.60% | 2026-02-17 | A 级 |
| #5 | glm-5 glm-5 · mini-SWE-agent | 72.80% | 2026-02-17 | A 级 |
| #6 | gpt-5-2 gpt-5-2 · mini-SWE-agent | 72.80% | 2026-02-17 | A 级 |
| #7 | gpt-5-2-codex gpt-5-2-codex · mini-SWE-agent | 72.80% | 2026-02-19 | A 级 |
| #8 | claude-sonnet-4-5-20250929 claude-sonnet-4-5-20250929 · mini-SWE-agent | 71.40% | 2026-02-17 | A 级 |
| #9 | kimi-k2.5 kimi-k2.5 · mini-SWE-agent | 70.80% | 2026-02-17 | A 级 |
| #10 | deepseek-v3.2 deepseek-v3.2 · mini-SWE-agent | 70.00% | 2026-02-17 | A 级 |
| #11 | gemini-3-pro-preview gemini-3-pro-preview · mini-SWE-agent | 69.60% | 2026-02-26 | A 级 |
| #12 | claude-haiku-4-5-20251001 claude-haiku-4-5-20251001 · mini-SWE-agent | 66.60% | 2026-02-17 | A 级 |
| #13 | gpt-5-mini-2025-08-07 gpt-5-mini-2025-08-07 · mini-SWE-agent | 56.20% | 2026-02-17 | A 级 |
排名规则
仅保留 mini-SWE-agent v2.0.0 的官方 Verified 结果,按 resolved 百分比降序排列;同分按模型名称排序。
模型必须由 SWE-bench 官方榜单标注基础模型名称,并使用当前最高 mini-SWE-agent 版本 v2.0.0。
正确理解这个榜单
本榜比完整系统榜更适合比较基础模型,但推理强度、成本和供应商配置仍可能不同,页面保留每条官方记录供复核。
旧版 mini-SWE-agent、定制 Agent Harness、商业合作、热度和编辑偏好均不参与本榜。