首页能力天梯精选工具实践洞察我的产品数字员工
A 级证据 · 官方榜单

Coding Model 能力天梯(统一 Agent)

只比较使用同一 mini-SWE-agent v2.0.0 的模型,减少 Agent Harness 与模型能力混淆。

方法版本 v1.0.0

来源复核 2026/7/20 12:55:24

源内最新评测 2026-02-26

“来源复核”表示 AIUtil 重新读取并校验官方数据的时间;“源内最新评测”才是官方榜单最近一条评测记录的日期。官方没有新增提交时,系统不会把复核时间伪装成新评测时间。
排名基础模型(统一 Agent)Resolved评测日期证据
#1

claude-4-5-opus

claude-4-5-opus · mini-SWE-agent

76.80%2026-02-17A
#2

gemini-3-flash-preview

gemini-3-flash-preview · mini-SWE-agent

75.80%2026-02-17A
#3

minimax-m2.5

minimax-m2.5 · mini-SWE-agent

75.80%2026-02-17A
#4

claude-opus-4-6

claude-opus-4-6 · mini-SWE-agent

75.60%2026-02-17A
#5

glm-5

glm-5 · mini-SWE-agent

72.80%2026-02-17A
#6

gpt-5-2

gpt-5-2 · mini-SWE-agent

72.80%2026-02-17A
#7

gpt-5-2-codex

gpt-5-2-codex · mini-SWE-agent

72.80%2026-02-19A
#8

claude-sonnet-4-5-20250929

claude-sonnet-4-5-20250929 · mini-SWE-agent

71.40%2026-02-17A
#9

kimi-k2.5

kimi-k2.5 · mini-SWE-agent

70.80%2026-02-17A
#10

deepseek-v3.2

deepseek-v3.2 · mini-SWE-agent

70.00%2026-02-17A
#11

gemini-3-pro-preview

gemini-3-pro-preview · mini-SWE-agent

69.60%2026-02-26A
#12

claude-haiku-4-5-20251001

claude-haiku-4-5-20251001 · mini-SWE-agent

66.60%2026-02-17A
#13

gpt-5-mini-2025-08-07

gpt-5-mini-2025-08-07 · mini-SWE-agent

56.20%2026-02-17A

排名规则

仅保留 mini-SWE-agent v2.0.0 的官方 Verified 结果,按 resolved 百分比降序排列;同分按模型名称排序。

模型必须由 SWE-bench 官方榜单标注基础模型名称,并使用当前最高 mini-SWE-agent 版本 v2.0.0。

正确理解这个榜单

本榜比完整系统榜更适合比较基础模型,但推理强度、成本和供应商配置仍可能不同,页面保留每条官方记录供复核。

旧版 mini-SWE-agent、定制 Agent Harness、商业合作、热度和编辑偏好均不参与本榜。