4 个榜单服务器每日更新
按任务看模型排名
编码、综合能力和 Agent 任务分开比较。先选任务,再看分数。
综合能力
模型综合智能天梯
复杂推理、专业知识与真实工作任务的综合表现。
- 1Claude Opus 5 (Adaptive Reasoning, Max Effort)
- 2Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
- 3Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
- 4Claude Opus 5 (Adaptive Reasoning, High Effort)
当前领先
Claude Opus 5 (Adaptive Reasoning, Max Effort)
60.7
查看完整榜单
Agent 能力
模型 Agent 能力天梯
规划、工具调用与多步骤任务执行能力。
- 1Claude Opus 5 (Adaptive Reasoning, Max Effort)
- 2Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
- 3GPT-5.6 Sol (max)
- 4Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
当前领先
Claude Opus 5 (Adaptive Reasoning, Max Effort)
55.3
查看完整榜单
编码 Agent
Coding Agent 能力天梯
Coding Agent 在软件工程、终端操作和代码库理解任务中的表现。
- 1Claude Code - Opus 5 (xhigh)
- 2Codex - GPT-5.6 Sol (max)
- 3Claude Code - Fable 5 (max) (with fallback)
- 4Grok Build - Grok 4.5 (high)
当前领先
Claude Code - Opus 5 (xhigh)
66.7
查看完整榜单
编码模型
模型编码能力天梯
模型在软件工程、代码生成与问题修复任务中的表现。
- 1GPT-5.6 Sol (xhigh)
- 2Claude Opus 5 (Adaptive Reasoning, Max Effort)
- 3GPT-5.6 Sol (max)
- 4GPT-5.6 Sol (high)
当前领先
GPT-5.6 Sol (xhigh)
78.3
查看完整榜单