跳到主要内容
AIUtil

站内搜索

找行业 Agent、模型、文章或产品

导航
模型排名、工具资料和开发记录
4 个榜单服务器每日更新

按任务看模型排名

编码、综合能力和 Agent 任务分开比较。先选任务,再看分数。

综合能力

模型综合智能天梯

复杂推理、专业知识与真实工作任务的综合表现。

  1. 1Claude Opus 5 (Adaptive Reasoning, Max Effort)
  2. 2Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
  3. 3Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
  4. 4Claude Opus 5 (Adaptive Reasoning, High Effort)

当前领先

Claude Opus 5 (Adaptive Reasoning, Max Effort)

60.7

查看完整榜单

Agent 能力

模型 Agent 能力天梯

规划、工具调用与多步骤任务执行能力。

  1. 1Claude Opus 5 (Adaptive Reasoning, Max Effort)
  2. 2Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
  3. 3GPT-5.6 Sol (max)
  4. 4Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)

当前领先

Claude Opus 5 (Adaptive Reasoning, Max Effort)

55.3

查看完整榜单

编码 Agent

Coding Agent 能力天梯

Coding Agent 在软件工程、终端操作和代码库理解任务中的表现。

  1. 1Claude Code - Opus 5 (xhigh)
  2. 2Codex - GPT-5.6 Sol (max)
  3. 3Claude Code - Fable 5 (max) (with fallback)
  4. 4Grok Build - Grok 4.5 (high)

当前领先

Claude Code - Opus 5 (xhigh)

66.7

查看完整榜单

编码模型

模型编码能力天梯

模型在软件工程、代码生成与问题修复任务中的表现。

  1. 1GPT-5.6 Sol (xhigh)
  2. 2Claude Opus 5 (Adaptive Reasoning, Max Effort)
  3. 3GPT-5.6 Sol (max)
  4. 4GPT-5.6 Sol (high)

当前领先

GPT-5.6 Sol (xhigh)

78.3

查看完整榜单

每条天梯只比较同一能力维度

更新时间见各榜单