TOP 1Browser Use
Browser Use:面向浏览器 Agent的行业头部 AI 工具
综合分95.2
在浏览器 Agent的证据综合中,Browser Use 位列 Top 1。独立工程师横评记录 Browser Use 的 WebVoyager 89.1%、约 3 秒/step、10 步约 7k–15k tokens,并认为它适合通用 Agent 和最大社区生态;同时指出每一步 LLM 调用使重复流程成本增长。作者未提供自有复现实验,按 B 级技术综合使用。
- 使用规模
- 100.0
- 实际结果
- 94.0
- 投入价值
- 90.0
- 可信度
- 92.0
适合
- 浏览器 Agent核心工作流
- 希望优先评估行业头部方案的团队
限制
- 公开证据综合而非 AIUtil 亲自实测
- 公开基准由厂商材料传播,横评未复现原始运行
- GitHub 108k stars 不等于生产采用
- 登录、CAPTCHA、反爬和地区网络仍需目标站点测试。
TOP 2Skyvern
Skyvern:面向浏览器 Agent的行业头部 AI 工具
综合分88.0
在浏览器 Agent的证据综合中,Skyvern 位列 Top 2。独立技术横评记录 Skyvern v2 的 WebVoyager 85.85%,并描述 Planner-Actor-Validator 与公开 traces;视觉优先适合遗留和 DOM 不可靠站点,但估算 10 步约 30k–50k tokens、单任务 US$0.10–0.50。作者未独立复现,按 B 级使用。
- 使用规模
- 84.0
- 实际结果
- 92.0
- 投入价值
- 84.0
- 可信度
- 92.0
适合
- 浏览器 Agent核心工作流
- 希望优先评估行业头部方案的团队
限制
- 公开证据综合而非 AIUtil 亲自实测
- WebVoyager 不覆盖所有真实登录和反爬条件
- 视觉 token 成本较高
- GitHub 22.7k stars 只是关注信号
- AGPL-3.0 商业嵌入需法务确认。
TOP 3Stagehand
Stagehand:面向浏览器 Agent的行业头部 AI 工具
综合分87.5
在浏览器 Agent的证据综合中,Stagehand 位列 Top 3。独立工程师横评认为 Stagehand 的 TypeScript/CDP、动作缓存和自愈适合重复生产流程,报告首次执行约 1–3 秒、缓存执行低于 100ms且重复时接近零 LLM 成本;同一横评明确写明没有公开统一任务基准。
- 使用规模
- 86.0
- 实际结果
- 86.0
- 投入价值
- 94.0
- 可信度
- 88.0
适合
- 浏览器 Agent核心工作流
- 希望优先评估行业头部方案的团队
限制
- 公开证据综合而非 AIUtil 亲自实测
- 缺少与前两名同口径的公开任务成功率
- 缓存延迟为横评描述而非 AIUtil 复测
- GitHub 23.7k stars 不代表生产质量
- 托管主路径与 Browserbase 绑定。