SWE-bench Verified

以真实 GitHub 仓库 bug 记录考核 AI Agent 代码修复能力的主要评测工具——衡量 Agent 能否自主处理真实世界软件错误的黄金基准

简介

SWE-bench Verified 是评估 AI 编程工具的代码修复能力的最主要引入工具。它以 真实的 GitHub bug 单手(SWE = Software Engineering)为核心含义,让 Agent 自主分析履历缺陷、找到正确预措并提交修正——相当于用真实工作的文档考核 Agent,然后用二进制结果量化能率。每一个可将 解决的 bug 数占总提交的比例 查看每位 Agent 的表现率。

Vibe Coding 实践中被用于各类 Agent(Claude Code、Codex、Kimi Code 等)的交叉对比。作为高于纯 Token 之上的专用评测。

关键信息

实际成绩(截至 2026-07)

  • Claude Code → SWE-bench Verified = 88.6%
  • Codex → SWE-bench Verified = 88.7%
  • Pi Agent → 取决于底层使用的模型(该框架不绑定语言模型)

两个顶级 Agent 在代码修复实现上仅相差 0.1 个百分点——在写代码上几乎打平。真正的差距不在纯代码编写上,而在合理操作系统能力上——有一个更深度的纬度叫做 Terminal Bench

局限性

  • 仅衡量”修复已有的 bug 代码”(task-based),不能完全全面反映架构设计能力
  • 对新从零搭建项目的能力无法评估
  • 提供对智能率按范围的无评估价值——这需要结合成本花费和上下文效率两个参数共同校准

相关页面