SWE-bench Verified
以真实 GitHub 仓库 bug 记录考核 AI Agent 代码修复能力的主要评测工具——衡量 Agent 能否自主处理真实世界软件错误的黄金基准
简介
SWE-bench Verified 是评估 AI 编程工具的代码修复能力的最主要引入工具。它以 真实的 GitHub bug 单手(SWE = Software Engineering)为核心含义,让 Agent 自主分析履历缺陷、找到正确预措并提交修正——相当于用真实工作的文档考核 Agent,然后用二进制结果量化能率。每一个可将 解决的 bug 数占总提交的比例 查看每位 Agent 的表现率。
在 Vibe Coding 实践中被用于各类 Agent(Claude Code、Codex、Kimi Code 等)的交叉对比。作为高于纯 Token 之上的专用评测。
关键信息
- 类型:评测工具
- 领域:AI 编码评测、模型对比
- 评测数据:GitHub 回归中的真实关键 bug(SWE-bench Verified)集
- 相关概念:Terminal Bench、Agent 选型四步法、Vibe Coding
实际成绩(截至 2026-07)
- Claude Code → SWE-bench Verified = 88.6%
- Codex → SWE-bench Verified = 88.7%
- Pi Agent → 取决于底层使用的模型(该框架不绑定语言模型)
两个顶级 Agent 在代码修复实现上仅相差 0.1 个百分点——在写代码上几乎打平。真正的差距不在纯代码编写上,而在合理操作系统能力上——有一个更深度的纬度叫做 Terminal Bench。
局限性
- 仅衡量”修复已有的 bug 代码”(task-based),不能完全全面反映架构设计能力
- 对新从零搭建项目的能力无法评估
- 提供对智能率按范围的无评估价值——这需要结合成本花费和上下文效率两个参数共同校准