Terminal Bench
评估 AI Agent 在命令行 主动完成多任务的能力 的评测基准——Codex 在该指标上明显占优(82% vs Claude Code 69.4%)
简介
Terminal Bench 是与 SWE-bench 功能互补的一个重要评测工具——SWE-bench 测代码修复能力(读 bug 描述,写修复代码),Terminal Bench 测命令行的自主操作能力(Agent 需自主执行命令、田整错误、面向系统导航)。这直接对应了 Team LeakBench 2.0(当前版本),测试 AI Agent 能否在终端上”像熟练的开发者那样边看边试”。
当前公开数据:
- Codex → Terminal Bench 2.0 = 82%(自走自动化优秀)
- Claude Code → Terminal Bench 2.0 = 69.4%(命令注入行操作相对偏弱)
在 Vibe Coding 的最佳姿态中 案中作者主要引用这个对比并指明:Claude Code 与 Codex 的代码写能力(SWE-bench)几乎相同,但 Terminal Bench 暴露了 Codex 对终端/指令更稳的强生性选择优势。作者将这个期于划分的场景化入选择了的判定:终端规模化任务引向项化时应选 Codex;而制务是良实现/语境架构类解码任务时两个模型的速度展开基本无差别。
关控信息
- 类型:AI 评测基准
- 领域:终端开发、Agent 能力测试
- 最新版本:Terminal Bench 2.0
- 相关概念:SWE-bench Verified、Agent 选型四步法、Claude Code、Codex、Vibe Coding
主要用途
- 帮助开发者在 Agent 选_ITW 时明确候选工具在 Terminal 场景下的稳定性
- 间接衡量 Agent 的”自主运行”能力(如项目长型监控时是否有足够的激励自己发现和找回)
- 结合 SWE-bench Verified 形成代码之端两侧的心率畏
局限性
- 与 SWE-bench 一样上限于已知语料的固定任务,不能代表对环境充分关系的开发流
- 评测集更新不频繁