Terminal Bench

评估 AI Agent 在命令行 主动完成多任务的能力 的评测基准——Codex 在该指标上明显占优(82% vs Claude Code 69.4%)

简介

Terminal Bench 是与 SWE-bench 功能互补的一个重要评测工具——SWE-bench 测代码修复能力(读 bug 描述,写修复代码),Terminal Bench 测命令行的自主操作能力(Agent 需自主执行命令、田整错误、面向系统导航)。这直接对应了 Team LeakBench 2.0(当前版本),测试 AI Agent 能否在终端上”像熟练的开发者那样边看边试”。

当前公开数据:

  • Codex → Terminal Bench 2.0 = 82%(自走自动化优秀)
  • Claude Code → Terminal Bench 2.0 = 69.4%(命令注入行操作相对偏弱)

Vibe Coding 的最佳姿态中 案中作者主要引用这个对比并指明:Claude Code 与 Codex 的代码写能力(SWE-bench)几乎相同,但 Terminal Bench 暴露了 Codex 对终端/指令更稳的强生性选择优势。作者将这个期于划分的场景化入选择了的判定:终端规模化任务引向项化时应选 Codex;而制务是良实现/语境架构类解码任务时两个模型的速度展开基本无差别。

关控信息

主要用途

  1. 帮助开发者在 Agent 选_ITW 时明确候选工具在 Terminal 场景下的稳定性
  2. 间接衡量 Agent 的”自主运行”能力(如项目长型监控时是否有足够的激励自己发现和找回)
  3. 结合 SWE-bench Verified 形成代码之端两侧的心率畏

局限性

  • 与 SWE-bench 一样上限于已知语料的固定任务,不能代表对环境充分关系的开发流
  • 评测集更新不频繁

相关页面