一段「先定义完成标准」的提示词,能拦住 AI Agent 做过头

PCWorld 实测发现:在 Claude Cowork、ChatGPT Work、Gemini Spark 这类能直接操作电脑文件的 Agent 上,先让模型写清任务终点并停下来等批准,能显著降低误删、误改和越权延伸处理的风险。

基本信息

核心观点

  1. Agent 最难预测的不是能力,是「何时算做完」:Claude Cowork、ChatGPT Work、Gemini Spark 已经能按详尽指令处理和分析本机文件,但用户仍很难预判它会怎么判断任务完成、会不会在完成标准之外继续动手。涉及删除、改名、移动文件时,这种不确定性就是破坏力来源。
  2. 「定义完成」(define done)比「写得更细」更管用:动手前先逼 Agent 写清五件事——完成时什么会成立、它将产出或修改什么、用户如何亲自验证、哪些相关事项这次不做、还有哪些会改变完成结果的开放问题——能把模糊目标(「改善」「最佳化」)换成可检查的终点线。
  3. 真正刹车的是末尾那句「先停下来,等我批准」:PCWorld 强调,提示词的关键不在五段模板本身,而在写完计划后同一则回复里不要开工。用户可以在批准前改范围;一旦批准,检查通过就立刻停,注意到的其他事项只能列在「不属于这次任务」下。
  4. 实测路径:Claude 造测试盘,ChatGPT 按提示词整理:PCWorld 先用 Claude 建一个含数十个虚构工作/个人文件的测试文件夹,再让 ChatGPT 指向该目录并附上上述提示词。ChatGPT 先回报整理结果、产出物、验证方式、非处理范围和开放问题,还主动问要不要把财务、税务、法律、保险、身份文件单独分类;被要求建「机密」文件夹后继续等待指示;获准后约一分钟完成整理,文件按预期重新分类。
  5. 适用面是「直接碰文件」的任务,不是所有 Agent 对话:重新命名截图、整理桌面这类会改磁盘状态的操作最吃这套流程。方向不对可以在开工前改范围,避免 Agent 一路往错误方向走。

实操内容保留

Prompt 模板

PCWorld 给出的完整「定义完成」提示词(可直接贴给 Claude Cowork / ChatGPT Work / Gemini Spark):

在你开始之前,先对你要求的任务设定一条明确终点线。请保持简短,并与这次工作的规模相称。

完成结果:当这项任务完成时,有什么会成立。

你将产出什么:你将制作或变更的具体事物。

我将如何得知:某一项我能亲自检视、测试、计数或以其他方式加以验证的事物。

不属于完成范围内:你可能会注意到、但不予处理的相关工作。

开放性问题:任何模糊不清、且会改变完成结果的事项。若无这类事项,可以写下「无」。

请采用能满足我要求的最简洁完整版本。避免使用「改善」或「最佳化」等含糊不清的目标。

接着请停下来。不要在同一则回复便开始动工,等候我的许可。一旦我批准,检查通过后立即停止。如果你注意到任何其他事项,请将它单独列在「不属于这次任务」下,除非我提出要求,请勿径行处理。

原文英文标题对应同一套做法:I found a prompt that keeps AI agents from taking tasks too far

操作步骤(PCWorld 实测流程)

  1. 用 Claude 在测试环境里生成含数十个虚构工作与个人文件的文件夹,作为可破坏的沙盒。
  2. 把 ChatGPT 指向该目录,下达「整理文件」任务,并附上整段 define-done 提示词。
  3. 先审 Agent 回传的五段计划(完成结果 / 产出 / 验证方式 / 非范围 / 开放问题);本例中 ChatGPT 额外问是否把敏感财务、税务、法律、保险、身份文件独立分类。
  4. 需要时追加范围(本例:再建一个「机密」文件夹),Agent 继续等待,不自行开工。
  5. 用户批准后执行;本例约一分钟完成,测试文件按预期重新分类。批准后若检查通过,立即停止,不顺手做「注意到的其他事」。

关键概念

  • Claude Cowork — 本文点名的桌面文件 Agent 之一,也是「做过头」风险最直观的产品形态
  • ChatGPT — 实测里真正执行整理的一方(文中写作 ChatGPT Work)
  • Gemini Spark — 与 Cowork / ChatGPT Work 并列的第三家文件 Agent
  • 提示词工程 — 「定义完成 + 先停再批」被归为常见提示词做法,不是新框架
  • AI Agent 智能体 — 问题出在 Agent 自己判定任务完成的时机,而不只是模型能力
  • Agent安全护栏 — 用完成标准和批准门当运行时护栏,降低误删误改
  • ChatGPT Work — 文中对 ChatGPT 办公/文件 Agent 形态的称呼,知识库暂无独立实体页
  • define done / 定义完成 — 先写清终点线再动手的提示词模式

与其他素材的关联

原文精彩摘录

要避免 Claude、ChatGPT 或 Gemini 把一道可能带有破坏力的指令执行得太过火,其中一种相当实用的方法,便是要求 AI Agent 在动手前先有清楚的任务终点,包括结果会是什么、会产出或修改哪些内容、你如何检查、哪些事项不属于这次任务,以及是否还有任何未釐清的问题。

值得一提的是,提示词的关键内容是末尾「先停下来并取得批准」部分,藉此确保 AI Agent 不会在还没检视完整个计划且做出调整之前,便一马当先做下去。

实测中,PCWorld 先用 Claude 协助建立一个包含数十个虚构工作和个人档案的测试资料夹,再把 ChatGPT 指向该目录,要求整理档案并附上上述提示词。ChatGPT 则回覆整理结果、产出内容、验证方式、非处理范围及开放性问题,甚至主动询问是否要把敏感的财务、税务、法律、保险及身分文件独立分类。接着被要求建立一个「机密」资料夹,ChatGPT 等待进一步指示。ChatGPT 获得允许后,约一分钟内完成整理,测试档案也如预期被重新分类。

相关页面