一段「先定义完成标准」的提示词,能拦住 AI Agent 做过头
PCWorld 实测发现:在 Claude Cowork、ChatGPT Work、Gemini Spark 这类能直接操作电脑文件的 Agent 上,先让模型写清任务终点并停下来等批准,能显著降低误删、误改和越权延伸处理的风险。
基本信息
- 来源类型:文章(TechNews 编译 PCWorld 实测)
- 原文位置:raw/articles/2026-08-18-025438-tg-3f7881.md
- 原文 URL:https://technews.tw/2026/08/17/a-prompt-that-keeps-ai-agents-from-going-too-far/
- 消化日期:2026-08-18
- 关键词:Claude Cowork、ChatGPT Work、Gemini Spark、define done、提示词
核心观点
- Agent 最难预测的不是能力,是「何时算做完」:Claude Cowork、ChatGPT Work、Gemini Spark 已经能按详尽指令处理和分析本机文件,但用户仍很难预判它会怎么判断任务完成、会不会在完成标准之外继续动手。涉及删除、改名、移动文件时,这种不确定性就是破坏力来源。
- 「定义完成」(define done)比「写得更细」更管用:动手前先逼 Agent 写清五件事——完成时什么会成立、它将产出或修改什么、用户如何亲自验证、哪些相关事项这次不做、还有哪些会改变完成结果的开放问题——能把模糊目标(「改善」「最佳化」)换成可检查的终点线。
- 真正刹车的是末尾那句「先停下来,等我批准」:PCWorld 强调,提示词的关键不在五段模板本身,而在写完计划后同一则回复里不要开工。用户可以在批准前改范围;一旦批准,检查通过就立刻停,注意到的其他事项只能列在「不属于这次任务」下。
- 实测路径:Claude 造测试盘,ChatGPT 按提示词整理:PCWorld 先用 Claude 建一个含数十个虚构工作/个人文件的测试文件夹,再让 ChatGPT 指向该目录并附上上述提示词。ChatGPT 先回报整理结果、产出物、验证方式、非处理范围和开放问题,还主动问要不要把财务、税务、法律、保险、身份文件单独分类;被要求建「机密」文件夹后继续等待指示;获准后约一分钟完成整理,文件按预期重新分类。
- 适用面是「直接碰文件」的任务,不是所有 Agent 对话:重新命名截图、整理桌面这类会改磁盘状态的操作最吃这套流程。方向不对可以在开工前改范围,避免 Agent 一路往错误方向走。
实操内容保留
Prompt 模板
PCWorld 给出的完整「定义完成」提示词(可直接贴给 Claude Cowork / ChatGPT Work / Gemini Spark):
在你开始之前,先对你要求的任务设定一条明确终点线。请保持简短,并与这次工作的规模相称。
完成结果:当这项任务完成时,有什么会成立。
你将产出什么:你将制作或变更的具体事物。
我将如何得知:某一项我能亲自检视、测试、计数或以其他方式加以验证的事物。
不属于完成范围内:你可能会注意到、但不予处理的相关工作。
开放性问题:任何模糊不清、且会改变完成结果的事项。若无这类事项,可以写下「无」。
请采用能满足我要求的最简洁完整版本。避免使用「改善」或「最佳化」等含糊不清的目标。
接着请停下来。不要在同一则回复便开始动工,等候我的许可。一旦我批准,检查通过后立即停止。如果你注意到任何其他事项,请将它单独列在「不属于这次任务」下,除非我提出要求,请勿径行处理。
原文英文标题对应同一套做法:I found a prompt that keeps AI agents from taking tasks too far。
操作步骤(PCWorld 实测流程)
- 用 Claude 在测试环境里生成含数十个虚构工作与个人文件的文件夹,作为可破坏的沙盒。
- 把 ChatGPT 指向该目录,下达「整理文件」任务,并附上整段 define-done 提示词。
- 先审 Agent 回传的五段计划(完成结果 / 产出 / 验证方式 / 非范围 / 开放问题);本例中 ChatGPT 额外问是否把敏感财务、税务、法律、保险、身份文件独立分类。
- 需要时追加范围(本例:再建一个「机密」文件夹),Agent 继续等待,不自行开工。
- 用户批准后执行;本例约一分钟完成,测试文件按预期重新分类。批准后若检查通过,立即停止,不顺手做「注意到的其他事」。
关键概念
- Claude Cowork — 本文点名的桌面文件 Agent 之一,也是「做过头」风险最直观的产品形态
- ChatGPT — 实测里真正执行整理的一方(文中写作 ChatGPT Work)
- Gemini Spark — 与 Cowork / ChatGPT Work 并列的第三家文件 Agent
- 提示词工程 — 「定义完成 + 先停再批」被归为常见提示词做法,不是新框架
- AI Agent 智能体 — 问题出在 Agent 自己判定任务完成的时机,而不只是模型能力
- Agent安全护栏 — 用完成标准和批准门当运行时护栏,降低误删误改
- ChatGPT Work — 文中对 ChatGPT 办公/文件 Agent 形态的称呼,知识库暂无独立实体页
- define done / 定义完成 — 先写清终点线再动手的提示词模式
与其他素材的关联
- 与 2026-08-11-gemini-spark-tutorial:同一产品线(Gemini Spark)从「怎么用」补到「怎么防止它把文件任务做过头」。
- 与 2026-08-05-agent-cs-guardrails、Agent安全护栏:都在谈 Agent 运行时护栏;本文把护栏前移到「开工前的完成定义 + 人工批准」,而不是事后拦请求。
- 与 提示词工程、2026-05-31-bnext-17-office-prompts:同属办公场景提示词,但本文针对的是有写盘能力的 Agent,而不是普通对话润色。
- 与 Claude Cowork、Claude Code Plan 模式:Cowork 的文件操作和 Claude Code 的 Plan 模式都依赖「先计划再执行」;本文把这套纪律写成可粘贴的五段模板。
原文精彩摘录
要避免 Claude、ChatGPT 或 Gemini 把一道可能带有破坏力的指令执行得太过火,其中一种相当实用的方法,便是要求 AI Agent 在动手前先有清楚的任务终点,包括结果会是什么、会产出或修改哪些内容、你如何检查、哪些事项不属于这次任务,以及是否还有任何未釐清的问题。
值得一提的是,提示词的关键内容是末尾「先停下来并取得批准」部分,藉此确保 AI Agent 不会在还没检视完整个计划且做出调整之前,便一马当先做下去。
实测中,PCWorld 先用 Claude 协助建立一个包含数十个虚构工作和个人档案的测试资料夹,再把 ChatGPT 指向该目录,要求整理档案并附上上述提示词。ChatGPT 则回覆整理结果、产出内容、验证方式、非处理范围及开放性问题,甚至主动询问是否要把敏感的财务、税务、法律、保险及身分文件独立分类。接着被要求建立一个「机密」资料夹,ChatGPT 等待进一步指示。ChatGPT 获得允许后,约一分钟内完成整理,测试档案也如预期被重新分类。