智能客服Agent护栏设计:让AI客服从【能用】到【敢用】
智能客服Agent系列第二篇。系统拆解六道防线:从输入安检、检索审核、话题围栏、操作审批到出门检查和全局风控,结合DPD爆粗口事故、加航判例、亚马逊MARCO论文等真实案例,讲清每道护栏防什么、怎么建、如何选型。
核心观点
-
客服Agent真正的风险不是”AI说脏话”,而是”AI正经办事时把业务办错”。DPD爆粗口是低频舆情风险,加航案(聊天机器人编造不存在的退款政策,公司被判赔812.02加元)才是高频、高损失的业务风险。AI说错的话,公司要照单全赔。
-
护栏是6道防线,而非一个模块:输入护栏→检索护栏→对话护栏→操作审批→出门检查→全局风控。六层沿客户提问→系统处理→回复的链路依次设卡。AI能做的事越多,护栏就要越往前移、越要细。
-
操作审批是客服场景最关键的护栏:当Agent从”回答问题”进化到”帮客户做事”(退改订单、查账户),风险陡然上升。亚马逊MARCO论文四道检查(格式→接口→参数→规则)把准确率从66%提升到94%,消融实验发现格式检查贡献最大:去掉后准确率跌21%。LLM最大问题不是理解错,而是输出格式不合规。
-
反思重试必须带诊断信息:护栏拦住错误操作后,不能只让AI重试,而要告诉它”哪里错了、为什么错、该怎么办”。MARCO实验结论:带诊断信息的重试绝大多数问题在第一次内解决;纯重试即使4次,错误率依然居高不下。
-
幻觉检测有4种方式,按风险分层选择:对照原文法(最直观,依赖知识库覆盖)、多次采样一致性(不依赖资料但成本×3)、NLI逻辑推理(能识别换说法的一致)、专用检测器(如Luna-2, <200ms, 成本降低97%)。大多数客服用专用检测器够了,涉及资金合规的叠加多重检测。
-
确定性工作流 + 四道检查是两种互补思路:确定性工作流限死”能不能做”(路径约束),像单行道让你只能按规定路线走;ARCO四道检查管”做得对不对”(参数校验),像路上摄像头抓违章。两手都要抓。
实操内容保留
确定性工作流架构图
以退款场景为例的确定性工作流示意:
客户输入"我要退款"
→ AI NLU(仅做意图+信息提取,不做决策)
→ 规则判断:订单是否在退款期内?
YES → 规则判断:退款金额 > 500?
YES → 转人工
NO → 规则判断:商品是否已发货?
NO → AI自动发起退款
YES → 规则判断:客户已完成退货寄回?
YES → AI自动退款
NO → 告知客户退货流程,等待寄回确认
NO → 告知退款期限已过幻觉检测四种方式选用指南
| 方式 | 延迟 | 依赖 | 适用场景 |
|---|---|---|---|
| 对照原文法(groundedness) | 毫秒级 | 知识库 | 日常客服、FAQ |
| 多次采样一致性 | 3×生成延迟 | 不依赖知识库 | 高风险+知识库未覆盖 |
| NAND推理 | >1秒 | NAND模型 | 语义变化 |
| 专用检测器(Luna-2等) | <200ms | 训练数据 | 高吞吐日常客服(推荐) |
按风险分级护栏配置
| 风险 | 操作类型 | 护栏配置 |
|---|---|---|
| 低 | 查余额、查订单状态、查FAQ | 专用检测器 + 关键词规则 |
| 中 | 改地址、改手机号、修改备注 | 专用检测器 + NAND + 人工确认 |
| 高 | 退款、取消订单、投诉升级 | NAND + 多次采样一致性 + 人工必确认 |
| 极高 | 合同变更、批量修改账户 | 确定性工作流限死路径 + 多层人工审核 |
护栏落地三阶段路线图
- 第1-2周:快速兜底——出门检查(原文对照)+ 话题围栏(关键词+兜底话术)+ 找资料审核(相关性阈值+来源标注)+ 进门安检(正则+关键词)
- 第3-4周:工具调用安全——操作审批(参数来源核对+函数白名单)+ 反思重试(至多2次)
- 第5-8周:精细化——全局风控(情绪识别+违规拦截+人工升级)+ 知识库权限隔离+ 审计日志+可观测性仪表盘
Agent安全PRD最小清单(客服场景扩展版)
## 客服Agent护栏PRD清单
1. 输入护栏
- 提示注入检测(关键词+语义分类两层)
- PII脱敏(身份证、银行卡号、手机号在传入LLM前批量脱敏)
- 身份验证(查订单/退款需先验证客户身份)
2. 检索护栏
- 相关性阈值(低于阈值的不传给AI)
- 知识权限隔离(A客户只能检索A有权看到的知识)
- 来源标注+更新时间标注(长期未更新降权)
3. 对话护栏
- 声明式规则定义能聊/不能聊范围(NVIDIAAM NeMo Guardrails)
- 不医疗/法律建议、不评价竞品、不讨论政治宗教
- 不知道的说不知道+转人工
4. 操作审批
- 格式检查:输出是否合规JSON
- 接口检查:调用的函数是否真实存在
- 参数检查:参数值是否来自客户对话(非AI编造)
- 规则检查:参数是否满足业务正则
- 高风险操作(退款>500元、改联系信息、投诉升级)必走人工
5. 出门检查
- 对比知识库原文件做中期复核
- 风险分级:低→专用器,中→NAND,高→多重叠加
- 2次重试后未通过→转人工
6. 全局风控
- 情绪识别(情绪→加重安抚语;暴怒→转人工)
- 客服特有交通:不乱承诺、不说漏嘴、不踩竞品、不超范围建议
- 5个自动转人工条件
- 全层重置的审计日志关键概念
- 智能客服 — 需从”会聊天的机器人”扩充为”能办事的构建型Agent”
- Agent安全护栏 — 补补客服场景的6层安全架构与实际案例
- AI幻觉 — 补幻觉检测4种方法和选择指南
- RAG 知识库 — 补检索护栏和来源核算
- 置信度门控 — 需要易名实体页
- 规则引擎双校验 — 需要易名实体页
与已有素材的关联
- 2026-07-07-woshipm-agent-safety-guardrails:前一篇讲了安全的护栏模型和风险分层,本篇文章以客服Agent具体场景落地6层架构,特别是RALPH操作审批、确定性工作流、反思重试和情绪管理
- 2026-07-16-woshipm-ai-hallucination-3-solutions:前篇讲幻觉产品级治理(规则引擎、保护层、全链溯源),本篇讲从客服Agent视角的幻觉检测术语
- 2026-05-26-智能客服MVP三件事:之前讲MVP阶段三件事(查订单/查积分/申请退款),本篇在其基础上讲构建完整防护体系,把客服从”用”推进到”敢用”
原文精彩摘录
2024年2月,加拿大航空输掉了一场官司:它的聊天机器人给客户编造了一个不存在的”丧亲票价可事后退款”政策,客户按它说的买了票、事后申请退款被拒,告至仲裁庭。加航辩称”聊天机器人是独立的法律实体,应对自己的言论负责”,被仲裁庭驳回,判赔812.02加元。(论点:AI说错的话,公司要照单全赔)
护栏不是一个单独的模块,而是六道防线:前五道沿着客户提问、系统处理、回复客户这条链路依次设卡 第六道不在链路上,全程在候盯梢。每一道拦截不同类型的风险。
确定性工作流像是把路“成单行道:你只能按规定路线走,根本没有违章的机会。而四道检查像是在马路上装摄像头抓违章:车可以随便开,抽到了再罚。两种思路不是二选一——确定性工作流管能不能做,RVCO四道检查管做得好不好。”。“
相关页面
*原始出处:人人都是产品经理 - Amber