智能客服Agent护栏设计:让AI客服从【能用】到【敢用】

智能客服Agent系列第二篇。系统拆解六道防线:从输入安检、检索审核、话题围栏、操作审批到出门检查和全局风控,结合DPD爆粗口事故、加航判例、亚马逊MARCO论文等真实案例,讲清每道护栏防什么、怎么建、如何选型。

核心观点

  1. 客服Agent真正的风险不是”AI说脏话”,而是”AI正经办事时把业务办错”。DPD爆粗口是低频舆情风险,加航案(聊天机器人编造不存在的退款政策,公司被判赔812.02加元)才是高频、高损失的业务风险。AI说错的话,公司要照单全赔。

  2. 护栏是6道防线,而非一个模块:输入护栏→检索护栏→对话护栏→操作审批→出门检查→全局风控。六层沿客户提问→系统处理→回复的链路依次设卡。AI能做的事越多,护栏就要越往前移、越要细。

  3. 操作审批是客服场景最关键的护栏:当Agent从”回答问题”进化到”帮客户做事”(退改订单、查账户),风险陡然上升。亚马逊MARCO论文四道检查(格式→接口→参数→规则)把准确率从66%提升到94%,消融实验发现格式检查贡献最大:去掉后准确率跌21%。LLM最大问题不是理解错,而是输出格式不合规。

  4. 反思重试必须带诊断信息:护栏拦住错误操作后,不能只让AI重试,而要告诉它”哪里错了、为什么错、该怎么办”。MARCO实验结论:带诊断信息的重试绝大多数问题在第一次内解决;纯重试即使4次,错误率依然居高不下。

  5. 幻觉检测有4种方式,按风险分层选择:对照原文法(最直观,依赖知识库覆盖)、多次采样一致性(不依赖资料但成本×3)、NLI逻辑推理(能识别换说法的一致)、专用检测器(如Luna-2, <200ms, 成本降低97%)。大多数客服用专用检测器够了,涉及资金合规的叠加多重检测。

  6. 确定性工作流 + 四道检查是两种互补思路:确定性工作流限死”能不能做”(路径约束),像单行道让你只能按规定路线走;ARCO四道检查管”做得对不对”(参数校验),像路上摄像头抓违章。两手都要抓。

实操内容保留

确定性工作流架构图

以退款场景为例的确定性工作流示意:

客户输入"我要退款"
  → AI NLU(仅做意图+信息提取,不做决策)
  → 规则判断:订单是否在退款期内?
     YES → 规则判断:退款金额 > 500?
           YES → 转人工
           NO → 规则判断:商品是否已发货?
                NO → AI自动发起退款
                YES → 规则判断:客户已完成退货寄回?
                      YES → AI自动退款
                      NO → 告知客户退货流程,等待寄回确认
     NO → 告知退款期限已过

幻觉检测四种方式选用指南

方式延迟依赖适用场景
对照原文法(groundedness)毫秒级知识库日常客服、FAQ
多次采样一致性3×生成延迟不依赖知识库高风险+知识库未覆盖
NAND推理>1秒NAND模型语义变化
专用检测器(Luna-2等)<200ms训练数据高吞吐日常客服(推荐)

按风险分级护栏配置

风险操作类型护栏配置
查余额、查订单状态、查FAQ专用检测器 + 关键词规则
改地址、改手机号、修改备注专用检测器 + NAND + 人工确认
退款、取消订单、投诉升级NAND + 多次采样一致性 + 人工必确认
极高合同变更、批量修改账户确定性工作流限死路径 + 多层人工审核

护栏落地三阶段路线图

  1. 第1-2周:快速兜底——出门检查(原文对照)+ 话题围栏(关键词+兜底话术)+ 找资料审核(相关性阈值+来源标注)+ 进门安检(正则+关键词)
  2. 第3-4周:工具调用安全——操作审批(参数来源核对+函数白名单)+ 反思重试(至多2次)
  3. 第5-8周:精细化——全局风控(情绪识别+违规拦截+人工升级)+ 知识库权限隔离+ 审计日志+可观测性仪表盘

Agent安全PRD最小清单(客服场景扩展版)

## 客服Agent护栏PRD清单
 
1. 输入护栏
- 提示注入检测(关键词+语义分类两层)
- PII脱敏(身份证、银行卡号、手机号在传入LLM前批量脱敏)
- 身份验证(查订单/退款需先验证客户身份)
 
2. 检索护栏
- 相关性阈值(低于阈值的不传给AI)
- 知识权限隔离(A客户只能检索A有权看到的知识)
- 来源标注+更新时间标注(长期未更新降权)
 
3. 对话护栏
- 声明式规则定义能聊/不能聊范围(NVIDIAAM NeMo Guardrails)
- 不医疗/法律建议、不评价竞品、不讨论政治宗教
- 不知道的说不知道+转人工
 
4. 操作审批
- 格式检查:输出是否合规JSON
- 接口检查:调用的函数是否真实存在
- 参数检查:参数值是否来自客户对话(非AI编造)
- 规则检查:参数是否满足业务正则
- 高风险操作(退款>500元、改联系信息、投诉升级)必走人工
 
5. 出门检查
- 对比知识库原文件做中期复核
- 风险分级:低→专用器,中→NAND,高→多重叠加
- 2次重试后未通过→转人工
 
6. 全局风控
- 情绪识别(情绪→加重安抚语;暴怒→转人工)
- 客服特有交通:不乱承诺、不说漏嘴、不踩竞品、不超范围建议
- 5个自动转人工条件
- 全层重置的审计日志

关键概念

与已有素材的关联

原文精彩摘录

2024年2月,加拿大航空输掉了一场官司:它的聊天机器人给客户编造了一个不存在的”丧亲票价可事后退款”政策,客户按它说的买了票、事后申请退款被拒,告至仲裁庭。加航辩称”聊天机器人是独立的法律实体,应对自己的言论负责”,被仲裁庭驳回,判赔812.02加元。(论点:AI说错的话,公司要照单全赔)

护栏不是一个单独的模块,而是六道防线:前五道沿着客户提问、系统处理、回复客户这条链路依次设卡 第六道不在链路上,全程在候盯梢。每一道拦截不同类型的风险。

确定性工作流像是把路“成单行道:你只能按规定路线走,根本没有违章的机会。而四道检查像是在马路上装摄像头抓违章:车可以随便开,抽到了再罚。两种思路不是二选一——确定性工作流管能不能做,RVCO四道检查管做得好不好。”。“

相关页面


*原始出处:人人都是产品经理 - Amber