Instinct:客服场景的开源决策模型,让模型做选择题而不是写作文

甲木未来派介绍 ZooWork 开源的 Instinct 决策模型:客服崩溃往往不是因为话术差,而是判断错;不要让大模型逐字生成 JSON,只让它在有限候选里选一个并给出可校准概率。4B 权重开源可本地部署,27B 面向复杂规则,截至 2026-09-29 官网处于免费预览。

基本信息

  • 来源类型:文章(人人都是产品经理 · 作者:甲木,公众号「甲木未来派」)
  • 原文位置:/home/steven/llm-wiki/ai-wiki/raw/articles/2026-10-07-203852-tg-e69ce3.md
  • 原文 URL:https://www.woshipm.com/ai/6472744.html
  • 发布日期:2026-10-01(页面标注 0 评论、1066 浏览、0 收藏、阅读约 20 分钟)
  • 素材来源:Telegram bot 抓取(telegram_msg_id 4311,chat 5415079648),正文由 scripts/http_capture.py 从人人都是产品经理抓取
  • 消化日期:2026-10-07
  • 文章结构:痛点 → 01 判断为什么重要 → 02 从 Jev 到 Instinct → 03 企业怎样放心(五类切入场景 + 三步落地)→ 04 结语与标价

核心观点

  1. 客服机器人挨骂,通常不是因为不会说话,而是判断错了一次。 作者做企业服务落地时,「转人工」是机器人听得最多的一句话。大模型已经能把话说得很漂亮,但用户崩溃点在判断:用户说「耳机用了两天,左耳就没声了」,机器人回复「签收已超 7 天,不支持无理由退货」,而按规则 15 天内的质量问题本该直接换货;用户第三次追问发货、语气已经在冒火,机器人仍在重复物流模板。话说得再漂亮,判断错一次就是一次投诉。一轮普通客服对话背后,系统要做十几次这类判断。

  2. 行业默认做法是「让作家用写作文的方式答选择题」:每做一次判断,就让大模型写一段 JSON。 客服判断的共同点是答案来自有限选项集——查物流、退换货、改地址、开发票还是投诉;签收超 7 天能不能退;是否满足补偿;情绪到了什么程度、有没有提到「曝光」「起诉」;继续由机器人处理、转售后专员还是升级主管;上一句回复有没有越权承诺;下一步查订单、发优惠券还是建工单。它只需要在几个选项里选一个,并说清有多确定。提示词 + JSON 解析「能用」,但进生产环境会反复出现三个问题:慢且贵(高并发下一轮十几个判断,每个都逐字生成文本,延迟和成本叠加)、飘(格式出错、选出不在候选里的答案、同样输入跑两次结果不一样,工程师要写兜底)、以及最致命的——它不知道自己有多确定。

  3. 让生成式大模型「顺便报一个置信度」通常不可用,因为对齐训练带来过度自信。 它多半会自信地报出 0.9 以上,答对时这样,答错时也这样。企业真正需要的是这个数字:九成把握的退款可以自动放行,六成把握必须交给人工复核。没有可信概率就没法设阈值,自动化就只能永远停在「辅助」。作者引 ZooWork 的原话:「准确率决定模型能不能用,校准决定企业敢不敢用。」阈值取决于判断错的代价——发一张五元优惠券和批一笔大额退款不该用同一把尺子。不少项目卡在:测试集平均准确率好看,但没人敢让它自动批退款,因为没人知道它哪一次是在猜。

  4. 决策模型换的是任务形态,不是再换一个更会写 JSON 的大模型。 输入三样东西:当前对话状态、判断问题(业务规则写在问题里)、候选答案;输出只有一样:每个候选的概率。任务定义本身成了输入——同一个模型这次判情绪、下次执行退款规则、再下次选工具,不必为每个任务单独训练分类器;规则改了改的是一段文字,不必重新标注、重新训练。一次前向计算给出全部候选概率,同一段对话上的多个问题可以共享计算。作者用卡尼曼《思考,快与慢》对照:资深客服一眼看出「这单该换货」「这位用户快要投诉了」,靠的多半是系统一(快、凭直觉、几乎不费力),而不是系统二的缓慢推理。

  5. Jev 把「系统一模型」做成了硅谷热词,Instinct 是同一思路在客服场景的开源落地。 2026 年 9 月 15 日,旧金山 TypeSafe AI 结束两年隐身,宣布完成 4000 万美元种子轮,发布首个系统一模型 Jev。创始人是前 OpenAI 研究员、InstructGPT(ChatGPT 技术前身)论文作者之一。Jev 不生成文本,只输出带置信度的决策;TypeSafe 宣称同类任务上比前沿大模型最多快近 200 倍、便宜 400 多倍。发布后数周已被 Vercel、OpenRouter 等接入,LangChain 推出配套集成,社区出现开源评测 jevbench。Jev 目前走托管 API;Instinct 同时提供低于 Jev 的托管 API,并开源 Instinct-4B 权重,支持企业本地部署。开源仓库 github.com/SerendipityOneInc/instinct,Hugging Face huggingface.co/srpone/instinct-tuned-4b。

  6. Instinct 公开三条方案,选型要按判断点而不是按「一个客服模型打天下」。 Instinct Dual 4B 以 Qwen3.5-4B 为基础,分别计算两个候选项顺序再合并,两个顺序可并行,面向成本敏感、响应频繁的意图分流、工单路由、工具选择。Instinct Tuned 4B 经过决策任务后训练和概率校准,单顺序完成判断,面向规则判定、工单分类、情绪分级,也适合作为企业做场景适配的起点。Instinct 27B 以原文所写的 Qwen3.8-27B 为基础,单顺序候选得分读出,并对服务链路做了激进性能优化;在三款方案现有公开题自测中正确率最高,优先用于条款多、上下文复杂的规则判断,以及更看重判断质量的质检和复核。作者明确:上述是选型方向,具体效果仍需用企业自己的业务样本验证。文中另有两处规模表述与产品表不完全一致:智能分流案例写「由 2B 这样的小模型」做第一句话的意图和紧急程度;落地第二步写「高并发分流用 0.5B,常规判定用 4B,复杂规则和质检用 27B」。产品线正文只展开了 Dual 4B、Tuned 4B 和 27B。

  7. JevBench 历史公开 231 道决策题上,Instinct 27B 与 Tuned 4B 和 Jev 1.13.0 几乎打平,但官方综合分不能直接当成标价性价比。 Instinct 27B 答对 202 道,后训练的 Tuned 4B 答对 198 道,Jev 1.13.0 公开逐题记录为 200 道——分别比 Jev 多 2 道、少 2 道。全集上 Jev 的整体决策质量仍领先;Instinct Dual 4B 的校准分与 Jev 接近,但不能把校准分等同于答对能力。两款已测 Instinct 的官方原始 P50 约为 253–260 ms,Jev 为 616.5 ms,低时延是值得关注的特征。综合分的计价方式不对称:官方为两款 Instinct 采用基模参考价格估算成本,并把原始延迟乘以 2,当作 demo 服务承载生产负载的假设;Jev 用标准公开价,延迟不乘该系数。因此官方综合分不能直接代表按 Instinct 当前标价购买时的性价比。

  8. 通用基准只能证明「会判断」,证明不了「懂客服」。 客服数据的脾气是:口语化、错别字多、一句话里夹着好几个诉求、情绪表达含蓄、业务规则全是例外条款。流程里的关键动作恰好可以拆成边界明确的判断:属于哪类诉求、是否满足退换条件、应该调用哪个工具、是否需要转人工。ZooWork 把客服作为 Instinct 的重点落地方向,围绕意图、规则判定、情绪、路由、质检和工具选择做场景适配。接入顺序是:先用历史工单验证,再以影子模式观察(只记录、不执行),把达到业务要求的判断交给模型,不确定的转人工。文中 Ps. 写明:展示的是通用决策评测,客服专项效果以相应业务评测为准。

  9. 先切五类判断,而不是让决策模型包办整个客服。 ① 智能分流:用户第一句话进来,小模型判断意图和紧急程度,决定进哪个流程,这是调用量最大、延迟和成本优势最明显的环节。② 售后规则判定:退换货、补偿、价保规则直接写进问题,规则更新只改文字、不必重新训练。③ 情绪与升级预警:实时判断投诉风险,高风险对话提升优先级、转资深客服。④ 全量质检:过去只能抽检几个百分点,现在可以对每一轮回复做合规判断——是否用了禁用话术、是否越权承诺、是否遗漏必要告知。⑤ Agent 的下一步动作:「下一步调用哪个工具」本身就是选择题,由决策模型选定动作,再交给生成模型组织语言。决策模型不做的三件事:写回复、查数据、开放性题目。

  10. 校准做好了才能分层自动化,而且必须在自己的业务数据上持续监控漂移。 模型说有九成把握时,应该真的有约九成是对的,这叫校准。分层是:高置信直接执行;中置信执行同时进入抽检;低置信交给人。ZooWork 建议不要只看测试集平均准确率,而要在自己的业务数据上检验概率是否可信,上线后持续监控——客服数据会随大促、新品和政策调整漂移,今天校准良好的模型三个月后可能就要重新调整。给想尝试的企业三步:第一步把现有流程里每个判断节点按调用量和出错代价排序,写成「问题 + 候选答案」,规则用自然语言写进问题;第二步选规格,与现有系统并行跑影子模式,对比结果、检查概率分布;第三步先把高置信、低风险判断交给模型自动执行,再逐步扩大,人工复核结果回流为训练和校准数据。

  11. 截至 2026-09-29,官网显示 Instinct 处于免费预览、尚未启用计费,但已公布单价,且所有型号不收输出 token 费。 27B(instinct)每百万输入 token 0.03 美元;4B(instinct-dual-4b、instinct-tuned-4b)每百万输入 token 0.01 美元。想自行部署的开发者从 Hugging Face 上的 Instinct-4B 和 GitHub 仓库入手,用自己的业务数据检验。团队背景:ZooWork 核心成员来自谷歌、阿里巴巴、字节跳动;此前开源的时尚图文检索模型 ZooClaw-FashionSigLIP2 在全部评测中达到同类开源模型最佳,效果超过月下载量超 40 万次的 Marqo-FashionSigLIP。作者收束成一句话:做选择题,就别让大模型写作文。

实操内容保留

本文没有可直接粘贴的代码块或 Prompt 模板。有可执行的选型、标价和三步落地,保留如下。

代码/配置

(本文无代码块或配置文件。公开入口是仓库与模型页,不是安装命令。)

Prompt 模板

(本文无完整 Prompt 模板。任务形态被定义成三段输入,而不是一段生成式提示词。)

输入固定为三样,输出只有每个候选的概率:

  1. 当前的对话状态
  2. 判断问题(业务规则写在问题里)
  3. 候选答案

操作步骤

作者转述的企业落地三步,不要压成一句「先试点」:

  1. 把判断点写成问题。 梳理现有客服流程里的每一个判断节点,按调用量和出错代价排序;每个节点写成「问题 + 候选答案」,业务规则用自然语言写进问题里。
  2. 选好规格,影子模式跑一遍。 原文这一步的规格建议是:高并发分流用 0.5B,常规判定用 4B,复杂规则和质检用 27B。先与现有系统并行,只记录、不执行,对比结果,检查概率分布是否可信。产品线正文给出的对应方向是:意图分流 / 工单路由 / 工具选择从 Dual 4B 开始;规则判定、工单分类、情绪分级用 Tuned 4B;条款多、上下文复杂的规则以及质检复核优先 27B。
  3. 分层上线,闭环迭代。 先把高置信、低风险的判断交给模型自动执行,再逐步扩大范围;人工复核的结果回流为训练和校准数据。

置信度分层(校准做好之后才成立):

  • 高置信:直接执行
  • 中置信:执行,同时进入抽检队列
  • 低置信:交给人

阈值按错判代价分开设:五元优惠券和大额退款不用同一把尺子。

已公布单价(免费预览阶段,截至 2026-09-29 尚未启用计费;所有型号不收输出 token 费):

模型每百万输入 token
27B:instinct0.03 美元
4B:instinct-dual-4b、instinct-tuned-4b0.01 美元

五类优先切入,而不是替换整个客服生成链路:智能分流、售后规则判定、情绪与升级预警、全量质检、Agent 下一步工具选择。明确不做:写回复、查数据、开放性题目。

关键概念

  • Instinct — ZooWork 的客服向决策模型系列:Dual 4B、Tuned 4B、27B,输出候选概率而不是文本
  • ZooWork — 推出 Instinct 的企业 AI 平台;核心团队来自谷歌、阿里、字节,此前开源 ZooClaw-FashionSigLIP2
  • 智能客服 — 本文把客服拆成「生成话术」和「十几次封闭判断」,决策模型只接后者
  • 意图识别 — 五类切入里的第一类:第一句话判断意图和紧急程度,调用量最大
  • Jev / TypeSafe AI — 2026-09-15 发布的系统一模型与 4000 万美元种子轮公司;本文拿它当对照,不把它写成 Instinct 的上游产品
  • 概率校准 — 「说九成把握时大约真有九成对」;没有校准就无法把自动化从辅助推进到可设阈值的执行
  • Qwen3.5-4B / 原文所称 Qwen3.8-27B — Dual/Tuned 4B 与 27B 的基座;27B 基座名称按原文保留

与其他素材的关联

  • 与 2026-09-21-woshipm-jev-fast-judgment-layer 是同一判断层思路的两篇人人都是产品经理文章,但角色不同。那篇把 Jev 放进 Agent 架构:慢思考层(GPT/Claude)负责生成,快判断层(Jev 一类)负责路由、筛选、评分、门禁,并用 fast-jev-compaction 演示「不做摘要、只做保留决策」。这篇不讲上下文压缩,而是把同一「不生成、只输出概率」的接口收束到客服:退换规则、情绪升级、质检、工具选择,并给出可本地部署的 Instinct-4B 和已公布的输入 token 单价。两篇都强调影子模式、用自己的业务样本核对概率段真实正确率、高风险动作不让判断模型单独拍板;这篇把那条工程纪律说成客服话:「准确率决定能不能用,校准决定敢不敢用。」
  • 与 智能客服 已有的 MVP 框架互补:既有页面强调大模型只做 NLU、确定性流程用代码执行;本文进一步把「每轮十几次封闭判断」从生成式 JSON 里拆出来,交给专门输出概率的小模型,生成模型只负责组织语言。
  • 与 企业AI落地 的关系:这是一条「判断点可枚举、错判代价可定价、必须能本地部署」的企业场景,不是通用聊天机器人替换方案。

原文精彩摘录

「转人工」是客服机器人听得最多的一句话。……很多人以为,机器人挨骂是因为不会说话。但随着大模型发展,早已把话说得足够好了。让用户崩溃的,往往是它判断错了。用户说「耳机用了两天,左耳就没声了」,机器人回复「签收已超 7 天,不支持无理由退货」。可按规则,15 天内的质量问题本该直接换货。……话说得再漂亮,判断错一次,就是一次投诉。

一轮普通的客服对话背后,系统要做十几次这样的判断。而目前行业里最常见的做法是:每做一次判断,就让大模型写一段 JSON。这相当于让一位作家,用写作文的方式来答选择题。

第三,也是最致命的:它不知道自己有多确定。让大模型「顺便报一个置信度」,它多半会自信地报出 0.9 以上的数字——答对时是这样,答错时也是这样,对齐训练带来的过度自信,都会让这个数字失真。而企业真正需要的,恰恰是这个数字。九成把握的退款判断可以自动放行,六成把握的必须交给人工复核。没有可信的概率,就没法设阈值;没法设阈值,自动化就只能永远停留在「辅助」。

在 JevBench 历史公开的 231 道决策题上,Instinct 27B 答对 202 道,后训练的 Tuned 4B 答对 198 道;Jev 1.13.0 的公开逐题记录为 200 道。……两款已测 Instinct 的官方原始 P50 约为 253–260 ms,Jev 为 616.5 ms。……当前官方为两款 Instinct 采用基模参考价格估算成本,并将原始延迟乘以 2,作为 demo 服务承载生产负载的假设;Jev 使用其标准公开价,延迟不乘该系数。因此,官方综合分不能直接代表按 Instinct 当前标价购买服务时的性价比。

「准确率决定模型能不能用,校准决定企业敢不敢用。」……不要只看模型在测试集上的平均准确率,而要在自己的业务数据上检验概率是否可信,并在上线后持续监控。客服数据会随着大促、新品和政策调整而漂移,今天校准良好的模型,三个月后可能就需要重新调整。……做选择题,就别让大模型写作文。

相关页面