Instinct
ZooWork 推出的客服向决策模型:不生成回复,只在有限候选上输出概率,让企业能按置信度决定自动执行、抽检还是转人工。
简介
Instinct(直觉)是企业 AI 平台 ZooWork 在 2026 年推向客服场景的决策模型系列。它要解决的不是「客服话术不够像人」,而是一轮对话里十几次封闭判断被做成了生成式 JSON:慢、贵、格式会飘,而且模型报出的 0.9 往往在答错时也同样自信。
它的接口很窄。输入是当前对话状态、把业务规则写进去的判断问题、以及候选答案;输出只有每个候选的概率。同一个权重可以这次判情绪、下次执行退换规则、再下次选工具,规则变更改的是问题文本,不必为每个标签重新训练一个分类器。一次前向计算给出全部候选的概率,同一段对话上的多个问题还可以共享计算。
它和 Jev 同属「系统一」:快、封闭、带置信度,不负责写作。差别是交付方式。Jev 走托管 API;Instinct 同时提供标价低于 Jev 的托管 API,并开源了 4B 权重,企业可以放进自己的环境。作者甲木把它收成一句操作原则:做选择题,就别让大模型写作文。
关键信息
- 类型:模型(决策 / 分类,不是对话生成模型)
- 领域:企业客服里的意图、规则、情绪、路由、质检、工具选择
- 出品:ZooWork
- 开源仓库:https://github.com/SerendipityOneInc/instinct
- Hugging Face:https://huggingface.co/srpone/instinct-tuned-4b
- 定价/开源状态:截至 2026-09-29 官网为免费预览、尚未启用计费;已公布输入单价,所有型号不收输出 token 费。4B 为 0.01 美元/百万输入 token,27B 为 0.03 美元/百万输入 token。4B 权重开源,可本地部署。
- 相关概念:智能客服、意图识别、企业AI落地、Jev(TypeSafe AI 的系统一模型,对照而非上游)
核心特性
三条方案
| 方案 | 基座(按原文) | 计算方式 | 优先场景 |
|---|---|---|---|
| Instinct Dual 4B | Qwen3.5-4B | 两个候选项顺序分别计算再合并,两序可并行 | 成本敏感、调用频繁的意图分流、工单路由、工具选择 |
| Instinct Tuned 4B | 同一 4B 量级,经过决策任务后训练和概率校准 | 单顺序完成判断 | 规则判定、工单分类、情绪分级;也是企业拿自己的样本继续适配的起点 |
| Instinct 27B | 原文写作 Qwen3.8-27B | 单顺序候选得分读出,服务链路做了激进性能优化 | 条款多、上下文复杂的规则,以及更看重判断质量的质检和复核 |
落地步骤里还出现过另外两个规模说法:智能分流案例写「2B 这样的小模型」,第二步写「高并发分流用 0.5B,常规判定用 4B,复杂规则和质检用 27B」。产品说明正文只展开了上面三行。选型时以企业自己的工单样本为准,不要把这三处数字当成同一张已核对的规格表。
工具/模型类必填项
- 安装方式:自行部署从 GitHub 仓库
SerendipityOneInc/instinct和 Hugging Facesrpone/instinct-tuned-4b入手。原文没有给出 pip / vLLM / 显存占用命令,不能把「开源可本地部署」写成已经有一条安装命令。托管调用走 ZooWork 的 API,截至文中日期仍是免费预览。 - 基本用法:把一个判断点写成「问题 + 候选答案」。问题里用自然语言写上业务规则(例如 15 天内质量问题直接换货,而不是签收超 7 天一律拒绝无理由退货)。把当前对话状态一起送入,读回每个候选的概率,再由业务代码按阈值分支。生成回复、查订单、开放问答不交给它。
- 关键参数/配置:真正要调的不是温度,而是置信度阈值,并且阈值按错判代价分开。发一张五元优惠券可以放得比较松;大额退款必须更严。作者给的分层是:高置信直接执行,中置信执行并进入抽检,低置信转人工。
- 适用场景:候选集合封闭、每轮要做很多次、错了能用概率决定要不要人看的客服判断。不适用于写回复、查业务数据和没有标准答案的开放题。
公开题成绩与不能直接拿来比的综合分
JevBench 历史公开的 231 道决策题:Instinct 27B 答对 202,Tuned 4B 答对 198,Jev 1.13.0 的公开逐题记录是 200。全集上 Jev 的整体决策质量仍然领先。Dual 4B 的校准分与 Jev 接近,但校准分不等于答对能力。两款已测 Instinct 的官方原始 P50 约 253–260 ms,Jev 为 616.5 ms。
官方综合分的算法不对称:Instinct 用基模参考价格估算成本,并把原始延迟乘以 2,当作 demo 扛生产负载的假设;Jev 用标准公开价,延迟不乘这个系数。所以这个综合分不能代表「按 Instinct 当前标价买服务」的性价比。文中也写明,展示的是通用决策评测,客服专项效果要以业务评测为准。
不同素材中的观点
- 2026-10-07-woshipm-instinct-cs-decision:甲木未来派把 Instinct 放在企业客服,而不是通用 Agent 压缩。核心论据是耳机质量问题被错判成「超 7 天不可无理由退货」——话术没问题,规则判断错了,一次就是一次投诉。他认为生成式模型顺便报出的置信度因为对齐训练而过度自信,企业需要的是能设阈值的概率。Instinct 的价值被收成两句:准确率决定能不能用,校准决定敢不敢用;做选择题就别让大模型写作文。接入顺序是历史工单验证、影子模式只记录不执行、达标的判断才自动执行。
已有的 Jev 素材 2026-09-21-woshipm-jev-fast-judgment-layer 讲的是同一类接口(不生成、只输出概率、影子模式、高风险不单独拍板),但对象是 Agent 的快判断层和上下文保留决策,不是 Instinct 这个权重。不要把那篇的 fast-jev-compaction 代码当成 Instinct 的用法。
实用信息
- 快速上手:先从现有客服流程里列出判断节点,按调用量和出错代价排序。挑一个封闭、可复核的点(例如是否满足换货条件,或下一句该不该转人工),写成问题和候选,用历史工单对一下概率段里的真实正确率。影子模式跑通之前不要让它自动批退款。
- 五类适合先切的判断:智能分流、售后规则(退换、补偿、价保)、情绪与升级预警、全量质检(禁用话术、越权承诺、必要告知)、Agent 下一步调用哪个工具。工具选定之后,组织语言仍交给生成模型。
- 注意事项:公开榜近乎打平不等于懂你家的例外条款。客服语料口语化、错字多、一句话多个诉求、情绪含蓄。大促、新品和政策变化会让校准漂移,作者建议三个月量级就要重新检查。27B 基座在原文里写作 Qwen3.8-27B,引用时保持这个写法,不要擅自改成别的 Qwen 版本名。