分诊机制
一种Agent架构中的任务路由策略——像医院分诊台一样,用一个便宜快速的小模型接住所有任务,简单的自己当场处理,真正复杂或拿不准的才升级转交给贵模型处理。
简介
分诊机制(Triage Mechanism)是AI Agent架构中”按场景分模型”原则的具体落地方式。其核心逻辑是:不是所有任务都需要最强模型的推理能力,大量常规确定的任务用便宜小模型就够用,而小模型拿不准的复杂任务才值得升级给贵模型。这个机制在高频调用场景下能节省数量级的Token成本。
核心特征
工作原理
用户任务 → [分诊层(小模型)] → 简单任务 → 直接处理并返回
↓
不确定/复杂任务 → 升级给强模型
分诊判断标准
轻量模型处理的任务:
- 文本分类、意图识别、打标签
- 固定格式的信息抽取
- 简单问答、改写、摘要
- 格式转换(表格↔文字、文字→JSON)
强模型处理的任务:
- 复杂推理、多步逻辑决策
- 高质量代码生成、复杂系统设计
- 长程Agent任务、复杂工具调用编排
- 多模态理解(图/音/视频)
- 高价值、低容错的对外场景
不同素材中的观点
来自 2026-06-17-woshipm-ai-agent-token-60:
- 分诊机制是AD提出四层省Token架构中第二层”按场景分模型”的具体落地形态,类比医院分诊台:便宜快速的小模型当前台接住所有任务,简单的自己当场处理,只有真正复杂、拿不准的才升级给贵模型
- 这个机制在高频调用下,可将模型费用从”全高端套餐”换成”基础+极少专家号”,省下量级差异
- 重要的例外:对小团队来说第一版直接上最贵模型反而是对的,因为初期最大风险不是成本而是员工不信任和弃用——贵模型和便宜模型对小公司的绝对费用差实际很小,但建立信任的价值远大于那几十块钱
与相似概念的区别
- 多模型路由:分诊机制是多模型路由的一种具体实现形态,分诊特指”先分支分诊→分诊升级”的升级路径;多模型路由是更广泛的概念,涵盖各种按任务特征路由到不同模型的策略。
- 风险路由:分诊机制处理的是成本优化维度(便宜 vs 贵),风险路由处理的是安全维度(低风险 vs 高风险)——两者都是分诊路由模式,但分诊维度不同。
实用信息
落地关键问题
- 需要定义一个reliable的”想抄”逻辑——小模型在哪些条件下判断”拿不准”应该升级
- 需要持续监控升级率——升级率过高说明分诊标准失效,过低可能错过了该升级给的任务
- 需要在小模型的latency增加和成本节省之间做权衡——分诊增加了一层额外调用
适用场景
- 面向大量不同复杂度层次的统一Agent入口
- 高频调用场景下模型方案有明显梯队
- 不希望用户感知到不同模型之间的切换(分诊是无感的)