分诊机制

一种Agent架构中的任务路由策略——像医院分诊台一样,用一个便宜快速的小模型接住所有任务,简单的自己当场处理,真正复杂或拿不准的才升级转交给贵模型处理。

简介

分诊机制(Triage Mechanism)是AI Agent架构中”按场景分模型”原则的具体落地方式。其核心逻辑是:不是所有任务都需要最强模型的推理能力,大量常规确定的任务用便宜小模型就够用,而小模型拿不准的复杂任务才值得升级给贵模型。这个机制在高频调用场景下能节省数量级的Token成本。

核心特征

工作原理

用户任务 → [分诊层(小模型)] → 简单任务 → 直接处理并返回
                                    ↓
                            不确定/复杂任务 → 升级给强模型

分诊判断标准

轻量模型处理的任务

  • 文本分类、意图识别、打标签
  • 固定格式的信息抽取
  • 简单问答、改写、摘要
  • 格式转换(表格↔文字、文字→JSON)

强模型处理的任务

  • 复杂推理、多步逻辑决策
  • 高质量代码生成、复杂系统设计
  • 长程Agent任务、复杂工具调用编排
  • 多模态理解(图/音/视频)
  • 高价值、低容错的对外场景

不同素材中的观点

来自 2026-06-17-woshipm-ai-agent-token-60

  • 分诊机制是AD提出四层省Token架构中第二层”按场景分模型”的具体落地形态,类比医院分诊台:便宜快速的小模型当前台接住所有任务,简单的自己当场处理,只有真正复杂、拿不准的才升级给贵模型
  • 这个机制在高频调用下,可将模型费用从”全高端套餐”换成”基础+极少专家号”,省下量级差异
  • 重要的例外:对小团队来说第一版直接上最贵模型反而是对的,因为初期最大风险不是成本而是员工不信任和弃用——贵模型和便宜模型对小公司的绝对费用差实际很小,但建立信任的价值远大于那几十块钱

与相似概念的区别

  • 多模型路由:分诊机制是多模型路由的一种具体实现形态,分诊特指”先分支分诊→分诊升级”的升级路径;多模型路由是更广泛的概念,涵盖各种按任务特征路由到不同模型的策略。
  • 风险路由:分诊机制处理的是成本优化维度(便宜 vs 贵),风险路由处理的是安全维度(低风险 vs 高风险)——两者都是分诊路由模式,但分诊维度不同。

实用信息

落地关键问题

  1. 需要定义一个reliable的”想抄”逻辑——小模型在哪些条件下判断”拿不准”应该升级
  2. 需要持续监控升级率——升级率过高说明分诊标准失效,过低可能错过了该升级给的任务
  3. 需要在小模型的latency增加和成本节省之间做权衡——分诊增加了一层额外调用

适用场景

  • 面向大量不同复杂度层次的统一Agent入口
  • 高频调用场景下模型方案有明显梯队
  • 不希望用户感知到不同模型之间的切换(分诊是无感的)

相关页面