Claude API 成本优化:Prompt Caching、Effort 设置与 Message Batches 三大省钱招

Anthropic 工程师拆解三大成本浪费:重读前缀、旧模型包袱、高 effort,调整后成本省 80%、准确率破 90%。

基本信息

核心观点

  1. Prompt Caching:把不变前缀(system/tools)排最前,API 请求加 cache_control: {"type": "ephemeral"} 后,命中率可将写入成本降到 0.1 倍原价(Sonnet 5 最低 1024 token)。
  2. Prompt Audit:升新模型时先读提示词,删掉“再检查一次”“一定要非常仔细”等旧叮嘱,成本降 14.6%、准确率升 5.3%。
  3. Effort 设置:简单任务用 low/medium,high effort 反而浪费;Fable 5.1 low effort 成绩接近前代 high effort,费用降 3 倍。
  4. Message Batches:非实时任务(客服摘要)用批次 API 打包,费用打 5 折 + 快取折扣可叠加。
  5. 测试验证:同一组固定测试题反复调参,最后用另一组验收,避免过拟合。

实操内容保留

必填节。原文有完整代码示例、配置参数、分步教程。

代码/配置

Prompt Caching 示例(示意,真实请求需替换括号内容):

{
  "model": "claude-sonnet-5",
  "max_tokens": 4096,
  "cache_control": {"type": "ephemeral"},
  "tools": [ /* 工具列表 */ ],
  "system": "(系统提示,例如产品说明与退换货规则,每次相同)",
  "messages": [ /* 用户问题 */ ]
}

Effort 示例

{
  "model": "claude-opus-5",
  "output_config": {"effort": "medium"}
}

Message Batches 适用场景:凌晨批量处理客服对话摘要,1 小时内完成,最慢 24 小时,费用打 5 折。

Prompt 模板

(本文无完整可直接复用的 Prompt 模板,仅有配置示例)

操作步骤

  1. 把不变内容排最前(tools/system),可变消息放最后。
  2. 添加 cache_control 断点。
  3. effort:简单任务从 low 开始试。
  4. 用同一组测试题反复验证,另一组留到最后验收。

关键概念

  • Prompt Caching(提示快取) — 复用前缀中间状态,Sonnet 5 最低 1024 token
  • Effort — 控制模型推理深度(low/medium/high/xhigh/max),简单任务勿用 high
  • Message Batches — 打包 API 请求,非实时任务再省 5 折
  • Prompt Audit(提示词审查) — 升模型前删多余叮嘱

与其他素材的关联

(暂无关联素材)

原文精彩摘录

必填。至少 2 段原文摘录,优先保留含关键数据和生动案例的段落。

Anthropic 在客服基准测试中,把同一个应用从 Opus 4.8 高 effort 调整到 Sonnet 5 低 effort,再加任务分流规则,最后准确率从 78.6% 升到 90.5%,成本只剩原本约五分之一。

新模型自己就会推理,这些叮嘱变多余工作。Anthropic 实测,把叮嘱删掉后,同新模型平均成本降 14.6%、准确率升 5.3%。

相关页面