Claude API 成本优化:Prompt Caching、Effort 设置与 Message Batches 三大省钱招
Anthropic 工程师拆解三大成本浪费:重读前缀、旧模型包袱、高 effort,调整后成本省 80%、准确率破 90%。
基本信息
- 来源类型:网页文章
- 原文位置:raw/articles/2026-09-16-095503-tg-1d7b6d.md
- 原文 URL:https://www.bnext.com.tw/article/92211/claude-api-cost-optimization-prompt-cache-effort-guide
- 消化日期:2026-09-16
核心观点
- Prompt Caching:把不变前缀(system/tools)排最前,API 请求加
cache_control: {"type": "ephemeral"}后,命中率可将写入成本降到 0.1 倍原价(Sonnet 5 最低 1024 token)。 - Prompt Audit:升新模型时先读提示词,删掉“再检查一次”“一定要非常仔细”等旧叮嘱,成本降 14.6%、准确率升 5.3%。
- Effort 设置:简单任务用 low/medium,high effort 反而浪费;Fable 5.1 low effort 成绩接近前代 high effort,费用降 3 倍。
- Message Batches:非实时任务(客服摘要)用批次 API 打包,费用打 5 折 + 快取折扣可叠加。
- 测试验证:同一组固定测试题反复调参,最后用另一组验收,避免过拟合。
实操内容保留
必填节。原文有完整代码示例、配置参数、分步教程。
代码/配置
Prompt Caching 示例(示意,真实请求需替换括号内容):
{
"model": "claude-sonnet-5",
"max_tokens": 4096,
"cache_control": {"type": "ephemeral"},
"tools": [ /* 工具列表 */ ],
"system": "(系统提示,例如产品说明与退换货规则,每次相同)",
"messages": [ /* 用户问题 */ ]
}Effort 示例:
{
"model": "claude-opus-5",
"output_config": {"effort": "medium"}
}Message Batches 适用场景:凌晨批量处理客服对话摘要,1 小时内完成,最慢 24 小时,费用打 5 折。
Prompt 模板
(本文无完整可直接复用的 Prompt 模板,仅有配置示例)
操作步骤
- 把不变内容排最前(tools/system),可变消息放最后。
- 添加
cache_control断点。 - 调
effort:简单任务从 low 开始试。 - 用同一组测试题反复验证,另一组留到最后验收。
关键概念
- Prompt Caching(提示快取) — 复用前缀中间状态,Sonnet 5 最低 1024 token
- Effort — 控制模型推理深度(low/medium/high/xhigh/max),简单任务勿用 high
- Message Batches — 打包 API 请求,非实时任务再省 5 折
- Prompt Audit(提示词审查) — 升模型前删多余叮嘱
与其他素材的关联
(暂无关联素材)
原文精彩摘录
必填。至少 2 段原文摘录,优先保留含关键数据和生动案例的段落。
Anthropic 在客服基准测试中,把同一个应用从 Opus 4.8 高 effort 调整到 Sonnet 5 低 effort,再加任务分流规则,最后准确率从 78.6% 升到 90.5%,成本只剩原本约五分之一。
新模型自己就会推理,这些叮嘱变多余工作。Anthropic 实测,把叮嘱删掉后,同新模型平均成本降 14.6%、准确率升 5.3%。