Claude API 定价页面更新:Prompt Caching 缓存读写费用怎么计算
Anthropic 的 Claude API 定价页面用于查询模型调用及相关功能的费用。近期页面价格监控检测到相关文本变化;目前提供的官方材料明确列出了 Prompt Caching(提示词缓存)的计费规则和部分模型的缓存命中倍率。对开发者来说,这些信息尤其关系到系统提示词、固定文档或对话历史会在多个请求中重复发送时,缓存是否能降低成本。
Prompt Caching 的基本思路是保存一部分已经处理过的提示词内容,后续请求再次使用时从缓存读取,而不是每次都按普通输入重新处理。页面所列价格以美元计;MTok 是 million tokens 的缩写,即百万 token。官方也提示,最新价格应以 Claude 定价页面为准。
不同模型的缓存命中倍率
缓存命中是指后续请求成功读取此前保存的内容。官方材料列出的计费倍率,以模型的基础输入价格为参照:
- Claude Fable 5.1 和 Claude Mythos 5.1:缓存命中与缓存刷新按基础输入价格的 0.025 倍计费,也就是 2.5%。页面同时列出这两款模型的缓存命中价格为每百万 token 0.25 美元。
- Claude Opus 5.5:缓存命中与缓存刷新按基础输入价格的 0.05 倍计费,也就是 5%。页面列出的缓存命中价格为每百万 token 0.20 美元。
- 其他模型:采用基础输入价格的 0.1 倍,即 10%。
这些倍率说的是缓存读取或命中费用,不等于模型的常规输入单价,也不能单独代表一次请求的全部成本。所提供的页面材料没有包含完整的模型输入、输出价格表,因此不能据此补出所有模型的基础单价或完整调用费用。
缓存写入、读取分别如何收费
缓存写入费用在内容首次存入时产生;后续请求读取这部分内容时,则产生缓存读取费用。判断缓存能否省钱,需要比较两种情况:不使用缓存时,每次请求都重新支付这段内容的普通输入费用;使用缓存时,先支付写入费用,再为后续读取支付缓存命中费用。
官方给出的常规缓存命中价格是基础输入价格的 10%。按页面说明,5 分钟缓存的写入费用为基础输入价格的 1.25 倍,读取一次后即可达到成本回收条件;1 小时缓存的写入费用为基础输入价格的 2 倍,读取两次后达到回收条件。这里的“回本”是与重复按普通输入价格处理相比较,不代表写入本身免费。
Fable 5.1、Mythos 5.1 和 Opus 5.5 的缓存命中倍率低于常规的 0.1 倍。它们的实际成本还取决于对应模型的基础输入价格以及写入费用,不能只凭命中单价判断整次调用是否划算。
什么时候值得考虑 Prompt Caching
如果多个请求反复包含同一段较长内容,例如固定的系统提示词、产品文档或仍然适用的对话上下文,缓存可以减少重复处理这些输入的费用,也可能降低延迟。反过来,如果内容很少复用,或每次请求都需要大幅改写,那么缓存写入费用未必能由后续读取抵消。
官方提供两种启用方式:自动缓存是在请求顶层添加一个 cache_control 字段,由系统随对话增长自动管理缓存断点;显式缓存断点则把 cache_control 放在具体内容块上,便于精确指定要缓存的内容。官方将自动缓存作为大多数使用场景的推荐起点;需要控制缓存边界时,可以使用显式断点。具体实现方式、支持的模型和代码示例,应参考 Prompt Caching 的实现文档。
核算总费用还要考虑哪些因素
缓存倍率可能与其他价格调整同时生效。页面明确说明,Prompt Caching 的倍率可以与 Batch API 折扣及数据驻留价格调整叠加。因此,核算时应先区分普通输入、输出、缓存写入和缓存读取,再确认是否使用批处理、特定推理区域或其他收费功能。
- Batch API:用于异步处理请求,输入和输出 token 可享受 50% 折扣。页面说明缓存和批处理折扣按标准费率适用于完整上下文窗口;缓存倍率也可与 Batch API 折扣叠加。
- 数据驻留:对 Claude 4.6 及后续模型,使用美国区域推理会对输入、输出、缓存写入和缓存读取等 token 价格应用 1.1 倍倍率。默认的 global 路由按标准价格计费。较早的模型不支持
inference_geo参数,携带该参数会返回 400 错误。 - 调用平台:Anthropic 直连 API、Amazon Bedrock 和 Google Cloud 的计费不能简单视为同一套价格。Bedrock 和 Google Cloud 由相应云平台提供价格信息;Claude Platform on AWS 和 Claude in Microsoft Foundry 则通过各自市场以 Claude Consumption Units(CCU,Claude 消耗单位)计费。
在 Claude Platform on AWS 和 Claude in Microsoft Foundry 中,Anthropic 会根据标准模型与功能价格计算用量,应用可能适用的协商折扣,再按每个 CCU 0.01 美元换算,并按小时向对应市场报告 CCU 用量。因此,使用这些渠道时,账单呈现方式与直接按 token 单价查看并不相同。
如何理解这次页面变化
目前提供的官方页面材料可以确认上述模型缓存倍率、缓存命中单价和计费说明,但没有提供变更前的页面快照,也没有包含完整模型定价表。因而可以说明页面当前列出的规则,不能据此判断这些规则相较旧版具体何时、如何变化,也不能仅凭监控摘要中的价格片段确定其对应的完整输入或输出价格。需要核对某款模型的全部单价或确认历史差异时,应查看官方当前定价页面及可信的历史页面记录。
实际评估时,可先估算同一段内容在缓存有效期内会被重复读取几次,再根据模型对应的写入与命中倍率计算费用;同时把批处理、推理区域和实际调用平台纳入账单估算。这样比较的才是完整请求成本,而不是孤立的一项缓存价格。
原始来源: https://platform.claude.com/docs/en/about-claude/pricing