minssam.
Published on

Claude Fable 5.1:缓存读取降价75%,对话中途可修改推理预算

价格不变,缓存成本降至四分之一。以实际运营成本计算,切换到Fable 5.1后,依赖缓存的应用每月账单将明显减少。

Anthropic于2026年9月1日发布了Claude Fable 5.1。正如版本号所示,这是Fable 5的渐进式改进版。然而"渐进式"在这次并不贴切。缓存读取成本降低75%以及per-message effort control这两项变化,对通过API调用Fable的开发者和企业带来了实质性的经济影响。


1. 核心变更1:缓存读取降价75%

提示词缓存(prompt caching)是在重复使用相同系统提示或文档时降低令牌成本的功能。首次调用时支付高成本的"缓存写入"费用,之后的调用只需支付低廉的"缓存读取"费用。

Fable 5中缓存读取为每百万令牌1.00。Fable5.1中为∗∗1.00。Fable 5.1中为**0.25**,恰好是原价的四分之一。

模型输入(基本)输出缓存写入缓存读取
Fable 5$10/M$50/M$12.5/M$1.00/M
Fable 5.1$10/M$50/M$12.5/M$0.25/M

以具体例子说明。假设构建一个将长法律文件作为系统上下文处理多个问题的服务。每天引用100,000令牌的合同1,000次:

  • Fable 5缓存读取成本:0.10×1,000=∗∗0.10×1,000=**100/天**
  • Fable 5.1缓存读取成本:0.025×1,000=∗∗0.025×1,000=**25/天**

按月计算相差$2,250。运营规模越大,这一差距线性增长。


2. 核心变更2:Per-message Effort Control

这是技术上更有趣的变化。从Fable 5.1开始,per-message effort control作为测试版提供。

迄今为止,Claude的推理预算在对话开始时设定,对整个对话固定不变。还有一个更大的问题:**修改推理预算会使提示词缓存失效。**对话中途出现需要更深入思考的问题时提高预算,之前积累的缓存就会消失。

Per-message effort control同时解决这两个问题。

# 第一条消息:快速回答即可
message_1 = {"role": "user", "content": "...", "effort": "low"}

# 第三条消息:需要深度分析
message_3 = {"role": "user", "content": "...", "effort": "high"}

# 提示词缓存保持不变

按消息调整推理深度,同时系统提示和之前的上下文缓存保持不变。

实际应用场景

客户支持代理:简单FAQ问题路由至"low" effort,合同解释或边缘情况路由至"high" effort。同时优化成本和质量。

文档工具:"继续写下一段"使用低effort,"批判性审查本节的逻辑结构"使用高effort。

教育平台:根据学生的理解程度,对同一问题动态提供不同深度的解释。


3. 基础规格:100万令牌上下文与始终开启的自适应思考

Fable 5.1的基础规格与Fable 5相同。

  • 上下文窗口:1,000,000令牌(约75万字)
  • 最大输出:128,000令牌
  • 训练数据截止日期:2026年6月
  • 思考方式:始终开启的自适应思考

性能改进

Fable 5.1报告的具体改进有三点:

  1. 前端代码生成:React、Vue等UI组件生成结果更流畅。
  2. 长推理链的前提条件维持:多步骤推理中,初始设定的前提条件能更稳定地维持到最后。
  3. 自主工作流的工具调用可靠性:代理流水线中工具调用行为更一致。

4. 注意事项:Thinking Block向后兼容性

采用Fable 5.1时需注意一点。

Fable 5.1可以读取之前Claude模型生成的thinking block。但之前的模型无法读取Fable 5.1生成的thinking block。

具有多模型流水线或回退结构的系统需要考虑这一点。


5. 新测试版功能

除per-message effort control外,还新增了两项测试版功能。

Turn-scoped system messages:可设置仅适用于特定消息轮次的系统消息。下一轮次自动恢复原始系统提示。

Updates display mode:模型在工具调用之间以人类可读格式流式传输进度更新。长时间代理任务中,可实时向用户展示"当前正在做什么"。


使用建议

  1. 依赖缓存的服务立即迁移:相同价格、相同性能、缓存读取成本降至四分之一。正在使用Fable 5的话,没有理由不切换到5.1。
  2. 将effort级别分为三档:"low"(简单事实确认、短回答)、"medium"(一般分析)、"high"(深度推理、创意工作)——按此设计消息路由器。
  3. 将长文档放入系统提示进行缓存:不要每次调用都传递参考文档,将其一次性放入系统提示并缓存。充分利用Fable 5.1较低的缓存读取成本。
  4. 用updates mode改善用户体验:为长时间运行的代理添加updates display mode可降低用户流失率,解决"不知道AI在做什么"的常见抱怨。

参考资料:

Claude Fable 5.1:缓存读取降价75%,对话中途可修改推理预算 | MINSSAM.COM