Claude With Amazon Bedrock
← 所有课程
课程 53Claude With Amazon Bedrock

Prompt caching in action

摘要音频

本节课没有语音摘要。

学习笔记

📝 提示缓存 (Prompt Caching) 学习笔记

核心概念

  • 定义与目的: 提示缓存是一种机制,用于存储和重用模型对特定输入(如系统提示或工具定义)的分析结果,从而减少重复计算、降低 API 成本并加快生成速度。
  • 缓存阈值: 缓存通常在输入内容超过 1024 个 token 的最小阈值时生效。
  • 缓存对象: 开发者应优先缓存那些变化频率低且内容冗长的部分,主要包括:
  • 系统提示 (System Prompt)
  • 工具模式/工具模式列表 (Tool Schemas)

实现方法

  • 修改函数: 在聊天函数 (chat function) 中进行修改,以启用缓存。
  • 添加缓存点 (Cache Point):
  • 为系统提示添加缓存点,并设置为默认缓存 (default)。
  • 为工具列表添加缓存点,并将其作为默认缓存。
  • 监控指标: 在响应对象中包含 usage 字段,用于检查缓存状态。

缓存工作流程

  • 首次请求 (Cold Start): 当模型首次处理某个输入时,系统会执行分析并将其存储到缓存中 → 观察到 cache write input tokens。
  • 后续相同请求 (Warm Cache): 如果在缓存有效期内再次使用完全相同的输入,模型将直接从缓存中读取结果 → 观察到 cache read input tokens。
  • 缓存失效 (Expiration): 缓存条目有时间限制(例如 5 分钟),超过时间后会自动清除。
  • 内容变更 (Cache Miss):
  • 如果系统提示或工具模式发生任何变化,即使只改变了用户消息,系统也会重新进行分析和存储 → 触发 cache write input tokens。
  • 如果仅改变用户消息,但系统提示和工具模式不变,仍会触发 cache read input tokens。

总结

  • 效益: 缓存系统提示和工具模式(通常长度大于 1024 token)能显著降低生成成本,并提高文本生成速度。

Takeaways

  • 提示缓存用于存储和重用模型对特定输入(如系统提示)的分析结果,旨在减少重复计算、降低 API 成本并加快生成速度。
  • 缓存应优先应用于变化频率低且内容冗长的部分,主要包括系统提示和工具模式列表,通常在输入超过 1024 个 token 时生效。
  • 首次请求会执行分析并写入缓存(cache write),后续使用完全相同的输入则直接从缓存中读取结果(cache read)。
  • 只要系统提示或工具模式发生任何变化,即使只改变用户消息,也会触发重新分析和写入缓存(cache write)。
抽认卡 10 张卡片
问题
点击显示 · ←/→
答案
点击翻回
导出到 Anki (.tsv) ↓
知识检测 0 题

No quiz for this lesson yet.