摘要音频
本节课没有语音摘要。
学习笔记
📝 提示缓存 (Prompt Caching) 学习笔记
核心概念
- 定义与目的: 提示缓存是一种机制,用于存储和重用模型对特定输入(如系统提示或工具定义)的分析结果,从而减少重复计算、降低 API 成本并加快生成速度。
- 缓存阈值: 缓存通常在输入内容超过 1024 个 token 的最小阈值时生效。
- 缓存对象: 开发者应优先缓存那些变化频率低且内容冗长的部分,主要包括:
- 系统提示 (System Prompt)
- 工具模式/工具模式列表 (Tool Schemas)
实现方法
- 修改函数: 在聊天函数 (chat function) 中进行修改,以启用缓存。
- 添加缓存点 (Cache Point):
- 为系统提示添加缓存点,并设置为默认缓存 (default)。
- 为工具列表添加缓存点,并将其作为默认缓存。
- 监控指标: 在响应对象中包含 usage 字段,用于检查缓存状态。
缓存工作流程
- 首次请求 (Cold Start): 当模型首次处理某个输入时,系统会执行分析并将其存储到缓存中 → 观察到 cache write input tokens。
- 后续相同请求 (Warm Cache): 如果在缓存有效期内再次使用完全相同的输入,模型将直接从缓存中读取结果 → 观察到 cache read input tokens。
- 缓存失效 (Expiration): 缓存条目有时间限制(例如 5 分钟),超过时间后会自动清除。
- 内容变更 (Cache Miss):
- 如果系统提示或工具模式发生任何变化,即使只改变了用户消息,系统也会重新进行分析和存储 → 触发 cache write input tokens。
- 如果仅改变用户消息,但系统提示和工具模式不变,仍会触发 cache read input tokens。
总结
- 效益: 缓存系统提示和工具模式(通常长度大于 1024 token)能显著降低生成成本,并提高文本生成速度。
Takeaways
- 提示缓存用于存储和重用模型对特定输入(如系统提示)的分析结果,旨在减少重复计算、降低 API 成本并加快生成速度。
- 缓存应优先应用于变化频率低且内容冗长的部分,主要包括系统提示和工具模式列表,通常在输入超过 1024 个 token 时生效。
- 首次请求会执行分析并写入缓存(cache write),后续使用完全相同的输入则直接从缓存中读取结果(cache read)。
- 只要系统提示或工具模式发生任何变化,即使只改变用户消息,也会触发重新分析和写入缓存(cache write)。
抽认卡 10 张卡片
问题
点击显示 · ←/→
答案
点击翻回
知识检测 0 题
No quiz for this lesson yet.