摘要音频
本节课没有语音摘要。
学习笔记
🤖 扩展思考 (Extended Thinking) 学习笔记
一、核心概念与定义
- 扩展思考 (Extended Thinking): 一种高级功能,允许 Claude 在生成最终回复前,先花时间对用户查询进行推理和思考。
- 目的: 帮助 Claude 解决更复杂的问题,提高任务的准确性。
二、权衡 (Trade-offs)
- 优点: 提高复杂任务的准确性。
- 缺点 (成本与性能):
- 成本增加: 思考阶段产生的 Token 也会计费。
- 延迟增加: 思考过程需要时间完成。
三、使用决策 (When to Use)
- 决策依据: 必须依赖提示词评估 (Prompt Evals)。
- 启用时机: 当提示词经过优化后,准确率仍未达到预期时,才应考虑启用扩展思考。
四、技术实现与结构
- 响应结构变化:
- 常规响应: 用户消息 → 助手消息 (包含文本部分)。
- 扩展思考响应: 包含一个新的部分类型——推理内容部分 (Reasoning Content Part)。
- 推理内容部分: 包含 Claude 在思考过程中生成的文本。
- 安全机制:
- 签名 (Signature): 一种加密令牌,用于确保推理内容未被修改。防止开发者篡改思考过程,从而引导 Claude 进入不安全的方向。
- 审查内容 (Redacted Content): 当 Claude 的思考文本被内部安全系统标记时,会返回此字段。它是一种加密形式的思考文本,用于后续对话中提供给 Claude。
五、API 配置要点
- 关键参数:
- thinking: 布尔值 (Boolean),控制是否启用思考。
- thinking_budget: 整数,设置允许 Claude 在思考阶段使用的最大 Token 数量。
- 配置流程: 需要在聊天辅助函数中添加这些参数,并将其传递给模型请求字典。
六、应用测试要点
- 代码兼容性测试: 应用程序必须能够正确处理两种情况:
- 包含完整文本的 Reasoning Content。
- 包含加密的 Redacted Content。
- 强制测试: 可以通过在用户消息中加入特定的“魔法字符串 (Magic String)”来强制 Claude 返回 Redacted Content,用于测试代码的鲁棒性。
💡 核心总结: 扩展思考的启用与否,最终取决于你对应用场景的提示词评估 (Evals)。
Takeaways
- 扩展思考是一种高级功能,允许模型在生成最终回复前进行推理,目的是提高复杂任务的准确性。
- 使用扩展思考的权衡是:准确性提高,但会带来成本增加和延迟增加。
- 启用该功能必须依赖提示词评估,仅在提示词优化后准确率仍未达到预期时才应考虑启用。
- 响应结构会新增“推理内容部分”,并包含签名和审查内容机制,以确保思考过程的安全和不可篡改。
- API通过 thinking (布尔值) 和 thinking_budget (整数) 进行配置,应用测试需兼容完整推理内容和加密的审查内容。
抽认卡 8 张卡片
问题
点击显示 · ←/→
答案
点击翻回
知识检测 0 题
No quiz for this lesson yet.