Claude Certified Associate Foundations Prep Course
← 所有课程
课程 03Claude Certified Associate Foundations Prep Course

评估与验证 Claude 的输出

摘要音频

本节课没有语音摘要。

学习笔记

屏幕 1: 评估与验证 Claude 的输出

模块 3 介绍·4 分钟

Claude 为你节省了二十分钟的分析草拟时间。然而,如果那份分析中有一个虚构的数据被发送给客户或监管机构,纠正它所需的时间可能远远超过二十分钟。

这就是专业 AI 使用的核心不对称性:节省的时间是短暂且可见的,而未经验证的错误成本则是巨大且延迟到来的。

这是认证考试中最大的部分,原因在于责任。当你在一份交付物上署名时,你就对其中的每一个主张负责,无论这些内容是你写的还是 Claude 生成的。本模块将赋予你站在 AI 辅助工作背后的纪律。

一位顾问请 Claude 提取支持客户市场规模估算的数据。Claude 返回了五个清晰且自信的数据。其中四个是可靠的,但一个增长率是虚构的,其合理性足以让人不加质疑。这些数据被放入演示文稿,文稿被发送给客户,而客户的内部分析师在会议中指出了这个虚构的数据。

节省的十分钟研究时间换来了信誉受损和一周的重建信任。屏幕上没有任何迹象表明这个数据有问题。这正是本模块旨在解决的问题:错过的错误成本不会在你节省时间时支付,而是在你需要信任的人那里支付。

AI 流畅性框架中的两项能力支撑了本模块。辨别力是批判性地评估输出是否符合要求、来源和标准的技能。勤勉是决定何时需要验证并对结果负责。辨别力是你如何审查;勤勉是你为何必须审查。

本模块结束时,你将能够:

  • 评估 Claude 生成的输出的准确性和完整性。
  • 识别响应中的幻觉、不一致和偏见。
  • 应用事实核查和验证技术。
  • 确定何时需要人工审查或额外验证。
  • 为目标受众编辑、调整、优化和比较输出。
  • 选择适当的输出格式并组织信息以获得最佳结果。

本模块的核心

你对所有借助 Claude 完成的交付物负责。学会系统地评估输出,识别失败模式,将验证融入你的提示,了解何时必须进行人工审查,并选择与任务可靠性要求相匹配的输出格式。

我们设计了这门初级课程模块 3:评估与验证 Claude 的输出,以帮助你利用 Claude 完成实际工作。请将其视为教育内容。它不构成法律、财务或其他专业建议,因此请根据自身情况调整所学内容。我们的产品和服务更新迅速,某些内容可能存在错误或已过时;请记得在 Anthropic 的网站或文档中核实。课程中的示例和场景均为说明性且多为虚构。如果课程材料提到某公司或产品,并不意味着 Anthropic 认可它们,它们认可 Anthropic,或我们之间存在关联。同时请注意,你对 Anthropic 产品和服务的使用受我们的条款、政策和文档约束;如果本课程中的任何内容与之冲突,以它们为准。

---

屏幕 2: 辨别力:评估准确性、完整性和适用性

教授辨别力·12 分钟

评估不是对输出是否看起来良好的感觉。它是基于三个固定参考的检查:你设定的要求、源材料和你所在领域的专业标准。辨别力协议是每次都以相同的方式运行这些检查,因此质量不会因你匆忙与否而受到影响。

三个评估参考

要求。输出是否反映了你的需求?重读你的请求,确认每个部分都得到了处理,而不仅仅是容易的部分。

源材料。如果输出依赖于你提供的文档,它是否与之匹配?将具体主张追溯到源材料,而不是信任 Claude 仔细阅读了它们。

专业标准。这在你的领域中能通过吗?没有单位的数字、没有推理的建议、无法定位的引用。这些即使读起来流畅,也未能达到专业标准。

风险校准

你审查的深度取决于风险,而风险是领域相关的,并非普遍适用。在零容忍的工作中(法律分析、财务数据、合规报告),准确性完全优先于速度,每个主张都需要验证。在低风险的内部头脑风暴中,较轻的审查是合适的。风险在于对两者应用相同的随意审查。在决定审查深度之前,先确定风险。

三方分类

审查后,将每个输出归类为以下三种状态之一,并记录理由:

判决

适用情况

准备使用

符合要求,匹配源材料,通过专业标准。可以发布。

需要修订

接近完成,但存在特定差距。记录差距并进行迭代。

需要人工干预

风险、错误或不确定性意味着不应仅凭 Claude 的草稿发布。需升级至人工处理。

完整性是独立的审查

准确性询问现有内容是否正确。完整性询问是否有任何遗漏。它们是独立失败的:输出可能完全准确,但仍遗漏了影响决策的一个因素。两者都需要审查。缺失的元素比错误的元素更难发现,因为屏幕上没有任何东西会吸引你的注意力。

协议应用于三个真实输出

协议在输出不明显好坏时最为有效。以下是其应用于三个不同判决的示例。

输出 1:竞争对手定价摘要。你要求 Claude 根据你上传的 PDF 总结三家竞争对手的公开定价。摘要清晰且组织良好。运行三个参考:要求已满足(涵盖所有三家竞争对手),但源材料审查失败:一个价格被列为“$40/用户”,而上传的 PDF 显示“$40/用户,最少 10 个席位。”遗漏改变了比较。判决:需要修订。修复方法是重新提示,限制源材料,而非重写。

输出 2:内部流程建议。你要求提供三个减少发票处理时间的选项。输出给出了三个合理的选项及其权衡。要求已满足,无需检查源材料,专业标准已通过,风险低(内部讨论启动器)。判决:准备使用。过度验证此输出会浪费工具节省的时间。

输出 3:合规差距分析。你要求 Claude 将你的数据处理政策与法规进行比较并标记差距。它自信地标记了四个差距。要求似乎已满足,但法规未上传,因此 Claude 基于训练数据回忆了一条可能已更改的规则,且风险涉及监管。判决:需要人工干预。输出是合规专家的有用提示,而非替代品。

相同的协议,三种判决。区别从不在于输出看起来多么完美;而在于三个参考和风险返回的结果。

---

屏幕 3: 幻觉、不一致与偏见

教授失败模式·10 分钟

合理不等于已验证。Claude 无论对错都能流畅写作,因此你不能依赖语气或自信来标记错误。

了解失败的具体特征可以让你快速发现它们,而不是对每一行都保持同等怀疑。

幻觉模式

合理但无支持的声明。听起来合理且符合主题的陈述,但没有来源或事实依据。最危险的类型,因为它看起来没有任何问题。

虚构的具体细节。编造的统计数据、日期、名称、引用或引文。具体性读起来像权威,这正是虚构细节具有说服力的原因。

自信语气掩盖不确定性。Claude 很少根据其实际确定性进行适当的保留。猜测和基于充分事实的陈述都以同样的自信语气呈现。

不一致与偏见

内部矛盾。在长篇输出中,早期的声明可能与后期的声明冲突。长篇文档是矛盾隐藏的地方,因为你很少同时查看整个内容。

框架中的确认偏见。如果你的提示暗示了偏好的答案,Claude 可能会倾向于它。注意那些在你本应真正开放的问题上过于轻易地同意你的输出。

一个常见且匿名的领域模式:一位专业人士请 Claude 比较一批文档并识别差异。输出列出了几个差异,读起来很全面。它错过了这批文件中最重要的文件的差异。完整性失败集中在注意力最低的地方,而对简单文件的自信总结可能掩盖了对困难文件的沉默。

Claude 可能会声称采取了它实际上无法采取的行动,例如“我已将其通过电子邮件发送给你的团队”或“我已保存文件”。在 claude. ai 中,Claude 处理对话、连接的工具和上传的文件;它不会执行未赋予工具的外部操作。在确认发生之前,将任何声称的外部操作视为未验证。

失败模式画廊

以下每种模式都以实际可能出现的方式展示,以便你识别特征而非标签。

提示:“2025 年中型市场 SaaS 公司采用 AI 工具的比例是多少?” 输出:“2025 年,约 63% 的中型市场 SaaS 公司采用了至少一种 AI 工具,高于 2024 年的 41%。”数字精确,趋势合理,但没有来源。精确性是线索。如此具体的真实数字会附带引用;未引用的 63% 是一个数字形状的猜测。

提示:“这条条款在我们州可执行吗?” 输出:四句话的答案,声称其可执行,语气与 Claude 用于算术的自信相同。法律可执行性是特定于司法管辖区且对日期敏感的,正是那种应保留但未保留的主张。自信不是证据。

在一份十页的市场分析中,第二页称可寻址市场“约为 20 亿美元”,第八页基于“26 亿美元市场”构建预测。两者单独读起来都很好。只有当你同时查看整个文档时,矛盾才会显现,这就是为什么长篇输出需要一致性检查,而不仅仅是逐段阅读。

这些输出看起来都没有问题。这正是本课的重点:失败模式的设计,通过流畅生成的性质,使其能够通过随意阅读。你通过了解特征并对照来源检查来捕捉它们,而不是等待某些东西看起来不对劲。

---

屏幕 4: 事实核查与基础技术

教授事实核查与基础·10 分钟

最强的验证是内置在提示中的,在输出存在之前。

一些提示习惯可以从源头减少幻觉,而不是事后捕捉它们,并使剩余内容更容易审核。

允许“我不知道”。明确告诉 Claude,承认不确定性是可以接受的。没有这种许可,模型在压力下更可能用虚构的内容填补空白。

限制到提供的来源。对于文档工作,指示 Claude 仅从你提供的材料中回答,并标记这些材料未涵盖的内容。这将开放式生成转换为有界检索。

要求可审核的引用。要求每个主张的具体来源和位置,以你可以检查的形式。无法追踪的引用不是引用。

先引用,后分析。对于长文档,请 Claude 在得出结论之前提取支持性引用。将分析建立在提取的引用上,使推理和错误都可见。

N 次最佳比较。重新运行相同的请求并进行比较。当运行结果一致时,信心上升;当它们分歧时,你找到了需要人工查看的薄弱点。

对照权威来源验证。对于重要的主张,对照可信的外部参考进行检查,而不是第二个 Claude 响应。产品内辅助工具在此有帮助:Claude for Excel 可以生成单元格级引用,将数字追溯到其输入。

技术作为逐字提示

每种技术都是一个你可以粘贴的短语。措辞就是技能。

允许不知道

“如果答案不受我提供的文档支持,请明确说明,而不是估计。回答‘提供的材料未涵盖此内容’是可以接受的。”

来源限制

“仅使用附上的合同回答。不要使用一般知识。对于合同未涉及的任何内容,将其列在‘本文件未涵盖’下。”

可审核引用

“对于每个主张,引用其来源的章节和条款编号,放在括号中,以便我可以对照来源进行验证。”

引用基础

“在你分析之前,从文档中提取与我问题相关的确切句子。然后仅基于这些引用进行分析。”

在依赖输出之前:我是否允许了不确定性,在适当的情况下限制了来源,要求了可审核的引用,并对照权威来源检查了高风险主张?将这些构建到提示中比事后重建对输出的信任更便宜。

---

屏幕 5: 勤勉:何时必须进行人工审查

教授勤勉·10 分钟

某些输出绝不能仅凭 Claude 的草稿发布,无论它们看起来多么好。

勤勉意味着提前了解这些阈值,以便升级决策是由政策而非在事情已经出错后做出的。

四个风险阈值

阈值

要问什么

风险

如果这是错误的,成本是多少?高成本错误需要人工审查,无论输出看起来多么自信。

可逆性

行动可以撤销吗?不可逆的步骤(发送给客户的交付物、提交的报告)比可以修订的草稿要求更高的标准。

受众

谁会看到它?外部、高管和监管受众将审查要求提高到内部工作草稿之上。

监管暴露

是否有规则、合同或法律对此进行管理?受监管的内容带有 AI 协助无法消除的义务。

不审查不发布的清单

提前决定这些并将其视为固定:

  • 最终客户交付物
  • 审计关键或财务重要计算
  • 涉及受监管、机密或高度敏感数据的任何内容
  • 公共或法律通信,其中错误陈述会带来持久后果

迭代与升级

生产性迭代每轮改进输出。当轮次停止改进时,你面临收益递减,正确的做法不是再次提示;而是寻求人工专家。识别这条线是勤勉的一部分:更多的提示无法制造情况所需的判断。

责任不转移给工具。使用 Claude 完成的工作在你发布时就是你的工作,专业标准与你独立完成的工作相同。勤勉是像事实那样行动的习惯,因为它就是事实。

三个升级场景

快速的“是”。Claude 草拟了一份内部会议议程。风险低,可逆,内部受众,无监管暴露。所有四个阈值都说可以发布。无需升级;这是你可以快速处理的常规情况。

欺骗性的“看起来不错”。Claude 生成了一份董事会财务摘要,读起来很干净。风险高,有高管受众,结果一旦呈现部分不可逆,触发了三个风险阈值。干净的外观无关紧要;这需要人工审查,并通过代码执行重新计算数字。

缓慢的蔓延。你已经迭代了五次客户提案。第三到第五轮几乎没有变化。收益递减加上高风险的外部交付物:停止提示,升级给同事进行新的阅读。升级的信号是改进曲线的平坦,而非可见的错误。

---

屏幕 6: 为目标受众编辑和调整输出

教授为受众编辑·8 分钟

Claude 草拟;你交付。原始草稿与完成交付物之间的差距是编辑过程,这一过程是你应用专业标准和对受众了解的地方。准确的草稿仍未完成。

从原始输出到交付物

三个过程将草稿转化为你愿意署名的内容:

清晰度。削减保留,收紧松散句子,删除任何不必要的内容。Claude 倾向于全面;编辑倾向于精确。

语气。匹配关系与场合的语域。相同的内容对同事、客户和监管者的阅读感受不同。

格式化。根据阅读方式塑造输出:对高管可扫描,对工作团队详细,对外部接收者简洁。

受众校准

一份分析通常需要转化为多个交付物。执行摘要以决策和影响为首。工作团队版本保留细节和方法。外部通信控制披露内容和框架。基本事实保持不变;选择、深度和语气随读者而变化。

编辑前比较输出

当质量重要时,生成多个草稿(跨运行或跨模型),并选择最强的基

抽认卡 0 张卡片

No flashcards for this lesson.

知识检测 0 题

No quiz for this lesson yet.