Claude Certified Architect Professional Prep Course
← 所有课程
课程 03Claude Certified Architect Professional Prep Course

负责任AI、安全与风险

摘要音频

本节课没有语音摘要。

学习笔记

屏幕1:安全堆栈:各层归属及失效时的应对

定位 模块 2分钟 安全堆栈:各层归属及失效时的应对

前几个模块结束时,我们已构建了一个可操作的生产系统:合作伙伴问题的每一步都分配给了正确的负责人,选择了参考架构和模型,用例规模已确定,评估标准作为验收条件已建立,集成层也已就位,将Claude嵌入企业堆栈中。

本模块将解决一个主要的安全问题:有哪些控制措施可以防止系统拒绝有效请求、产生不公平结果或执行未经批准的操作?安全是一整套控制措施,每项措施覆盖请求路径的不同部分,每项措施都有盲点,需要下一项措施来捕捉。架构师负责放置每项控制措施,并决定其失效时的应对策略。

通过本模块的学习,您将能够:

  • 区分模型训练所减少的风险与应用层仍需强制执行的内容。
  • 在请求路径的适当位置放置输入筛查、输出筛查和工具调用授权,并确定何时使用基于模型的检查与确定性检查,使系统在失效时关闭而非开放。
  • 识别系统中可能出现不公平结果的地方,并为用户、监管者和调试团队定义所需的解释,从而将公平性和透明性融入设计中。
  • 根据信心、可逆性和错误答案的成本,将决策路由给适当的审查者/决策者,从而将审查精力集中在值得关注的决策上。
  • 将每项合规义务映射到命名的控制措施、负责人和证据工件,以便架构能够准确审计。

本模块面向已构建了工作系统的架构师:所有权已分配,架构已选择,评估已建立,Claude已接入企业堆栈。Claude自带广泛的安全行为,但它不了解合作伙伴的数据处理规则、授权模型或领域政策。假设Claude强制执行了从未赋予的规则,是安全设计中最常见的失效方式。

本模块的所有内容都围绕一个背景展开:一个通过了所有架构审查但在生产中仍失败的系统。责任层不完整、被假设或在设计时正确,但在审计时出错。合作伙伴是受监管环境中的企业买家,控制措施在演示中看起来稳固,但在配置漂移或审查者要求提供控制措施运行的证据时,却成为审计发现。

决策映射到以下部分

对齐边界是您划定的界限,区分模型训练已经减少的风险与应用层仍需强制执行的内容。假设训练对齐覆盖了领域政策,则会在每一层中留下未执行的规则。模块从这里开始,因为这会影响每一个后续决策。

护栏放置是您在请求路径上定位输入筛查、输出筛查和工具调用授权的地方,选择每项检查是基于模型还是确定性的,并决定控制措施失效时的行为。路径末端的单一过滤器无法覆盖其他两个点,而失效时开放的控制措施比没有控制措施更糟糕,因为它提供了保护的假象而没有实际功能。

公平性和透明性是您识别系统中可能出现不公平结果的地方,并构建日志记录,以便事后解释任何决策。四个注入点由您来监控。

人工审查路由是您决定哪些决策应由人参与,以及审查者需要什么来完成工作。仅按数量路由会淹没队列,并常常迫使审查简化为批准。值得关注的决策是那些高风险和低信心的决策,而这些风险需要预先识别。

合规控制登记册是每项义务成为已识别的控制措施、责任人和审查者可检查的证据工件的地方。选择合规的入口点是先决条件。没有责任人和活动工件的控制措施可能会在无人察觉的情况下失效,然后在审计期间表现为漏洞。

这些主题相互依存。您在第一节中划定的边界由第二节中的控制措施强制执行,您为公平性构建的日志记录与审查者在第四节中使用的日志记录相同,第五节中的控制登记册依赖于其上每一个已监控的层。最后的累积任务要求您将所有五个部分组装成一个可辩护的部署,这正是本模块为您在面对安全审查员或合规审计员时所准备的。

免责声明 / 教育内容通知

我们构建了本架构师课程模块3:负责任AI、安全与风险,以帮助您使用Claude完成实际工作。请将其视为教育内容。它不构成法律、财务或其他专业建议,因此请将所学内容适应您自己的情况。我们的产品和服务发展迅速,因此某些内容可能包含错误或已过时;请记住在Anthropic的网站或文档中验证。课程中使用的示例和场景是说明性的,通常是虚构的。如果课程材料提到某家公司或产品,并不意味着Anthropic认可它们,它们认可Anthropic,或我们有关联。另请注意,您对Anthropic产品和服务的使用受我们的条款、政策和文档的约束;如果本课程中的任何内容与之冲突,以它们为准。

屏幕2:模型训练强制执行的内容与您负责的内容

教学对齐 11分钟 模型训练强制执行的内容与您负责的内容 之前的工作已经确定了架构、模型和集成。在这里我们回答:在开始添加控制措施之前,模型已经处理了多少安全行为,还有多少需要您来构建?您需要清楚地理解这一边界,以避免创建重复的保护措施或假设模型正在强制执行它从未见过的规则。

Anthropic根据宪法训练Claude:一份书面文件,描述了模型应表现出的价值观和行为,因此模型在部署时已经具备广泛的安全行为。Anthropic会随着时间的推移修订这份文件,最新发布的版本来自2026年1月。该文件在训练期间用于生成模型学习的示例并对候选响应进行排序。这塑造了模型对模糊或敏感请求的响应方式,但不一定能捕捉到不良输出。它为模型在目标冲突时设定了优先级顺序:广泛安全、道德、遵守指南,并真正对操作员和用户有帮助。这个顺序很重要,因为有时有帮助的答案是不安全的。顺序是整体而非严格的,因此当目标冲突时,优先级较高的目标通常优先,尽管模型会综合考虑它们,而不是严格按照顺序应用。模型在您编写任何提示之前已经减少了一类有害输出。内置层处理广泛的通用危害,但不涵盖您的特定领域:任何特定于您的用户和产品的政策仍需您来强制执行。

训练时对齐与推理时控制是两个具有不同目的的层 训练时对齐在部署前塑造模型行为。它通过引导Claude拒绝危险请求并默认选择更安全的响应来减少广泛的危害类别。由于它在任何部署之前就已设定,因此它是通用的。这既是优点也是缺点:它不了解合作伙伴的领域政策、数据处理规则或授权模型。请求可能符合Claude的通用对齐,但仍违反部署特定的规则,例如披露其他客户的订单信息或在批准的脚本之外提供建议。请记住,Claude无法强制执行从未赋予的规则。 部署特定的规则由第二层强制执行:推理时控制。这包括您为部署配置的运行时护栏,例如系统指令、输入和输出检查、工具权限和人工审查门。系统指令塑造模型的行为,但部署特定的政策只有在这些指令与运行时控制(如筛查、授权和审查)配对时才会强制执行。训练时对齐降低了基线风险,推理时控制强制执行特定于您部署的规则。

分层视图:每一层都有其职责和盲点 将安全视为从Claude向外堆叠的四层。每一层都覆盖了下一层无法覆盖的内容,每一层都以下一层必须捕捉的方式失效。 选择每一层以查看其可靠覆盖的内容、未覆盖的内容以及谁负责它。

训练行为 系统提示指令 运行时筛查 授权

它可靠覆盖的内容: 广泛的危害或不安全输出类别,应用于每个请求而无需配置。 它未覆盖的内容: 您的领域政策、您的数据规则、您的授权模型。 负责人: Anthropic。

它可靠覆盖的内容: 角色、语气和声明的约束,引导Claude在一个请求内。 它未覆盖的内容: 任何对抗性或异常输入可以说服Claude的内容,因为指令不是强制执行。 负责人: 架构师。

它可靠覆盖的内容: 检测不允许内容的输入和输出筛查。 它未覆盖的内容: 具有副作用的操作,筛查不授权,以及分类器遗漏的新攻击。 负责人: 架构师。

它可靠覆盖的内容: 在此上下文中,此调用者是否允许执行具有副作用的特定操作。 它未覆盖的内容: 内容质量和公平性。 负责人: 架构师。

成本 · 复杂性 · 风险 成本: 每增加一层都会增加延迟和工程成本。输入预筛查和输出检查为每个请求增加了两次额外调用或规则。 复杂性: 四层意味着四个需要设计、版本控制和测试的地方。如果不加以管理,系统提示和筛查逻辑会独立漂移。 风险: 最危险的失效是无声的:假设Claude强制执行了一个从未赋予的领域规则。由于该规则在任何层中都不存在,因此无法防止违规。

屏幕3:当训练拒绝被误认为是领域政策时

注意对齐 3分钟 当训练拒绝被误认为是领域政策时

设置钩子 您是一位强大的系统架构师。Claude在测试中已经拒绝了广泛的危害请求,因此您假设其训练也涵盖了合作伙伴的数据处理政策。您继续前进,没有构建单独的强制执行层。

事后分析:一个从未在任何层中编码的政策 一个团队为合作伙伴部署了一个内部助手,该合作伙伴的数据处理政策禁止用户访问属于其他业务单位的记录。在审查中,Claude拒绝了团队抛出的每一个危害提示,因此他们假设跨单位披露由相同的安全行为覆盖,从未为其构建授权检查。 在生产中,一个看似正常的领域内请求要求获取一个被禁止的记录。请求中没有任何内容看起来在一般情况下是有害的,因此Claude回答了它。团队认为已执行的规则实际上并不存在。它从未成为Claude训练的一部分,团队也从未在分类器、系统提示或应用控制中编码它,因为他们假设模型已经涵盖了它。

为什么会失败 领域政策与训练对齐混淆了。训练拒绝涵盖广泛的危害,而不是部署特定的规则。任何特定于合作伙伴的规则必须在您构建的层中强制执行。请记住,Claude无法强制执行从未赋予的规则。

屏幕4:分类责任

检查点对齐 3分钟 分类责任 现在试试。您正在审查合作伙伴的Claude助手的安全设计。将每项义务拖入应强制执行它的桶中:要么是Claude的训练行为,要么是应用层。反馈解释了每个义务为何属于该位置。

拒绝帮助合成危险武器 从不返回其他租户的数据 拒绝生成明显仇恨的内容 阻止在合作伙伴批准的脚本之外的建议 在退款发出前需要签字确认

Claude的训练行为

应用层(您负责)

检查答案 暂时跳过

屏幕5:LLM系统的风险、局限性和失效模式

教学护栏 9分钟 LLM系统的风险、局限性和失效模式 您已经放置了控制措施;现在识别它们防御的内容。架构师被期望作为安全交付的一部分,对拟议系统进行风险评估并记录。本屏幕涵盖了LLM系统中反复出现的风险类别,并将其转化为您可以运行的书面评估。

LLM系统中反复出现的风险类别 大多数LLM系统风险都落入一小部分类别。识别这些类别并针对每个类别检查您的设计:

直接提示注入: 用户制作输入,覆盖系统指令并重定向其行为。 间接提示注入: 恶意指令通过检索内容或工具输出到达,模型将其视为可信,而向量输入筛查未捕捉到。 令牌预算耗尽: 过大或恶意填充的输入消耗了上下文或输出预算,截断工作或增加成本。 工具和操作滥用: 模型被诱导调用超出政策的副作用工具,这是操作授权控制旨在阻止的失效。 数据暴露: 敏感字段进入不应出现的上下文窗口或日志,创建了独立于模型行为的泄漏。

系统漏洞评估:寻找位置 一起遍历请求和数据路径。在每个入口点、用户输入、检索内容、工具输出、模型自己的输出和日志中,询问对手可以做什么以及哪个控制措施挡在路上。寻找任何没有控制措施的地方,可能存在合理的攻击。

将风险评估记录为交付物 风险评估应是一个书面工件。对于每个识别的风险,记录类别、受影响的组件、可能性与影响的判断,以及缓解控制措施及其责任人和证据工件。该文件是安全审查员将签署的内容,也是本模块末尾累积练习期望您能够生成的内容。

屏幕6:评估拟议架构中的风险

检查点护栏 4分钟 评估拟议架构中的风险 现在试试。您正在审查一个拟议架构:一个客户支持代理,从合作伙伴知识库中检索答案,并通过连接的工具发出退款,所有活动都写入请求日志。识别此设计中存在的至少三个风险类别,并为每个类别命名一个可行的缓解措施。风险和缓解措施都需要。

识别此设计中存在的风险类别,并为每个类别配对一个缓解措施。

揭示模型答案 暂时跳过

模型答案

  • 通过知识库的间接提示注入。检索内容可以携带指令;缓解措施是将检索文本视为不可信,并筛查工具/内容输入,而不仅仅是用户输入。
  • 退款工具上的工具和操作滥用。缓解措施是在退款工具执行前运行的操作授权检查,独立于模型的输出。
  • 大型知识库文档上的令牌预算耗尽。缓解措施是分块和输入限制,加上预算监控,以便大型文档不会无声地截断工作。
  • 请求日志中的数据暴露。缓解措施是在记录之前对敏感字段进行服务器端脱敏。

屏幕7:放置筛查和授权,使系统安全降级

教学护栏 14分钟 放置筛查和授权,使系统安全降级 筛查请求的控制措施可能以任何依赖项失效的方式失效。它可能超时、返回错误或在负载下无法访问。不同的是,失效的护栏可能看起来仍然健康:当筛查服务出错但仍通过流量时,请求继续流动,而控制措施没有完成其被放置在那里要做的工作。因此,当护栏出错时,系统必须做两件事之一:让其通过或阻止它。如果您没有明确做出选择,周围的代码会为您决定。默认几乎总是让请求通过,这意味着回退到未受保护的路径。围绕模型调用放置重试和断路器的相同推理也适用于此:决定控制措施在失效时的行为,而不是继承任何保持请求流动的行为。

护栏在请求路径中的位置 受保护的请求路径有几个决策点,每个点回答不同的问题。

输入筛查在模型调用之前运行,决定请求是否应到达模型。 输出筛查在响应到达用户之前运行,决定模型生成的内容是否安全返回。 工具调用授权在任何具有副作用的操作之前运行,例如发送电子邮件、写入数据库或发出退款,并确定此调用者在此上下文中是否允许执行此操作。

因为它们位于不同的点并检查不同的内容,一个控制措施在一个地方对其他地方没有任何作用,这就是为什么单一过滤器无法覆盖整个路径。

每个检查的适用位置:基于模型与确定性按决策点 决策点 当需要基于模型的检查时,确定性检查更好时

输入筛查(在模型调用之前) 意图模糊,您正在捕捉无法用规则详尽捕获的越狱或提示注入模式。轻量级模型对输入进行分类。规则明确且定义清晰:黑名单、正则表达式、长度或格式检查。它更快、可预测,并且无法被说服改变其决定。 输出筛查(在响应到达用户之前) 您正在评估需要语言理解的毒性或政策合规性等质量。法官模型对输出进行评分。您正在检查已知字符串、禁止字段或模式验证器可以确定捕捉的模式违规。 工具调用授权(在任何副作用操作之前) 很少。授权应是确定性的,以便可审计。几乎总是:允许操作的允许列表、身份检查和范围验证。授权必须是您可以证明和重放的决策,因此必须是确定性的。

为什么基于模型和确定性检查以不同方式失效,以及为什么您将它们串联 基于模型的分类器可能被规避:用户可以通过一种方式表达输入,绕过即使是最强大的法官模型。确定性规则是脆弱的:它仅阻止其编程检测的内容,不多不少。它遗漏了任何未预料到的内容,并过度阻止任何类似于受限模式的内容。没有控制措施可以捕捉一切,因此这些控制措施串联部署。识别每个控制措施遗漏的内容,确保每个间隙被不同的控制措施有意覆盖,而不是留下开放。

第二个注入向量:通过检索内容和工具输出到达的指令 用户输入筛查捕捉用户直接发送的指令。它不捕捉系统检索或从工具接收的内容中嵌入的指令。在RAG系统中,检索文档中的恶意指令在输入筛查已经通过请求后到达模型。在代理系统中,工具响应可以携带模型视为权威的指令。这是具有检索或工具使用的企业部署中的主要注入向量,它需要一个单独的控制措施:在检索内容和工具输出附加到模型的上下文之前对其进行筛查,使用与用户输入相同的基于模型的分类器。盲点不同,因为来源不同;在控制设计中明确识别它以确保覆盖。

在API上,当流式分类器干预时,响应返回拒绝。Messages API将此报告为stop_reason: "refusal" 并附带一个stop_details对象(自Claude Opus 4. 7起可用)。该对象携带一个策略类别以及可读的解释;当拒绝未映射到命名类别时,这两个字段为空。类别集在platform. claude. com上的stop-reasons文档中枚举。截至撰写本文时,它包括cyber、bio、frontier_llm和reasoning_extraction。在发布时重新检查列表,而不是硬编码。您的应用程序应读取类别并相应地路由不同的拒绝类,而不是将每个拒绝视为单一、未区分的事件。在不返回stop_details的模型上,您的处理程序必须容忍缺失的对象并回退到通用处理。在发布时验证当前模型支持,请访问platform. claude. com。作为规则,一旦收到拒绝,在继续之前重置对话上下文:删除或重新表述触发拒绝的回合,或清除历史记录。在同一拒绝上下文中发送下一个请求会返回进一步的拒绝。

失效开放与失效关闭:您的护栏层在失效时的行为 当操作员构建的分类器在负载下出错,或操作员构建的筛查服务无法访问时,应用程序会做两件事之一。它可以失效开放并通过未筛查的流量,或者失效关闭并阻止任何额外操作,直到控制措施恢复健康。选择权在您作为架构师手中;这些是您的团队构建、托管和配置的组件。它们与Anthropic的内置模型安全控制措施分开,后者不可操作员配置,也不会失效开放。操作员构建的护栏在出错时无声地通过流量,比阻止流量的护栏更糟糕,因为它让您有控制的安慰,而没有提供任何保护。这与生产工作中的断路器推理相同:当堆栈中的依赖项失效时,根据情况有意降级。

完整的受保护请求路径,作为一个系统 请求按顺序通过路径:它到达,输入筛查决定它是否到达模型,模型生成响应,输出筛查决定是否返回该响应,模型发出的任何工具调用在运行前通过授权。每个门可以通过、阻止或失效,每个失效都解析为您选择的方向。每个被阻止或失效的门都被记录,以便可以从记录中重建事件。

完整的受保护请求路径 用户请求 → 输入筛查(基于模型用于模糊意图,确定性用于定义规则,设置为失效关闭) → 模型调用 → 输出筛查(法官模型或验证器,设置为失效关闭) → 工具调用授权(确定性允许列表加身份和范围)在任何副作用操作之前 → 响应给用户,每个被阻止或失效的门都被记录以供后续重建

技能供应链安全 您可能会在实地听到以下反对意见:“技能是一个黑匣子。在它运行之前,我无法看到其中的所有内容,那么我该如何信任它?”架构师的工作是构建一个控制措施来弥补这一点。 提醒一下,技能是可重用、可分发的代码与指令集配对,捆绑在一起并放入您的环境中。这种分发模式使其成为供应链风险。不受信任的技能可能携带代码执行漏洞:在调用时运行命令、访问网络或触摸文件的逻辑。这是有风险的,因为技能可能包含您的输入过滤器和提示筛查无法看到的隐藏恶意指令;这些监视对话,但威胁已在上游的技能包中烘焙。输出监控可能会在事后捕捉到下游效果,但到那时代码已经运行。 因此,防御必须更早地在链中移动。在您可以信任并调用技能之前,您需要对其进行审计:打开包并阅读两件事。首先,寻找异常调用:网络请求、shell执行、文件系统访问、凭据读取。其次,超出范围的操作:与其声称执行的工作不匹配的行为。一个格式化技能打电话回家是超出范围的;一个总结器写入磁盘是超出范围的。技能的既定目的应是您的审计基线,任何超出它的内容都是您应调查的发现。 您的审计告诉您包中的内容;通过审查的技能仍然可以在运行时获取从未在您阅读的包中的代码。这就是为什么门需要一个网。以最小权限运行技能,并在沙箱中运行,给予它们有限的文件访问、有限的网络、没有它们不需要的常驻凭据。审计决定什么可以进入;运行时限制在审计遗漏时包含它。您应同时使用两者,因为没有单一控制措施可以在没有另一个的情况下完美工作。 您还应考虑技能允许来自何处;仅信任来自经过审查的内部注册表、经过验证的发布者、仅签名发布的技能。受信任来源政策缩小了您必须审计的表面,并在未信任的包到达审查之前阻止它们。一条坦诚的规则始终适用:不要假设平台为您筛查技能。验证实际存在的自动审查;阅读文档,确认任何扫描的范围,找出它捕捉和不捕捉的内容。 每次审计必须以明确记录的裁决结束:批准、拒绝或修复。批准意味着它是干净的并获准使用。拒绝意味着它不进入环境。修复意味着您找到了可修复的问题;在这种情况下,剥离违规调用,沙箱操作,固定更安全的版本,然后重新审计。即使您可能永远看不到技能可以做的所有事情,审计裁决和受信任来源政策是让您负责任行事的补偿控制。

成本 · 复杂性 · 风险 成本: 每个筛查点为每个请求增加一次调用或规则评估。输出上的法官模型大致使该回合的模型成本翻倍。 复杂性: 三个控制点,每个点都有一个检查类型、失效方向和日志行,比单一过滤器要构建和测试的内容多得多。 风险: 失效开放是代价高昂的错误:系统负载不足会悄悄降低保护,同时仍然看起来受保护,因此漏洞仅在事件中显现。此风险不适用于Anthropic的API级控制,后者超出您的配置。它仅适用于您的团队构建和操作的组件。

屏幕8:当单一输出过滤器看起来像完成设计时

注意护栏 4分钟 当单一输出过滤器看起来像完成设计时

设置钩子 输出过滤是一个清晰的控制措施,您可以指向它;它在架构图上显示为一个干净的框,它在审查者可以观看的地方触发,它位于路径的末端,风险感觉最具体,就在用户看到响应之前。因此,如果您在输出上添加一个分类器,图表看起来完整,审查通过。问题是,系统做的最重要的事情可能在该分类器运行之前就已经发生了。

跟踪摘录,其中副作用工具在检查请求之前运行 模型收到一个请求,调用了一个发出退款的工具,工具运行了。退款是一个财务操作:工具逆转一笔费用并将钱从公司返回到客户的账户。只有在钱移动后,输出过滤器才查看任何内容。它检查了模型生成的文本,没有发现不安全的内容,然后通过了。退款已经发生了。控制措施可以位于此路径上的三个地方:在进入时筛查请求,在执行前授权工具调用,并在输出时过滤响应。该系统只有最后一个,并且它位于路径上唯一无法撤销的操作的下游。

客户服务代理有权访问issue_refund工具。用户提交请求。 1 请求接收(未配置输入筛查) 2 模型发出tool_use: issue_refund(order=…) 3 工具执行,退款发出(在副作用之前没有授权门) 4 输出过滤器检查生成的文本(它通过,因为它描述的操作已经发生)

为什么会失败 控制措施被放置在一个点,但被视为覆盖了三个点。输出筛查判断文本,而不是操作。具有副作用的工具需要授权才能运行,未筛查的输入没有门。路径末端的一个过滤器不是受保护的路径,您应在必要时添加所有三个过滤器。

屏幕9:在路径上放置控制措施

检查点护栏 4分钟 在路径上放置控制措施 现在试试。您被给予四个控制措施。每个控制措施回答两个问题:它在请求路径上的位置,以及它是什么类型的检查。将每个控制措施拖到网格上。水平轴是放置点,从输入筛查到工具运行前的操作授权,再到输出过滤。垂直轴是确定性检查还是基于模型的检查适合。正确放置揭示了推理。并非每个区域都会被填充,两个单元格将保持空。

**A. 越狱和提示注入筛查** **B. 用户消息上的禁止术语黑名单** **C. 生成响应上的毒性法官** **D. 工具运行前的退款授权政策检查**

基于模型 确定性

输入筛查

输出筛查

操作授权

检查答案 暂时跳过

屏幕10:不平等结果的进入点,以及系统必须解释的内容

教学公平性 11分钟 不平等结果的进入点,以及系统必须解释的内容 运行时控制阻止不允许的输出离开系统,确保用户永远不会看到它们。然而,运行时控制不考虑技术上通过所有检查但为不同人产生不同结果的输出。这种失败更难检测和归因,因为表面上它看起来像一个正常的输出。

不平等结果在可识别的点进入 一旦您停止将公平性视为模型的单一属性,并开始将其视为在特定、可识别的点进入的内容,公平性设计就变得更容易。在Claude系统中,有四个常见的进入点:

检索语料库 可能过度代表或不足代表某些群体,因此模型看到的上下文已经倾斜。 提示的框架 可以编码一个假设,将结果推向一个方向。 少样本提示中使用的示例 可以携带与语料库相同的倾斜。 下游路由,模型输出生成后发生的事情,可以将某些群体引导到不同的路径。

这些是您可以检查的注入点,这就是公平性成为真正架构属性的原因。

谁询问决定了系统解释的内容

受众 他们需要什么 这要求您捕捉什么

受影响的用户 明确解释为什么影响他们的决策被做出或以他们可以采取行动的术语表达。驱动决策的输入以及结果达成的原因,以可消化的形式。 监管者 证据表明系统以一致的方式处理可比案例,并且可以按需重建特定决策。持久、可查询的输入、输出和决策路径记录。 构建团队 足够详细的细节,以找出标记决策出错的原因并修复它。完整跟踪:提示、检索上下文、模型输出和每个路由步骤,与现有可观察性绑定。

决策日志记录使这些解释成为可能 要重放和解释单个决策,捕捉驱动它的输入、检索上下文、模型输出和它经过的路由。这是生产工作中相同的可观察性工具,应用于不同的问题。这次,我们不是问系统是否健康,而是问为什么特定决策发生了。工具是相同的,但保留和查询路径不同。

公平性和透明性检查清单在行动中 考虑一个信用决策支持系统。审查检查清单一次,标准就不再抽象:

四个进入点中哪一个可能扭曲此结果,每个是否已监控? 对于不利决策,您能否以申请人可以采取行动的术语提供输入和原因? 如果监管者询问类似申请人是否被一致对待,您能否查询日志并提供答案? 您的团队能否为任何标记决策提取完整跟踪?

任何地方的“否”都是设计漏洞。

辨别力:判断输出的不平等对待 辨别力是四项AI流畅性能力之一:评估AI输出和行为。在实践中,它意味着判断模型输出是否可接受、需要修订或需要覆盖,而不是接受它。应用于公平性,辨别力是让审查者识别倾斜或不合理结果的能力,而不仅仅是确认产生了值。透明性记录是使这种识别成为可能的基础。

成本 · 复杂性 · 风险 成本: 在每个请求上捕捉和保留决策级日志增加了存储和查询路径,成本随流量增长而不是保持固定。 复杂性: 监控四个进入点并为三个受众服务比单一审计日志更多的设计工作,因为每个受众需要同一记录的不同切片。除此之外,保留政策现在必须受到管理,因为您将决策级数据保留更长时间并用于特定目的。 风险: 总体结果指标可能看起来很好,而危害集中在某个子组中。未记录或未测量的注入点可以隐藏不公平性,直到团队外的人发现它。 数据处理: 决策日志本身在合规登记册的范围内。在HIPAA或GDPR上下文中,记录的输入和检索上下文包含敏感个人数据。对日志应用最小化、保留限制和访问控制,并将其作为命名控制映射到您的合规登记册中。为透明性记录一切和为合规性固定数据并不冲突,因为它们需要相同的日志,管理方式不同。

屏幕11:当公平性被视为模型提供商的问题时

注意公平性 3分钟 当公平性被视为模型提供商的问题时

设置钩子 公平性可能被视为模型的属性。模型提供商训练了它,运行了偏见评估,并发布了结果,因此将公平性视为在模型到达您的架构之前上游处理的内容似乎是合理的。这种框架在您的系统将模型与您自己的检索语料库配对之前是成立的,因为过度代表某些案例的语料库会产生模型提供商从未测试且无法看到的不平等结果。

事后审查 这种失效模式值得早期识别;团队做出了一个合理的假设,但最终是错误的。他们使用了一个通过公平性评估的模型,倾斜进入了一个他们没有想到要监控的点。以下是一位架构师在事后审查中描述的漏洞。 “我们假设公平性是模型的工作。倾斜在我们的检索语料库中,我们记录的很少,以至于我们无法证明它。” 不平等结果并非来自模型的训练。相反,它们来自一个过度代表某些案例的语料库,团队从未监控的注入点,因为他们将公平性分配给了供应商。当结果受到质疑时,团队没有决策级日志来重建发生了什么。他们既无法解释系统做出的具体决策,也无法排除语料库作为原因,这使他们无法回答监管者唯一的问题:倾斜来自哪里?

为什么会失败 公平性被视为供应商拥有的模型属性。不平等结果在架构师控制的点进入,检索语料库是其中之一。没有在这些点进行决策日志记录,团队无法解释危害或证明其来源。公平性和可解释性是架构要求。在倾斜可能进入的点进行监控。假设它们随模型到达会留下这些点未监控。

屏幕12:批评决策日志设计

检查点公平性 3分钟 批评决策日志设计 现在试试。您正在查看决策支持流的系统草图。点击透明性缺失或不足的组件,例如从未记录的路由步骤或无法重建的决策。每次点击都会揭示该漏洞对受影响用户或监管者的意义。 选择所有漏洞。保留充分记录的组件未选择。

漏洞 一个路由步骤,将某些案例发送到不同路径,没有日志条目。

漏洞 一个检索步骤,其返回的上下文未被捕捉。

漏洞 一个模型输出,未存储产生它的输入。

充分 输入、输出和路由都被记录并与会话ID绑定。

充分 日志可按决策查询并保留90天。

漏洞 一个聚合准确性仪表板,没有按子组细分。

检查答案 暂时跳过

屏幕13:按风险而非数量路由决策给人

教学审查路由 10分钟 按风险而非数量路由决策给人 决策日志记录为您提供了每个自动化决策的依据:它看到的输入、它采取的路径和它产生的输出。记录的决策可以在事后解释,但日志本身并不决定哪些决策在生效前应由人参与。日志在事后解释决策。路由规则阻止错误的决策生效。您将确定哪些决策值得人工审查步骤,以及审查者必须在屏幕上看到什么以快速做出决定。您已经构建的日志是该视图的原始材料,因此这是决定何时从其中浮现什么的问题,而不是从头开始再次监控系统。

什么设定决策的风险 将人工审查视为预算:您有有限的审查者注意力,必须将其集中在最高风险的项目上。以下变量共同设定决策的风险。

可逆性 是错误决策可以撤销的容易程度。 错误决策的成本 是错误决策如果未纠正会造成的后果。这两者设定了决策的风险:难以撤销且错误时成本高的选择是高风险的,无论系统如何到达它。 信心 是位于其他两个变量之上的第三个变量。它是系统关于其输出的分数,仅在它被校准时有用,因为模型可能自信地错误。信心不改变决策的风险;它估计此输出错误的可能性,告诉您应将多少数量路由给人进行审查。

将这些变量组合成一个规则:当决策低信心且不可逆或高成本时,将其路由给人;让自信、可逆、低成本的决策通过。自信、易于撤销、低成本的决策通常可以在没有人工的情况下运行。低信心、不可逆、高成本的决策几乎总是需要人工审查。 消耗您审查预算的决策是这些变量不一致的决策。一个案例可能成本高但易于撤销,或低信心但易于撤销。当它们冲突时,给予成本和可逆性更大的权重,因为它们决定了错误的后果。让信心决定您可以安全地让多少高风险数量通过未经审查。路由信心携带一个值得识别的假设:信心信号必须被校准,规则才能成立,确认该校准是一个独立的任务。

人坐在哪里是安全与速度之间的权衡 一旦决策路由给人,您选择他们在流程中的位置。更早地涉及人更安全但更慢。

放置 它给您什么 它花费什么

操作前批准 操作在获得人批准之前无法生效,因此没有不可逆的事情未经审查发生。它为每个路由的决策增加了延迟,并且必须有可用的人,因此它无法扩展到高数量。 操作后审计 操作立即运行,人在事后审查,因此吞吐量保持高。错误操作在被捕捉时已经生效,因此它仅适用于可逆、较低成本的决策。 抽样审查 一部分决策被审查以监控质量,而不减慢整体流程。错误决策可能未被抽样,它监控系统而不是保护个别结果。

审查者看到什么决定审查是否准确 审查者如果无法看到决策为何进入他们的队列,可能会在没有审查的情况下批准。确保您的审查者有三件事:驱动决策的输入、模型的输出以及它被标记的原因。没有这个原因,他们无法区分边缘案例和常规流量。没有输入,他们无法判断输出是否正确。您放在审查者面前的内容决定了审查是否准确。

Anthropic关于代理自主性的研究发现,要求每个操作都签字会增加摩擦而没有有意义的安全增益。更好的方法是让人监控正在发生的事情并在需要时介入。Anthropic在代理工作流中的一个模式是减少每步批准,并将审查移动到更高价值的检查点,如计划审查或异常处理,以避免同意疲劳;确切的审查设计取决于工作流的风险。没有这种辨别力,同意疲劳可能会发生。同意疲劳是当系统连续数十次请求批准时,审查者开始点击并批准项目而不阅读或提供所需的审查质量。这种模式导致了Claude Code中的计划级审查,人批准计划而不是每个步骤。在发布时验证当前框架,请访问anthropic. com/research/measuring-agent-autonomy和anthropic. com/research/trustworthy-agents。

勤奋:人工审查背后的能力 勤奋是四项AI流畅性能力之一:确保负责任的AI协作。应用于部署,它意味着维护明确的人工责任检查点,识别自动化压力何时侵蚀监督,并审计工作流中的漏洞,特别是在自动化扩展时,AI在没有审查的情况下行动。 对于代理工作流,路由规则成为一个检查点模式:一个门,根据任务的风险和可逆性暂停执行以进行人工审查。在任何代理将自主采取的不可逆或高风险操作之前放置一个门,并抽样较低风险的操作,而不是为每个操作设置门。这是多代理设计依赖的相同门词汇。

成本 · 复杂性 · 风险 成本: 操作前审查为每个路由的决策增加了延迟,并需要审查者时间,这是一个持续的运营成本。 复杂性: 路由逻辑、显示输入和标记原因的审查者界面,以及三个放置路径比单一审查队列更复杂。 风险: 按数量而非风险路由要么压倒审查者并风险审查质量下降,要么允许高风险、不可逆的操作完全没有门。

屏幕14:当将所有内容路由到审查使审查变得无意义时

注意审查路由 3分钟 当将所有内容路由到审查使审查变得无意义时

设置钩子 决定哪些决策算作高风险需要判断,将所有内容发送到审查消除了这一关键步骤。它可能感觉像是保守的默认值:它很容易向合规审查员或审计员辩护,并且不需要关于风险在哪里的判断。将所有内容路由感觉像是安全的答案,正是因为它让您免于划清界限。

一个草率审查的交接简短记录 审查者的队列很少被看到,直到它失败。以下模式显示了当系统将每个输出路由给人并给审查者没有任何审查依据时会发生什么。两件独立的事情同时出错,对话揭示了这两点:数量超过任何人可以阅读的内容,每个项目到达时都剥离了让审查者判断它的上下文。

审查者: 今天我的队列中有四百个项目。和昨天一样。 领导: 你在每个项目上阅读输入吗? 审查者: 不可能。我得到输出和一个批准按钮,仅此而已。我甚至看不到输入,或为什么这个项目落在我这里。一小时后,我不得不点击批准以跟上节奏。

设计将所有输出发送到审查,并给审查者仅输出,没有输入和标记原因。数量使仔细审查变得不可能,缺失的上下文使其变得毫无意义,因此审查简化为批准。高风险决策在该队列中得到了与琐碎决策相同的例行批准。

为什么会失败 两个独立的失败在这里叠加,任何一个单独都足以导致审查变得草率。 第一个是数量。 当路由给人的项目数量超过他们在可用时间内可以阅读的内容时,覆盖一切的监督什么也不审查,因为审查者为了跟上而脱离。修复是路由规则:按风险将决策发送给人,使用信心、可逆性和成本,使队列仅包含值得关注的决策,而不是所有决策。 第二个是缺失的上下文。 审查者如果只看到输出和批准按钮,就没有任何检查输出的依据,因此即使是短队列也很难准确判断。修复是改变审查者视图中的内容:浮现决策所依据的输入和项目被标记的原因,以便审查者可以看到他们被要求权衡的内容。 如果您只修复其中一个失败,审查仍然可能失败。 没有上下文的小队列和淹没在数量下的良好构建的审查者视图都会失败。

屏幕15:构建审查路由规则

检查点审查路由 3分钟 构建审查路由规则 现在试试。一个路由规则有三个控制:信心阈值、错误答案的成本和可逆性设置。目标是按风险将高风险、低信心的决策路由给人,同时保持审查队列在审查者上限以下。选择同时满足这两个目标的规则。

**A. 将所有低于高信心阈值的决策路由到审查,无论风险如何。** **B. 将低信心且不可逆或高成本的决策路由到操作前审查;让自信、可逆、低成本的决策通过。** **C. 仅按信心路由,设置足够低以保持队列小。** **D. 将所有决策发送到审查以确保安全。**

现在完成此步骤:用1-2句话命名单一决定控制,什么使低信心案例即使在信心在容忍范围内仍然路由给人?

揭示模型答案

模型答案 可逆性和错误答案的成本是决定控制,而不是信心。信心过滤您路由的数量,但它不改变决策的风险。一个案例可能自信,但如果它不可逆或高成本到足以值得,仍然路由给人。

标记完成

暂时跳过

屏幕16:将每项合规义务转化为有证据的控制措施

教学合规 10分钟 将每项合规义务转化为有证据的控制措施 集成模型的合规层使用治理义务作为预过滤器:HIPAA、GDPR、FedRAMP、律师-客户特权或数据驻留政策在成本或工程偏好进入对话之前,每个都决定了交付路线和入口点的进出。这项工作使您到达一个生存义务的入口点和路线,但下一步更窄且更难。每个生存的义务现在必须成为有责任人的控制措施。审查员不会将单独的合规入口点视为规则被遵循的证明。他们还询问谁负责控制措施以及什么证据表明它在实践中有效。

法规陈述结果,但您提供控制措施和其运行的证明 框架如GDPR、HIPAA和FedRAMP陈述结果,而不是实现。它们说明什么必须为真:受保护的数据必须以某种方式处理,访问必须被控制,处理必须在授权环境中进行,但它们将技术控制留给您。每项义务成为您拥有的三件事:实现结果的具体技术控制、负责它的责任人和显示其有效的证据工件。始终记住包括证据工件;这是审查员将检查的内容,也是最常遗漏的。

将义务映射到控制措施、责任人和证据 义务(框架) 技术控制 审查员接受的证据 责任人

受保护的健康数据在协议下处理(HIPAA) 仅使用HIPAA-ready企业计划或由签署的商业伙伴协议(BAA)覆盖的第一方API配置,启用HIPAA合规性并仅限范围内功能。签署的BAA和显示HIPAA合规性启用的管理设置,加上范围内功能列表。安全负责人 美国政府工作负载在所需影响级别(FedRAMP) 通过Anthropic记录的有授权路线交付,满足所需影响级别,而不是非授权入口点。所选路线的授权记录和确认工作负载仅在其上运行。平台负责人 数据在批准区域处理和存储(数据驻留) 配置支持的地区处理和存储为批准区域,并验证日志、缓存、监控和保留路径是否保持在批准边界内。驻留配置和显示每个副本所在位置的数据流记录。数据负责人 决策可按需重建(透明性,跨框架) 公平性集群中构建的决策日志记录,保留并可按所需期间查询。从实时日志中重建一个决策的示例。架构师

训练使用与保留,两个不同的声明 不要将训练使用和保留合并为同一声明:数据可能默认排除在模型训练之外,但仍保留或监控用于日志记录、滥用预防、法律合规或配置的审计目的。

证据工件使交接有效 集成工作中的约束消除推理在这里延续。那时您消除了无法生存约束的交付路线。现在您记录每项义务,满足它的控制措施和证明它的工件。 安全和法律审查员接受控制措施有效的证明:签署的协议、配置屏幕、授权记录或返回的日志查询。他们不接受的是识别控制措施但没有责任人和证据的设计文档;无法证明运行的控制措施与未运行的控制措施无法区分。

成本 · 复杂性 · 风险 成本: 为每项义务生成和维护证据是持续的工作。配置漂移和工件过时,因此登记册定期重新验证。 复杂性: 每项义务的控制措施、责任人和活动证据工件比入口点选择更多的治理,它跨越安全、法律和平台负责人,他们必须就谁持有什么达成一致。 风险: 指定没有责任人和证据的控制措施在审计中是不可见的。它可以在无人负责的情况下停止运行,漏洞在审查中显现而不是在设计中发现,这是最昂贵的地方。

屏幕17:当通过入口点选择感觉像完成合规时

注意合规 3分钟 当通过入口点选择感觉像完成合规时

设置钩子 通过约束预过滤器和能够证明合规性是两件不同的事情。预过滤器给您一个干净的信号。选择通过HIPAA、GDPR或FedRAMP的交付路线会产生一个立即、可见的结果:路线被允许,入口点被清除,设计可以继续。证明每项义务正在被满足在设计时不会产生任何可见的内容,因为证明是您必须构建、附加到责任人并保持活动状态的工件,随着配置的变化。这个漏洞很容易被忽视,因为感觉像终点线的时刻和审查员检查的时刻通常相隔数月。

选择了正确路线但不产生任何证明的部署 一个团队为受监管的工作负载选择了合规的交付路线,并将合规视为已解决。他们在设计时一次将义务映射到控制措施,在文档中。没有责任人附加到控制措施,也没有日志记录显示任何控制措施正在运行。 数据驻留义务是失败集中的地方。控制措施在纸上是正确的:处理固定在批准区域。然而,几个月后,日志记录配置更改并开始将请求元数据写入第二个区域的存储中。没有任何人识别更改,因为没有人负责驻留控制,也没有工件跟踪数据落在哪里。漏洞在审计中显现,而不是在设计时,当审查员要求提供数据保持在区域内的证据时,团队有一个设计文档而不是数据流记录。

为什么会失败 通过预过滤器被误认为建立了合规性。合规路线是先决条件,而不是证明。每项义务需要一个控制措施、一个命名的责任人和一个随着部署变化而重新验证的活动证据工件。这个故事中的驻留控制措施在设计时是真实的,在生产中无声地失效,没有任何东西捕捉到差异,因为没有工件在监视它。

屏幕18:证明控制措施选择

检查点合规 3分钟 证明控制措施选择 现在试试。您被给予一个受监管部署的一项合规义务。选择证明它的技术控制措施,然后选择安全和法律审查员将接受该控制措施作为证明的单一负载原因。只有当两者都正确时,您才通过:控制措施必须符合义务,并且您必须命名为什么它被视为审查员可以检查的证据。 义务: 受保护的健康数据必须在正式协议下处理(HIPAA)。

**A. HIPAA-ready计划或第一方API在签署的BAA下,因为签署的协议加上启用的配置是审查员可以检查的证明工件。** **B. HIPAA-ready计划在签署的BAA下,因为模型被指示小心处理健康数据。** **C. 基于模型的健康术语内容过滤器,因为它在运行时捕捉敏感数据。**

检查答案 暂时跳过

屏幕19:组装一个负责任的部署

累积模块 8分钟 组装一个负责任的部署 现在试试。您被给予一个自包含的简报,您做出五个顺序决策,构建一个负责任的部署。决策按顺序运行,因为每个决策为下一个决策设定条件。早期的弱选择缩小了后续决策的能力。如果您在决策一中将领域规则留在训练行为中,下游没有任何层可以将其放回。

您在整个模块中独立构建了每一层。以下是您正在组装的堆栈,按顺序:

训练行为塑造基线安全;您的应用政策定义领域特定规则;下面的运行时控制在操作中强制执行这些规则。 运行时筛查和授权位于请求路径上,阻止不允许的内容和未经许可的操作。 公平性和透明性控制在源头解决不平等结果,并确保每个决策可以重建。它们依赖于有效的日志记录。 人工审查路由将模型不应单独完成的决策按风险发送给人。它依赖于相同的日志记录。 控制登记册将每项义务绑定到控制措施、责任人和证据工件。

简报 一个公共部门福利助手帮助机构确定计划资格,建议批准、拒绝或转介。简报为您提供了决策所需的内容,仅此而已: 框架: FedRAMP在机构所需的影响级别,加上机构规则,被拒绝的申请人得到具体原因。 高风险、低信心案例: 一个接近资格门槛且文件不完整的申请人,错误拒绝会剥夺某人的福利。 倾斜倾向输出: 建议和附加到拒绝的原因。 数据: 申请人提交的字段、决策时检索的机构记录和任何派生特征。

**1. 设定训练行为与应用层之间的边界。**

**2. 放置运行时控制。**

**3. 指定公平性和透明性控制。**

**4. 定义人工审查路由。**

**5. 构建控制登记册。**

揭示模型答案 暂时跳过

模型答案

  • 设定训练行为与应用层之间的边界。训练行为拒绝广泛的危害类别,但从未见过此计划的资格规则,因此这些规则属于应用层。将它们留在训练行为中,下游没有任何控制措施可以触及它们。
  • 放置运行时控制。定位输入筛查、输出筛查和工具调用授权,选择每个是基于模型还是确定性的,并设置失效方向。失效关闭,因为失效开放的筛查让未筛查的拒绝到达申请人。
  • 指定公平性和透明性控制。命名四个注入点(语料库、提示框架、示例、路由)中哪一个可能扭曲此结果,并构建决策日志记录一次,因为受影响的申请人、监管者、构建团队和控制登记册都依赖于它。
  • 定义人工审查路由。按信心、可逆性和错误答案的成本路由,并选择一个放置点:操作前批准、操作后审计或抽样审查。将低信心、难以撤销的拒绝发送到操作前批准。将规则键到风险,而不是数量,否则安静的队列会挥手通过高风险拒绝。
  • 构建控制登记册。将每项FedRAMP义务映射到控制措施、责任人和审查员接受的证据。没有证据工件的控制措施是您无法证明运行的主张。

强答案具体:它们命名注入点,命名失效方向,命名路由规则变量,并命名证据工件。弱答案描述一般概念而不将其应用于此部署。根据简报检查每个决策,合规框架和高风险案例细节应在您的答案中显现。

标记完成

屏幕20:术语表

参考总结 术语表 本模块中使用的关键术语,按字母顺序排列。点击术语展开其定义。

BAA(商业伙伴协议) HIPAA下的合同,允许供应商在覆盖实体的代表下处理受保护的健康数据,定义各方的保障措施和责任。没有它,通过供应商处理该数据是不合规的,无论技术控制如何。 同意疲劳 当审查者被要求批准太多操作时,监督的崩溃,因此他们几乎批准所有内容而没有真正审查。它是将所有决策路由给人的失效模式。验证Anthropic的当前框架,请访问anthropic. com。 宪法 Anthropic在训练期间用于塑造Claude价值观和行为的书面文件,陈述了广泛安全、道德、遵守指南和真正对操作员和用户有帮助的优先级顺序。它塑造了模型的训练行为,但不编码任何部署的领域政策。验证当前版本,请访问anthropic. com。 控制登记册 将每项合规义务映射到其技术控制、责任人和证据工件的表格,以便受监管的部署可以作为登记册审计,而不是作为叙述断言。 数据驻留 要求在指定地理区域内处理和存储数据,包括日志和缓存中的副本。它是许多数据主权义务背后的控制措施。 决策日志记录 捕捉每个决策的输入、检索上下文、模型输出和路由,键控以便以后可以重放和解释一个决策。它是相同的可观察性工具,指向特定决策发生的原因。 证据工件 安全和法律审查员接受控制措施有效的具体证明:签署的协议、配置屏幕、授权记录或返回的日志查询。设计文档中命名的控制措施没有工件是主张,而不是证明。 失效开放与失效关闭 护栏在自身出错时的行为。失效开放通过未筛查的流量,而失效关闭阻止直到控制措施恢复健康。对于安全控制措施,失效关闭是故意的选择,因为无声通过流量的控制措施不提供保护。 FedRAMP FedRAMP分类(低、中、高),设定了云服务必须满足的安全控制措施,以处理给定敏感性的美国政府工作负载。所需级别由工作负载设定,交付路线必须在其或以上授权。 GDPR 欧盟的数据保护法,关于组织如何收集、处理、存储和转移欧盟和欧洲经济区人员的个人数据。它授予个人对其数据的权利,并要求处理的合法基础、数据最小化和保护。 HIPAA 美国联邦法律,设定了保护个人健康信息的标准。它规定了受保护的健康信息(PHI)如何被覆盖实体及其商业伙伴使用、披露和保护。当供应商在覆盖实体的代表下处理PHI时,HIPAA要求商业伙伴协议(BAA)定义各方的保障措施和责任。在本模块中,它驱动了通过HIPAA-ready计划或第一方API在签署的BAA下交付的要求。 人在回路路由 根据信心、可逆性和错误答案的成本将决策路由给人的规则,而不是按数量,审查者放置在操作前、操作后或抽样中。 注入点(公平性) 不平等结果可以进入系统的特定地方:检索语料库、提示框架、选择的示例或下游路由。命名它们使公平性成为您可以监控的架构属性,而不是您假设的模型属性。 输入筛查 在模型调用之前运行的检查,决定请求是否应到达模型,使用基于模型的分类器用于模糊意图如越狱或确定性规则用于清晰模式。 法官模型 用于评分或分类另一个模型输出的模型,用于毒性或政策合规性等质量,确定性规则无法可靠编码。它可能被规避,这就是为什么它与确定性检查串联。 输出筛查 在响应到达用户之前运行的检查,使用模型判断生成内容的毒性或验证器检查已知字符串和模式违规。 工具调用授权 在任何副作用操作之前运行的检查,决定此调用者在此上下文中是否允许执行此操作。它应是确定性的,允许列表加身份和范围,因此决策是可证明和可审计的。 训练时对齐与推理时控制 训练时对齐是为每个用户烘焙到模型中的安全行为。推理时控制是您在请求时添加的筛查和授权,以强制执行特定于您部署的规则。混淆两者会留下部署特定规则未强制执行。

屏幕21:贯穿所有内容的五件事

总结模块 3分钟 贯穿所有内容的五件事

01

安全是层的堆栈,而不是设置 训练为每个请求减少广泛的危害,但从未见过合作伙伴的领域政策、数据规则或授权模型,因此明确划定边界并识别每层覆盖的内容。危险的失效是无声的:假设Claude强制执行不在任何层中的规则。

02

受保护的路径有三个控制点和一个选择的失效方向 输入筛查、输出筛查和工具调用授权回答不同的问题,因此路径末端的一个过滤器无法覆盖其他两个。让控制错误在错误通过造成伤害的决策中失效关闭,因为无声通过流量的护栏给您保护的假象而没有实际功能。

03

公平性和透明性是监控的,而不是假设的 不平等结果在您控制的点出现,如语料库、提示框架、示例和路由,因此将公平性视为供应商的责任会留下这些点未监控。记录每个决策,以便用户、监管者和您的团队可以重建它。如果您无法重建解释,您无法可靠地提供一个。

04

按风险而非数量路由审查 信心、可逆性和错误答案的成本设定哪些决策应由人审查,因此将高风险、低信心的决策发送给人,并提供输入和标记原因,让其余通过。将所有内容路由会淹没队列,直到审查者点击通过而不阅读。

05

合规入口点是先决条件,有证据的控制集是证明 法规陈述结果并将控制措施留给您,因此将每项义务转化为具体控制措施、命名的责任人和您随时间重新验证的活动证据工件。没有责任人和证据的控制措施最终会失效并在审计中失败,因为审查员接受的是控制措施有效的证明,而不是控制措施本身。

接下来是什么 下一个模块从构建负责任的部署转向移交和管理它。您将采用您现在可以证明的架构,并将其权衡传达给非技术利益相关者,记录到标准,并通过发现到移交的生命周期管理它。您在这里构建的控制登记册和分层边界成为移交所依赖的文档和基线。

来源

使用Claude API构建(Skilljar课程4),用于模型评分器、工具调用机制、结构化输出和评估器模式。 **platform. claude. com/docs和platform. claude. com,用于内容审核、护栏指南、流式拒绝和结构化输出。** **anthropic. com,用于2026年1月宪法和当前安全态势。** Anthropic信任中心和隐私中心,用于HIPAA、FedRAMP和数据驻留态势。 架构师M1和M2故事板,用于参考而不是重新教授责任人分配、参考架构、模型和上下文策略、评估、集成层和可观察性。

您可以设计满足安全和合规要求的AI系统。 控制设计、证据收集、责任人分配和审计准备,没有责任人和证据的控制措施在最重要的时候失效。

屏幕22:恭喜!您已成功完成本模块。

模块完成 · 架构师 · 2分钟 恭喜!您已成功完成本模块。 模块3涵盖了负责任AI架构师在生产部署前后应用的安全框架、风险类别和控制设计决策。 受保护的路径不是末端的过滤器,而是在每个可能进入危害的阶段都有控制措施。

0 通过0个检查点

M1

Claude平台与解决方案设计 模型选择、提示架构、工具设计和平台层权衡。

M2

企业集成与生产 部署模式、集成架构和生产可靠性。

M3

负责任AI、安全与风险 安全框架、风险识别和治理实践。

您在这里

M4

利益相关者参与、生命周期与上市策略 利益相关者沟通、生命周期管理和上市策略。

接下来

M5

团队启用与运营生产力 团队工具配置和运营支持实践。

回顾模块 重新开始

抽认卡 0 张卡片

No flashcards for this lesson.

知识检测 0 题

No quiz for this lesson yet.