摘要音频
本节课没有语音摘要。
学习笔记
提示评估工作流中的评分系统 (Grading System in Prompt Evaluation Workflow)
核心概念 (Core Concepts)
- 评分器 (Grader) 的作用: 接收模型输出,并提供一个客观信号 (Objective Signal)。
- 常见信号类型:
- 数值 (Number):最常见,通常在 1 到 10 之间(10 代表高质量,1 代表低质量)。
- 布尔值 (True/False)。
- 任何可量化的指标。
三种评分器类型 (Three Types of Graders)
- 基于代码的评分器 (Code-based Grader):
- 原理: 将模型输出输入到自定义代码片段中进行程序化检查。
- 应用场景: 检查输出长度、特定词汇是否存在、JSON 或代码的语法验证、实现可读性评分等。
- 要求: 必须返回一个可用的信号(通常是 1 到 10 的数字)。
- 基于模型的评分器 (Model-based Grader):
- 原理: 再次调用一个额外的模型 API,让该模型对原始模型的输出进行评估。
- 优势: 灵活性极高,可评估响应的整体质量、指令遵循程度、完整性等。
- 要求: 模型必须提供一个客观信号(通常是 1 到 10 的数字)。
- 基于人类的评分 (Human-based Grading):
- 原理: 将模型输出交给真实的人进行评估。
- 特点: 灵活性最高,可针对任何指标进行评估。
- 缺点: 耗时且工作繁琐。
评估标准与实施策略 (Evaluation Criteria and Implementation Strategy)
- 明确评估标准 (Evaluation Criteria): 在开始评估前,必须明确关注响应的哪些方面。
- 示例标准 1 (格式): 确保输出仅为 Python、JSON 或正则表达式,不包含额外解释。
- 示例标准 2 (语法): 确保代码或格式没有拼写错误或语法错误。
- 示例标准 3 (任务遵循): 确保模型清晰地解决了用户任务,并提供了准确、无重大逻辑错误的答案。
- 分工协作:
- 代码评分器 适用于格式检查和语法验证(标准 1 和 2)。
- 模型评分器 适用于通用的任务遵循和响应质量评估(标准 3)。
模型评分器实施要点 (Model Grader Implementation Tips)
- 提示设计 (Prompt Design): 提示需要设置角色、清晰地列出任务和模型生成的解决方案,并提供明确的评估方向。
- 获取更具体的反馈: 不要只要求模型给出分数。应要求模型提供优点 (Strengths)、缺点 (Weaknesses) 和推理过程 (Reasoning)。这能迫使模型给出更具体、更具说服力的分数,避免默认的中间分数(如 6)。
- 结果处理: 模型返回的通常是 JSON 格式,需要进行解析 (Parsing) 以提取分数、推理和优缺点列表。
Takeaways
- 评分器(Grader)的作用是接收模型输出,并提供客观信号,常见信号包括数值(如 1 到 10)、布尔值或任何可量化的指标。
- 评分器主要分为三种类型:基于代码的(用于程序化检查格式和语法)、基于模型的(调用额外模型API进行评估)和基于人类的(人工评估,灵活性最高但耗时)。
- 评估策略应根据标准分工:代码评分器适用于格式和语法验证;模型评分器适用于任务遵循和整体响应质量评估。
- 在设计模型评分器提示时,应要求模型提供优点、缺点和推理过程,而非仅要求分数,以获取更具体、更具说服力的反馈。
抽认卡 10 张卡片
问题
点击显示 · ←/→
答案
点击翻回
知识检测 0 题
No quiz for this lesson yet.