摘要音频
本节课没有语音摘要。
学习笔记
📝 提示词评估工作流:评分系统 (Prompt Evaluation Workflow: Grading System)
🎯 核心概念 (Core Concepts)
- 评分器 (Grader) 作用: 接收模型输出,提供客观信号(Objective Signal)。
- 常见输出形式: 数字(如 1 到 10 分),其中 10 代表高质量,1 代表低质量。
- 目标: 建立一个客观的指标来衡量提示词(Prompt)的有效性。
🛠️ 三种评分器类型 (Three Types of Graders)
- 代码型评分器 (Code-based Grader):
- 原理: 将模型输出输入到自定义代码片段中进行程序化检查。
- 检查内容: 长度限制、特定词汇的有无、JSON/代码的语法验证、可读性评分等。
- 要求: 必须返回一个可使用的信号。
- 模型型评分器 (Model-based Grader):
- 原理: 将模型输出作为输入,再调用一个额外的模型(API 请求)进行评估。
- 优势: 灵活性高,可要求模型评估通用质量、指令遵循程度、完整性等。
- 要求: 必须返回一个客观信号(通常是 1 到 10 的数字)。
- 人工型评分 (Human-based Grading):
- 原理: 由真人评估模型输出。
- 优势: 灵活性最高,可针对任何指标进行评估。
- 缺点: 耗时且繁琐。
⚙️ 评估标准与实施策略 (Evaluation Criteria & Implementation)
- 评估标准示例 (Example Criteria):
- 格式检查: 确保输出仅为 Python、JSON 或正则表达式,无额外解释。
- 语法验证: 确保代码没有拼写错误或语法错误。
- 任务遵循度: 确保模型清晰地解决了用户任务,并提供了准确的代码(无重大逻辑错误)。
- 实施策略:
- 格式和语法检查 → 使用代码型评分器。
- 通用任务遵循度 → 使用模型型评分器(利用其灵活性)。
🤖 模型型评分器实现要点 (Model Grader Implementation Details)
- 函数设计: 创建 grade_by_model 函数,输入测试用例和原始模型输出。
- 提示词 (Prompt) 关键要素:
- 设定角色 (Set Role)。
- 明确任务 (State Task)。
- 列出模型生成的解决方案 (List Solution)。
- 提供明确的响应指南 (Directions):要求模型提供优点、缺点、推理过程以及分数。
- 提示词优化技巧: 要求模型提供推理和优缺点,能促使模型给出更具体、更具说服力的分数(
Takeaways
- 评分器(Grader)的核心作用是接收模型输出,提供客观信号(如 1 到 10 分)来衡量提示词的有效性。
- 评分器主要分为三种类型:代码型(程序化检查)、模型型(调用额外模型评估)和人工型(真人评估)。
- 实施策略上,格式和语法检查应使用代码型评分器;通用任务遵循度则应使用模型型评分器。
- 在使用模型型评分器时,提示词必须包含角色设定、明确任务、解决方案和详细的响应指南(要求提供优点、缺点和分数)。
抽认卡 10 张卡片
问题
点击显示 · ←/→
答案
点击翻回
知识检测 0 题
No quiz for this lesson yet.