摘要音频
本节课没有语音摘要。
学习笔记
📝 学习笔记:评估流程 (Evaluation Pipeline)
一、 评估流程概述
- 核心目标: 构建一个完整的评估流程 (Eval Pipeline)。
- 基本工作流: 测试用例 (Test Case) → 与提示 (Prompt) 合并 → 输入 Claude → 获得输出 → 经过评分器 (Grader)。
- 当前状态: 流程的大部分代码已完成,但“评分器”是待实现的关键部分。
二、 三个核心函数
- run_prompt (运行提示)
- 功能: 将生成的任务与单个测试用例合并,并调用 Claude 生成文本。
- 输入: 测试用例 (Test Case)。
- 过程: 任务 + 测试用例 → Prompt → 调用 Claude → 返回生成的输出 (Output)。
- 当前局限性: 提示目前非常简单,尚未包含格式要求(如要求输出 JSON、Python 或正则表达式)。
- run_test_case (运行单个测试用例)
- 功能: 对单个测试用例执行完整的运行和评分过程。
- 过程: 调用 run_prompt → 获得 Claude 输出 → 进行评分 (Grading) → 返回一个包含所有信息的字典。
- 返回内容: 输出结果 (Output)、原始测试用例 (Test Case)、得分 (Score)。
- 当前状态: 评分逻辑目前是硬编码 (hardcoded),需要后续改进。
- run_eval (运行评估)
- 功能: 负责加载整个数据集,并驱动整个评估流程。
- 过程: 循环遍历整个数据集 → 对每一个测试用例调用 run_test_case → 收集所有结果。
- 输出: 一个包含所有测试用例运行结果的列表。
三、 总结
- 流程构成: 整个评估流程主要由这三个函数构成。
- 关键缺失环节: 目前流程中最大的缺失环节是“评分器”的实现。
Takeaways
- 评估流程 (Eval Pipeline) 的核心目标是构建完整的测试用例 → 提示 → Claude → 评分器的完整工作流。
- run_prompt 函数负责将任务与单个测试用例合并,调用 Claude 生成输出,但目前提示内容过于简单。
- run_test_case 函数负责对单个测试用例执行完整的运行和评分过程,并返回输出、原始测试用例和得分。
- run_eval 函数负责加载整个数据集,并循环调用 run_test_case 来驱动整个评估流程。
- 目前评估流程中最大的缺失环节是“评分器”的实现。
抽认卡 8 张卡片
问题
点击显示 · ←/→
答案
点击翻回
知识检测 0 题
No quiz for this lesson yet.