提示词评估工作流的一个关键特点是什么？	它没有统一的标准，业界没有固定的方法。
典型提示词评估的第一步是什么？	撰写初始提示词草稿（Initial prompt draft）。
创建评估数据集（Evaluation data set）的目的在于什么？	包含一系列可能输入提示词的各种输入。
在评估流程中，在获得数据集后需要执行什么操作？	将数据集中的每个输入喂给模型以获取实际响应。
在评估流程的哪个阶段，会使用“评分器”（Grader）？	在获取模型响应后，用于对答案进行评分（例如1到10分）。
如何确定最终的客观性能指标？	将所有评分进行平均。
在获得平均分数后，下一步通常会做什么？	迭代或重复整个过程，修改提示词以提高分数。
为什么在本次学习中选择在 Jupyter Notebook 中实现自定义工作流？	为了理解工作流的行为，并证明不需要复杂的解决方案即可开始评估。
