提示词评估工作流的特点是什么？	它没有统一的标准方法，不是一套固定的流程。
在典型的提示词评估中，第一步是什么？	撰写初始提示词草稿（Initial prompt draft）。
创建评估数据集（Evaluation data set）的目的？	包含所有可能输入提示词的各种输入（如用户问题）。
在评估流程中，数据是如何被处理的？	将提示词和数据集中的每个输入组合，送入模型（如Claude）获取实际响应。
评估流程中的“评分”（Grading）步骤是如何进行的？	将原始输入和模型生成的答案配对，送给评分器（Grader）进行打分。
在评分阶段，一个10分的答案通常代表什么？	这是一个完美的答案，没有可以改进的地方。
如何得到一个客观的性能描述？	将所有获得的评分进行平均（Averaging）。
为什么需要重复整个评估流程？	为了根据分数迭代和改进提示词（Prompt）。
