在提示评估工作流中，评分系统（Grader）的主要作用是什么？	为模型的输出提供客观信号，例如数字或布尔值。
讨论的三种主要的评分系统类型是什么？	基于代码的（Code-based）、基于模型的（Model-based）和基于人类的（Human-based）。
基于代码的评分系统（Code-based grader）通常用于执行哪些类型的检查？	程序化检查，如验证输出长度、包含特定词汇或进行语法验证。
基于模型的评分系统（Model-based grader）是如何工作的？	将原始模型的输出作为输入，喂给另一个额外的模型进行评估。
基于人类的评分系统（Human-based grading）的主要缺点是什么？	通常耗时且工作繁琐（tedious）。
在评估模型输出时，一个常见的评分量表范围是什么？	1到10，其中10代表高质量，1代表低质量。
在评估标准中，如何使用代码评分器（Code grader）来验证输出格式？	检查输出是否为特定的格式（如Python、JSON或正则表达式）并验证其语法是否有效。
为什么在设计模型评分器的提示（prompt）时，需要要求提供“优点、缺点和推理”？	这样可以促使模型给出更具体、更确定的分数，而不是中庸的评分。
在评估任务时，除了格式和语法，还需要关注哪种关键的评估标准？	任务遵循度（Task following），确保模型清晰地解决了用户的任务。
在整个评估流程的最后，通过对所有评分进行平均，可以获得什么？	一个最终的、客观的性能指标（objective metric）。
