什么是评估工作流中的“评分器”（Grader）？	接收模型输出，并提供客观信号（如数字或布尔值）。
讨论了哪三种类型的评分器？	基于代码（Code-based）、基于模型（Model-based）和基于人类（Human-based）。
基于代码的评分器（Code-based Grader）是如何工作的？	将模型输出输入到作者编写的代码片段中进行程序化检查。
基于代码的评分器可以执行哪些程序化检查？	检查长度、特定词汇的有无、JSON/代码的语法验证、可读性评分等。
基于模型的评分器（Model-based Grader）是如何工作的？	将原始模型输出作为输入，发送给另一个额外的模型进行评估。
使用基于模型的评分器有什么主要优势？	灵活性高，可以要求模型根据质量、指令遵循度或完整性进行评估。
基于人类的评分方式（Human-based Grading）的主要缺点是什么？	通常耗时且工作繁琐（tedious）。
在使用任何评分方式之前，必须确定的关键要素是什么？	明确评估标准（Evaluation Criteria），即确定关注响应的哪些具体方面。
在设计模型评分器的提示（Prompt）时，为什么不只要求模型给出分数？	要求提供理由、优点和缺点，能促使模型给出更具体、更准确的分数。
在评估流程中，如何获得最终的客观指标？	运行评分器获取单个分数，然后计算所有测试用例的平均分。
