什么是评估工作流中的“评分系统”（Grading System）？	评分系统接收模型输出，并提供一个客观信号（如数字或布尔值）来衡量输出质量。
评估工作流中主要有哪些三种评分系统？	代码驱动型（Code-based）、模型驱动型（Model-based）和人工驱动型（Human-based）。
代码驱动型评分系统是如何工作的？	将模型输出输入到作者编写的自定义代码片段中进行程序化检查。
代码驱动型评分系统可以执行哪些类型的检查？	长度检查、特定词汇的有无、JSON/代码的语法验证、可读性评分等。
模型驱动型评分系统是如何运作的？	将原始模型输出作为输入，再调用一个额外的模型（API请求）来评估该响应。
使用模型驱动型评分系统的主要优势是什么？	提供了极大的灵活性，可以要求模型根据通用质量、指令遵循度或完整性进行评估。
人工驱动型评分系统的主要缺点是什么？	通常需要大量时间，并且工作非常繁琐（Tedious）。
在评估模型响应时，通常需要关注哪些评估标准？	格式（Format）、语法（Syntax）和任务遵循度（Task Following）。
哪种评分系统最适合检查输出的格式和语法（如JSON或正则表达式）？	代码驱动型评分系统（Code-based Grader）。
哪种评分系统最适合评估响应的整体质量和对用户任务的清晰回应？	模型驱动型评分系统（Model-based Grader）。
