代码评分器（Code Grader）的主要功能是什么？	确保模型输出是纯粹的 Python、JSON 或正则表达式，且没有解释性文字。
代码评分器如何验证代码的语法是否有效？	通过尝试解析（JSON）、解析抽象语法树（AST，用于Python）或编译（用于RegEx）模型输出。
如果代码的语法验证成功，评分器会返回什么分数？	满分 10 分。
为了让评分器知道运行哪个验证函数，测试数据集需要包含哪个关键信息？	`format` 键，用于指定预期的输出格式（如 "JSON" 或 "Python"）。
在更新数据集时，我们应该在任务输出中添加什么？	一个 `format` 键，明确指出该任务期望的输出类型。
在更新提示模板（Prompt Template）时，我们应该给模型添加什么指令？	要求模型仅以 Python、JSON 或纯正则表达式的形式响应，不得添加任何评论或解释。
在实现代码评分时，我们通常会创建哪些辅助函数？	`validateJSON`、`validatePython` 和 `validateRegEx`。
最终的综合得分是如何计算的？	模型得分（Model Score）和语法得分（Syntax Score）的平均值。
