代码评分器（Code Grader）的主要目的是什么？	确保模型输出是纯粹的 Python、JSON 或正则表达式，且不包含任何解释。
代码评分器如何验证输出的语法是否有效？	通过三个辅助函数（validateJSON, validatePython, validateRegEx）尝试解析或编译输出。
在语法验证过程中，如果输出成功解析或编译，应返回什么分数？	满分 10 分。
为了运行代码评分器，测试数据集必须包含哪些关键信息？	必须包含一个 `format` 键，用于指定预期的输出格式（如 JSON, Python, RegEx）。
在更新提示模板（Prompt Template）时，需要采取哪些措施来限制模型的输出？	明确要求模型仅以 Python、JSON 或正则表达式的形式响应，且不添加任何评论或解释。
最终的综合分数是如何计算的？	将模型评分（Model Score）和语法评分（Syntax Score）取平均值。
在代码评分器的实现中，`validatePython` 函数使用了哪种技术来检查代码的有效性？	尝试将输出解析为 Python 的抽象语法树（AST）。
