评估流程的整体步骤是什么？	测试用例 (Test Case) -> 合并提示 (Merge Prompt) -> Claude -> 评分器 (Grader)。
`run prompt` 函数的主要目标是什么？	将任务与测试用例合并，并调用 Claude 生成文本。
目前 `run prompt` 函数在输出格式上的主要局限性是什么？	缺乏格式化指令，可能会返回超出预期的多余内容。
`run test case` 函数的功能是什么？	调用 `run prompt` 获取输出，然后对结果进行评分，并返回描述事件的字典。
`run eval` 函数的作用是什么？	加载数据集，循环调用 `run test case`，并汇集所有结果。
在评估流程中，哪三个主要函数被构建了？	`run prompt`、`run test case` 和 `run eval`。
在 `run test case` 函数中，除了调用 `run prompt` 之外，还需要完成哪一步？	对 Claude 的结果进行评分 (Grading)。
评估流程的最后一步，在获得 Claude 输出后需要引入哪个组件？	评分器 (Grader)。
