在评估流程中，数据流的最终目标是什么？	将测试用例与提示合并，通过Claude生成结果，并送入评分器。
`run prompt` 函数的主要功能是什么？	将测试用例与任务合并，调用Claude生成文本输出。
`run test case` 函数是如何工作的？	调用 `run prompt` 获取输出，然后对结果进行评分并返回摘要字典。
`run eval` 函数在整个评估流程中扮演什么角色？	加载数据集，并循环调用 `run test case` 来处理所有测试用例。
当前构建的评估流程中，最大的缺失环节是什么？	评分（Grader）机制尚未实现。
在设计提示（Prompt）时，最初的目标是什么？	确保Claude返回特定格式（如Python或JSON）的结果。
在 `run prompt` 函数中，如何向Claude发送任务？	将测试用例与任务合并，作为用户消息（user message）传递给Claude。
在 `run test case` 函数中，返回的字典通常包含哪些信息？	Claude的输出结果、原始测试用例和最终得分。
