数据集中的每一条记录被称为？	测试用例 (test case)
评估工作流程的整体顺序是什么？	测试用例 -> 合并提示 -> 调用 Claude -> 运行评估器 (grader)
`run prompt` 函数的主要目标是什么？	将任务与测试用例合并，然后将结果输入 Claude 并返回输出。
当前 `run prompt` 中的提示（prompt）是如何构建的？	使用简单的 F-string，例如：“请解决以下任务。”
`run test case` 函数执行哪些核心操作？	调用 `run prompt` 函数获取输出，对结果进行评分，并返回一个描述事件的字典。
目前 `run test case` 中的评分（grading）是如何实现的？	目前是硬编码的，固定为 10 分。
`run eval` 函数的主要作用是什么？	加载数据集，循环遍历所有测试用例，调用 `run test case`，并汇集所有结果。
在当前构建的评估流程中，哪个关键组件尚未实现？	评估器 (grader)
