Wat is het algemene stappenplan van de eval-pipeline?	Testcase + Prompt $\rightarrow$ Claude $\rightarrow$ Grader.
Wat is de taak van de `run prompt` functie?	Een testcase samenvoegen met de prompt, deze aan Claude doorsturen en het resultaat retourneren.
Wat is de taak van de `run test case` functie?	De `run prompt` functie aanroepen voor één testcase, het resultaat beoordelen (graderen) en een samenvattende dictionary retourneren.
Wat is de functie van `run eval`?	De volledige dataset laden en voor elke testcase de `run test case` functie aanroepen om alle resultaten te verzamelen.
Wat is het huidige probleem met de output van de `run prompt` functie?	Er is nog geen instructie in de prompt om specifieke formaten (zoals Python of JSON) te garanderen.
Welke drie functies vormen de kern van de eval-pipeline?	`run prompt`, `run test case`, en `run eval`.
