Quel est le flux général du pipeline d'évaluation décrit ?	Test case -> Prompt -> Claude -> Grader.
Quel est le rôle principal de la fonction `run prompt` ?	Fusionner un test case avec le prompt, l'envoyer à Claude, et retourner le résultat.
Comment le prompt initial est-il structuré au début du processus ?	Il est simple, utilise une F-string, et ne contient pas d'instructions de formatage.
Quel est l'objectif final du prompt en termes de sortie souhaitée ?	Obtenir une sortie structurée (Python, JSON, ou expression régulière).
Que fait la fonction `run test case` ?	Appeler `run prompt`, évaluer le résultat (grading), et retourner un dictionnaire de résumé.
Quel est le but de la fonction `run eval` ?	Charger le jeu de données, boucler sur chaque test case, et assembler tous les résultats.
Quel composant majeur est encore manquant dans le pipeline d'évaluation ?	Le Grader (l'évaluateur).
