Quel est le flux général du processus d'évaluation décrit dans le pipeline ?	Test Case -> Prompt -> Claude -> Grader.
Quel est l'objectif principal de la fonction `run prompt` ?	Fusionner le test case avec le prompt, générer du texte avec Claude, et retourner le résultat.
Comment est initialement structuré le prompt utilisé dans `run prompt` ?	Il est simple, utilise une F-string, et ne contient aucune instruction de formatage spécifique (JSON, Python, etc.).
Quel est le rôle de la fonction `run test case` ?	Appeler `run prompt`, noter le résultat obtenu de Claude, et retourner un dictionnaire de résumé.
Quel est le rôle de la fonction `run eval` ?	Charger le jeu de données, boucler sur chaque test case, appeler `run test case`, et assembler tous les résultats.
Quel est le statut actuel de l'étape de notation (grading) dans le pipeline ?	Elle est actuellement remplacée par un score codé en dur (hard coded).
