Quel est le flux de travail général du pipeline d'évaluation décrit ?	Cas de test -> Fusion avec le prompt -> Appel à Claude -> Passage au gradeur.
Quel est l'objectif principal de la fonction `run_prompt` ?	Fusionner le cas de test avec la tâche, générer du texte avec Claude, et retourner le résultat.
Quelle est la structure initiale du prompt utilisé dans `run_prompt` ?	Un F-string simple demandant de résoudre la tâche suivante (ex: "Please solve the following task").
Quel est le principal défaut du prompt actuel mentionné dans le transcript ?	Il ne contient aucune instruction de formatage, ce qui peut entraîner un surplus de sortie non désiré.
Quel est le rôle de la fonction `run_test_case` ?	Prendre un cas de test, appeler `run_prompt`, évaluer le résultat (grading), et retourner un dictionnaire de résumé.
Que contient le dictionnaire retourné par `run_test_case` ?	Le résultat de Claude (output), le cas de test, et le score.
Quel est le rôle de la fonction `run_eval` ?	Charger le jeu de données et boucler à travers chaque cas de test pour assembler tous les résultats.
Comment `run_eval` traite-t-il le jeu de données ?	Il appelle la fonction `run_test_case` pour chaque cas de test individuel et ajoute les résultats à une liste.
Quelle est l'étape finale du pipeline d'évaluation après avoir obtenu la sortie de Claude ?	Alimenter l'entrée et le résultat de Claude dans l'un des différents gradeurs.
