Quel est le rôle d'un "grader" dans un flux d'évaluation de prompt ?	Il prend la sortie d'un modèle et fournit un signal objectif (ex: un score).
Quels sont les trois types de "graders" abordés ?	Basés sur le code, basés sur un modèle, et humains.
Comment fonctionne un "code-based grader" ?	Il soumet la sortie du modèle à un snippet de code personnalisé pour des vérifications programmatiques.
Citez deux types de vérifications qu'un "code-based grader" peut effectuer.	Vérification de la longueur, validation de la syntaxe JSON/code, ou score de lisibilité.
Comment fonctionne un "model-based grader" ?	Il utilise un modèle supplémentaire (une autre API) pour évaluer la qualité générale ou le respect des instructions.
Quel est le principal inconvénient de l'évaluation humaine ?	Cela prend beaucoup de temps et est souvent une tâche fastidieuse.
Pourquoi est-il conseillé de demander les forces et faiblesses dans un prompt de "model-based grader" ?	Pour obtenir un score plus concret et éviter des notes génériques (comme un 6).
Citez deux critères d'évaluation spécifiques mentionnés dans le transcript.	Le format de la réponse (Python, JSON, regex) ou le suivi général de la tâche.
