Quel est l'objectif principal d'un système de "grader" dans un workflow d'évaluation ?	Fournir un signal objectif (comme un nombre ou Vrai/Faux) sur la qualité de la sortie du modèle.
Citez les trois types de "graders" discutés dans le transcript.	Code-based, Model-based, et Human-based.
Comment fonctionne un "code-based grader" ?	Il utilise un snippet de code écrit par l'utilisateur pour effectuer des vérifications programmatiques.
Donnez deux exemples de vérifications qu'un code-based grader peut effectuer.	Vérifier la longueur de la sortie ou valider la syntaxie (JSON/code).
Qu'est-ce qu'un "model-based grader" ?	Il utilise un modèle supplémentaire (une autre API call) pour évaluer la réponse du modèle original.
Quelle est l'exigence principale pour qu'un modèle agisse comme un "grader" ?	Il doit fournir un signal objectif, généralement un score numérique (ex: 1 à 10).
Quel est le principal inconvénient de l'évaluation basée sur l'humain ?	Cela prend beaucoup de temps et est très fastidieux.
Qu'est-ce qui doit être défini en amont de toute évaluation ?	Les critères d'évaluation spécifiques (les aspects de la réponse sur lesquels on se concentre).
Quel type de grader est le plus approprié pour évaluer le suivi général de la tâche et la qualité globale ?	Le model-based grader, grâce à sa flexibilité.
Pourquoi est-il conseillé de demander au modèle de fournir des forces et des faiblesses lors de l'évaluation ?	Pour obtenir un score plus concret et éviter des scores moyens
