Est-ce qu'il existe une méthodologie unique et standard pour un workflow d'évaluation de prompts ?	Non, il n'y a pas de méthodologie unique imposée par l'industrie.
Quelles options existent pour implémenter un workflow d'évaluation de prompts ?	Des packages open source, des options payantes, ou une implémentation personnalisée (from scratch).
Quelle est la première étape d'un workflow typique d'évaluation de prompts ?	Rédiger un brouillon initial du prompt (initial prompt draft).
Quel est le rôle de l'ensemble de données d'évaluation (evaluation data set) ?	Contenir une liste de tous les inputs possibles (questions) qui seront testés par le prompt.
Comment peut-on constituer un ensemble de données d'évaluation ?	Manuellement ou en utilisant des outils d'IA (comme Claude) pour la génération.
Que se passe-t-il après avoir créé l'ensemble de données d'évaluation ?	Chaque input est combiné avec le prompt et envoyé au modèle (ex: Claude) pour obtenir une réponse.
Comment le processus de notation (grading) fonctionne-t-il ?	On couple chaque question avec la réponse obtenue, puis on la soumet à un "grader" pour obtenir un score (ex: 1 à 10).
Quel est l'objectif de l'étape d'agrégation des scores ?	Obtenir une mesure objective de la performance globale du prompt (par exemple, la moyenne).
Que fait-on après avoir obtenu un score moyen ?	On modifie le prompt (itération) et on répète tout le processus pour comparer les versions.
