Audio récapitulatif
Pas de récapitulatif audio pour cette leçon.
Notes de cours
📝 Notes d'étude : Systèmes d'évaluation (Grading Systems)
🎯 Objectif du Grader
- Un évaluateur (grader) prend en entrée la sortie d'un modèle (output) et doit fournir un signal objectif.
- Ce signal peut être un nombre (le plus fréquent), un vrai/faux, ou toute autre donnée structurée.
- Pratique courante : Un score numérique entre 1 et 10 (10 = haute qualité, 1 = basse qualité).
🛠️ Les Trois Types d'Évaluateurs
- Évaluateur basé sur le Code (Code-based Grader)
- Utilise un extrait de code personnalisé pour vérifier la sortie du modèle.
- Vérifications possibles : Longueur, présence de mots spécifiques, validation de la syntaxe (JSON, code), score de lisibilité.
- Exigence : Le code doit retourner un signal utilisable.
- Évaluateur basé sur un Modèle (Model-based Grader)
- Envoie la sortie du modèle initial à un modèle supplémentaire (une nouvelle requête API).
- Avantage : Grande flexibilité (qualité générale, suivi des instructions, complétude).
- Exigence : Le modèle doit fournir un signal objectif (souvent un score entre 1 et 10).
- Évaluation Humaine (Human-based Grading)
- Une personne réelle évalue les réponses du modèle.
- Avantage : Flexibilité maximale pour n'importe quel critère.
- Inconvénient : Très chronophage et fastidieux.
📋 Critères d'Évaluation
- Il est essentiel de définir les critères d'évaluation avant de commencer.
- Exemples de critères :
- Format de sortie (Python, JSON, Regex) sans explication supplémentaire.
- Validité de la syntaxe (pas de fautes de frappe).
- Suivi général de la tâche (réponse claire et code sans erreur logique majeure).
🧠 Application Pratique (Exemple)
- Format et Syntaxe : Idéal pour un Évaluateur basé sur le Code.
- Suivi Général de la Tâche : Idéal pour un Évaluateur basé sur un Modèle (en raison de sa flexibilité).
💡 Conseils pour le Model Grader
- Prompt détaillé : Le prompt doit définir le rôle, la tâche, la solution générée et les directions de réponse.
- Améliorer la qualité du score : Demander au modèle de fournir des forces, des faiblesses et un raisonnement en plus du score. Cela force le modèle à être plus précis et évite des scores génériques (comme un "6").
- Structure de sortie : Utiliser le format JSON pour faciliter l'extraction des données.
- Finalisation : Après avoir obtenu les scores individuels, il est nécessaire de calculer une moyenne pour obtenir une métrique objective finale.
Takeaways
- Un évaluateur (grader) doit fournir un signal objectif (nombre, vrai/faux, etc. ) en réponse à la sortie d'un modèle.
- Il existe trois types d'évaluateurs : basé sur le Code (vérification syntaxique), basé sur un Modèle (flexibilité générale), et Humain (flexibilité maximale mais chronophage).
- Il est essentiel de définir les critères d'évaluation (format, syntaxie, suivi de la tâche) avant de commencer l'évaluation.
- Pour un Évaluateur basé sur un Modèle, il est recommandé d'utiliser un prompt détaillé, de demander un raisonnement, et de structurer la sortie en JSON pour faciliter l'extraction des données.
Cartes mémo 7 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Vérification des connaissances 0 questions
No quiz for this lesson yet.