Audio récapitulatif
Pas de récapitulatif audio pour cette leçon.
Notes de cours
📝 Notes de Cours : Pipeline d'Évaluation (Eval Pipeline)
**I. Vue d'ensemble du Workflow d'Évaluation**
- Le pipeline d'évaluation prend un ensemble de données (le jeu de tests) et le fait passer par un processus structuré pour obtenir des résultats et des scores.
- Flux de travail : Cas de Test → Fusion avec le Prompt → Exécution par Claude → Sortie → Grille d'Évaluation (Grader).
- L'objectif est de générer des sorties spécifiques (ex: Python, JSON, expressions régulières) à partir des prompts.
**II. Fonctions Clés du Pipeline**
- run_prompt(test_case)
- Rôle : Fusionne le cas de test avec le prompt initial.
- Processus : Envoie le prompt fusionné à Claude (via chat).
- Sortie : Retourne le texte généré par Claude (l'output).
- Note : Le prompt initial est simple et ne contient pas encore d'instructions de formatage strict.
- run_test_case(test_case)
- Rôle : Gère le cycle complet pour un seul cas de test.
- Processus :
- Appelle run_prompt avec le cas de test.
- Effectue l'évaluation (Grading) sur le résultat de Claude.
- Retourne un dictionnaire récapitulatif.
- Sortie (Dictionnaire) : Contient l'output de Claude, le cas de test original, et le score.
- run_eval(data_set)
- Rôle : Orchestre l'exécution de l'évaluation sur l'ensemble du jeu de données.
- Processus : Boucle à travers chaque cas de test dans le jeu de données.
- Action : Appelle run_test_case pour chaque cas.
- Sortie : Retourne une liste de tous les résultats collectés.
**III. Concepts Importants**
- Jeu de Données (Data Set) : Ensemble des cas de test utilisés pour l'évaluation.
- Cas de Test (Test Case) : Chaque enregistrement individuel du jeu de données.
- Grille d'Évaluation (Grader) : Le composant final (non encore implémenté dans l'exemple) qui prend l'entrée et le résultat de Claude pour déterminer un score.
- Résultats Finaux : Un grand objet JSON où chaque entrée représente le résultat d'un cas de test unique (output, cas de test, score).
Takeaways
- Le pipeline d'évaluation prend un jeu de tests et le fait passer par un processus structuré pour générer des scores.
- run_prompt fusionne un cas de test avec le prompt initial et envoie le résultat à Claude.
- run_test_case gère le cycle complet pour un seul cas de test : appel à Claude puis évaluation (Grading).
- run_eval orchestre l'évaluation en bouclant sur chaque cas de test du jeu de données.
- Le Grader est le composant final qui détermine le score en analysant l'output de Claude.
Cartes mémo 6 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Vérification des connaissances 0 questions
No quiz for this lesson yet.