Claude With The Anthropic Api
← Toutes les leçons
Leçon 19Claude With The Anthropic Api

Running the eval

Audio récapitulatif

Pas de récapitulatif audio pour cette leçon.

Notes de cours

📝 Notes de Cours : Pipeline d'Évaluation (Eval Pipeline)

**I. Vue d'ensemble du Workflow d'Évaluation**

  • Le pipeline d'évaluation prend un ensemble de données (le jeu de tests) et le fait passer par un processus structuré pour obtenir des résultats et des scores.
  • Flux de travail : Cas de Test → Fusion avec le Prompt → Exécution par Claude → Sortie → Grille d'Évaluation (Grader).
  • L'objectif est de générer des sorties spécifiques (ex: Python, JSON, expressions régulières) à partir des prompts.

**II. Fonctions Clés du Pipeline**

  • run_prompt(test_case)
  • Rôle : Fusionne le cas de test avec le prompt initial.
  • Processus : Envoie le prompt fusionné à Claude (via chat).
  • Sortie : Retourne le texte généré par Claude (l'output).
  • Note : Le prompt initial est simple et ne contient pas encore d'instructions de formatage strict.
  • run_test_case(test_case)
  • Rôle : Gère le cycle complet pour un seul cas de test.
  • Processus :
  • Appelle run_prompt avec le cas de test.
  • Effectue l'évaluation (Grading) sur le résultat de Claude.
  • Retourne un dictionnaire récapitulatif.
  • Sortie (Dictionnaire) : Contient l'output de Claude, le cas de test original, et le score.
  • run_eval(data_set)
  • Rôle : Orchestre l'exécution de l'évaluation sur l'ensemble du jeu de données.
  • Processus : Boucle à travers chaque cas de test dans le jeu de données.
  • Action : Appelle run_test_case pour chaque cas.
  • Sortie : Retourne une liste de tous les résultats collectés.

**III. Concepts Importants**

  • Jeu de Données (Data Set) : Ensemble des cas de test utilisés pour l'évaluation.
  • Cas de Test (Test Case) : Chaque enregistrement individuel du jeu de données.
  • Grille d'Évaluation (Grader) : Le composant final (non encore implémenté dans l'exemple) qui prend l'entrée et le résultat de Claude pour déterminer un score.
  • Résultats Finaux : Un grand objet JSON où chaque entrée représente le résultat d'un cas de test unique (output, cas de test, score).

Takeaways

  • Le pipeline d'évaluation prend un jeu de tests et le fait passer par un processus structuré pour générer des scores.
  • run_prompt fusionne un cas de test avec le prompt initial et envoie le résultat à Claude.
  • run_test_case gère le cycle complet pour un seul cas de test : appel à Claude puis évaluation (Grading).
  • run_eval orchestre l'évaluation en bouclant sur chaque cas de test du jeu de données.
  • Le Grader est le composant final qui détermine le score en analysant l'output de Claude.
Cartes mémo 6 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 0 questions

No quiz for this lesson yet.