Claude On Google Cloud
← Toutes les leçons
Leçon 17Claude On Google Cloud

Running the eval

Audio récapitulatif

Pas de récapitulatif audio pour cette leçon.

Notes de cours

Concepts Clés du Pipeline d'Évaluation (Eval Pipeline)

  • Objectif du Pipeline : Tester un ensemble de données (dataset) en utilisant un modèle (Claude) et en évaluant les résultats.
  • Workflow Général :
  • Prendre chaque enregistrement du dataset (appelé test case).
  • Fusionner le test case avec le prompt.
  • Soumettre le résultat fusionné à Claude.
  • Passer les sorties de Claude à un grader (évaluateur).
  • Fonctions Principales :
  • run_prompt(test_case) :
  • Rôle : Fusionner le test case avec le prompt prédéfini.
  • Processus : Appeler Claude avec le message utilisateur (le prompt fusionné).
  • Sortie : Le texte généré par Claude (l'output).
  • Note : Le prompt initial est simple (ex: "Veuillez résoudre la tâche suivante") et ne contient pas encore d'instructions de format (JSON, Python, etc. ).
  • run_test_case(test_case) :
  • Rôle : Exécuter un cas de test individuel.
  • Processus :
  • Appeler run_prompt avec le test case.
  • Effectuer le grading (évaluation) du résultat de Claude.
  • Retourner un dictionnaire résumant l'exécution.
  • Sortie : Un dictionnaire contenant l'output de Claude, le test case original et le score.
  • run_eval(dataset) :
  • Rôle : Gérer l'ensemble du processus d'évaluation.
  • Processus :
  • Charger le dataset.
  • Boucler sur chaque test case du dataset.
  • Appeler run_test_case pour chaque cas.
  • Assemblage des résultats.
  • Sortie : Une liste de dictionnaires, où chaque dictionnaire représente le résultat d'un cas de test.
  • Points Clés à Retenir :
  • Le pipeline est structuré en trois étapes logiques : Prompt → Test Case → Évaluation Globale.
  • Le grading est l'étape manquante/future, mais il est essentiel pour transformer l'output brut de Claude en un score quantifiable.
  • L'exécution complète (run_eval) prend du temps, ce qui nécessite des techniques d'optimisation.

Takeaways

  • L'objectif du pipeline d'évaluation est de tester un jeu de données (dataset) en soumettant chaque cas de test (test case) à un modèle (Claude) pour évaluer ses résultats.
  • Le workflow général consiste à fusionner le test case avec le prompt, soumettre le résultat à Claude, puis passer la sortie à un évaluateur (grader).
  • La fonction run_prompt est responsable de la génération de l'output brut de Claude à partir d'un cas de test.
  • La fonction run_test_case orchestre l'exécution d'un seul cas de test, incluant l'appel à run_prompt et l'étape de grading pour obtenir un score.
  • La fonction run_eval gère l'ensemble du processus en bouclant sur le dataset et en assemblant les résultats de chaque cas de test.
Cartes mémo 9 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 0 questions

No quiz for this lesson yet.