Claude On Google Cloud
← Toutes les leçons
Leçon 15Claude On Google Cloud

A typical eval workflow

Audio récapitulatif

Pas de récapitulatif audio pour cette leçon.

Notes de cours

Notes d'étude : Flux de travail d'évaluation de prompts (Prompt Evaluation Workflow)

  • Flexibilité du Workflow :
  • Il n'existe pas de méthodologie unique ou standardisée pour les flux de travail d'évaluation.
  • De nombreuses options (open source ou payantes) permettent de construire son propre système.
  • Il est possible de commencer petit pour comprendre le fonctionnement avant de passer à une solution plus complexe.
  • Étapes d'un Workflow Typique d'Évaluation :
  • Élaboration du Prompt Initial :
  • Rédiger une ébauche de prompt de base (ex. : "Veuillez répondre à la question de l'utilisateur").
  • Création de l'Ensemble de Données d'Évaluation (Dataset) :
  • Constituer une liste d'entrées possibles (questions) pour le prompt.
  • Note : Dans la réalité, ce jeu de données peut contenir des centaines ou des milliers d'enregistrements.
  • Génération des Réponses :
  • Soumettre chaque entrée du dataset au prompt complet (Prompt + Question).
  • Faire appel à un modèle de langage (LLM, ex. Claude) pour obtenir une réponse pour chaque entrée.
  • Notation (Grading) :
  • Paire chaque question avec la réponse générée par le LLM.
  • Soumettre cette paire à un "gradeur" (souvent un autre LLM) pour obtenir un score de qualité.
  • Le score est typiquement donné sur une échelle (ex. : de 1 à 10).
  • Agrégation des Scores :
  • Calculer la moyenne de tous les scores obtenus pour obtenir une métrique objective de la performance du prompt initial.
  • Itération et Amélioration :
  • Utiliser le score pour modifier et affiner le prompt (ex. : ajouter des instructions plus détaillées).
  • Répéter l'intégralité du processus (Étapes 2 à 5) avec le nouveau prompt.
  • Comparer les scores des différentes versions de prompt pour déterminer laquelle est la meilleure.

Takeaways

  • Le workflow d'évaluation des prompts n'est pas standardisé et permet la construction de systèmes personnalisés.
  • Le processus est itératif : il consiste à tester un prompt, analyser les scores, et l'améliorer en répétant le cycle.
  • L'évaluation nécessite la création d'un ensemble de données (dataset) pour soumettre le prompt à des entrées variées.
  • La notation (grading) est souvent effectuée par un "gradeur", qui est typiquement un autre modèle de langage (LLM).
Cartes mémo 8 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 0 questions

No quiz for this lesson yet.