Claude With The Anthropic Api
← Alle Lektionen
Lektion 19Claude With The Anthropic Api

Running the eval

Zusammenfassung (Audio)

Keine Audio-Zusammenfassung für diese Lektion.

Studiennotizen

Studiennotizen: Aufbau einer Evaluierungs-Pipeline

Ziel der Pipeline:

  • Jeden Datensatz (Test Case) durch einen Prompt leiten, um eine Ausgabe von Claude zu erhalten, und diese Ausgabe anschließend bewerten.

Workflow (Ablauf):

  • Test Case → Merging mit Prompt → Eingabe in Claude → Ausgabe → Durch den Grader.

Die drei Hauptfunktionen:

  • run prompt:
  • Nimmt einen Test Case als Eingabe.
  • Führt eine Merging-Operation zwischen dem Test Case und dem Prompt durch.
  • Sendet den resultierenden Prompt an Claude (via chat).
  • Gibt die generierte Ausgabe (output) von Claude zurück.
  • Hinweis: Aktuell fehlen Formatierungsanweisungen (z. B. für JSON oder Python).
  • run test case:
  • Nimmt einen einzelnen Test Case.
  • Ruft die Funktion run prompt auf, um die Claude-Ausgabe zu erhalten.
  • Führt die Bewertung (Grading) durch.
  • Gibt ein Dictionary zurück, das folgende Informationen enthält:
  • Die Claude-Ausgabe (output).
  • Den ursprünglichen Test Case.
  • Die berechnete Punktzahl (score).
  • Hinweis: Die Bewertung ist momentan hartkodiert (z. B. Score = 10).
  • run eval:
  • Lädt den gesamten Datensatz (oder erhält ihn als Argument).
  • Iteriert durch jeden Test Case im Datensatz.
  • Ruft für jeden Test Case die Funktion run test case auf.
  • Sammelt alle Ergebnisse in einer Liste (results).

Zusammenfassung des aktuellen Stands:

  • Die grundlegende Struktur der Evaluierungs-Pipeline ist implementiert.
  • Der entscheidende Schritt – die Implementierung des Graders – steht noch aus.

Takeaways

  • Die Evaluierungs-Pipeline leitet jeden Test Case durch einen Prompt an Claude, um die Ausgabe anschließend zu bewerten.
  • Die Funktion run prompt führt das Merging zwischen Test Case und Prompt durch, bevor die Eingabe an Claude gesendet wird.
  • run test case ist für die einzelne Bewertung zuständig: Es ruft run prompt auf, führt das Grading durch und gibt Ausgabe, Test Case und Punktzahl zurück.
  • run eval ist die übergeordnete Funktion, die den gesamten Datensatz iterativ durch run test case verarbeitet.
  • Aktuell ist die grundlegende Struktur implementiert, jedoch fehlt die eigentliche Implementierung des Graders.
Lernkarten 6 Karten
Frage
zum Aufdecken klicken · ←/→
Antwort
zum Zurückdrehen klicken
Nach Anki exportieren (.tsv) ↓
Wissensüberprüfung 0 Fragen

No quiz for this lesson yet.