Zusammenfassung (Audio)
Keine Audio-Zusammenfassung für diese Lektion.
Studiennotizen
Studiennotizen: Aufbau einer Evaluierungs-Pipeline
Ziel der Pipeline:
- Jeden Datensatz (Test Case) durch einen Prompt leiten, um eine Ausgabe von Claude zu erhalten, und diese Ausgabe anschließend bewerten.
Workflow (Ablauf):
- Test Case → Merging mit Prompt → Eingabe in Claude → Ausgabe → Durch den Grader.
Die drei Hauptfunktionen:
- run prompt:
- Nimmt einen Test Case als Eingabe.
- Führt eine Merging-Operation zwischen dem Test Case und dem Prompt durch.
- Sendet den resultierenden Prompt an Claude (via chat).
- Gibt die generierte Ausgabe (output) von Claude zurück.
- Hinweis: Aktuell fehlen Formatierungsanweisungen (z. B. für JSON oder Python).
- run test case:
- Nimmt einen einzelnen Test Case.
- Ruft die Funktion run prompt auf, um die Claude-Ausgabe zu erhalten.
- Führt die Bewertung (Grading) durch.
- Gibt ein Dictionary zurück, das folgende Informationen enthält:
- Die Claude-Ausgabe (output).
- Den ursprünglichen Test Case.
- Die berechnete Punktzahl (score).
- Hinweis: Die Bewertung ist momentan hartkodiert (z. B. Score = 10).
- run eval:
- Lädt den gesamten Datensatz (oder erhält ihn als Argument).
- Iteriert durch jeden Test Case im Datensatz.
- Ruft für jeden Test Case die Funktion run test case auf.
- Sammelt alle Ergebnisse in einer Liste (results).
Zusammenfassung des aktuellen Stands:
- Die grundlegende Struktur der Evaluierungs-Pipeline ist implementiert.
- Der entscheidende Schritt – die Implementierung des Graders – steht noch aus.
Takeaways
- Die Evaluierungs-Pipeline leitet jeden Test Case durch einen Prompt an Claude, um die Ausgabe anschließend zu bewerten.
- Die Funktion run prompt führt das Merging zwischen Test Case und Prompt durch, bevor die Eingabe an Claude gesendet wird.
- run test case ist für die einzelne Bewertung zuständig: Es ruft run prompt auf, führt das Grading durch und gibt Ausgabe, Test Case und Punktzahl zurück.
- run eval ist die übergeordnete Funktion, die den gesamten Datensatz iterativ durch run test case verarbeitet.
- Aktuell ist die grundlegende Struktur implementiert, jedoch fehlt die eigentliche Implementierung des Graders.
Lernkarten 6 Karten
Frage
zum Aufdecken klicken · ←/→
Antwort
zum Zurückdrehen klicken
Wissensüberprüfung 0 Fragen
No quiz for this lesson yet.