Zusammenfassung (Audio)
Keine Audio-Zusammenfassung für diese Lektion.
Studiennotizen
📝 Lernnotizen: Evaluierungspipeline (Evaluation Pipeline)
Thema: Aufbau und Funktionsweise einer automatisierten Evaluierungspipeline zur Bewertung von LLM-Outputs.
⚙️ Workflow der Evaluierung
Der gesamte Prozess folgt einem klaren, sequenziellen Workflow:
- Testfall (Test Case): Ein einzelner Datensatz aus dem Test-Set.
- Prompt-Generierung: Der Testfall wird mit einem spezifischen Prompt zusammengeführt.
- LLM-Ausführung: Der erstellte Prompt wird an das Sprachmodell (Claude) gesendet.
- Ergebnis: Claude liefert einen Output.
- Bewertung (Grading): Der Output wird durch einen Grader analysiert und bewertet.
🛠️ Hauptfunktionen der Pipeline
**1. run_prompt(test_case)**
- Zweck: Erstellt die Eingabe für das LLM.
- Prozess:
- Nimmt einen einzelnen Testfall als Eingabe.
- Führt eine Zusammenführung (Merge) des Aufgaben-Tasks mit dem Testfall durch.
- Ruft das LLM (Claude) auf und gibt den generierten Text (Output) zurück.
- Hinweis: Der initiale Prompt ist bewusst einfach gehalten und enthält noch keine spezifischen Formatierungsanweisungen (z. B. JSON, Python).
**2. run_test_case(test_case)**
- Zweck: Führt die Bewertung für einen einzelnen Testfall durch.
- Prozess:
- Ruft run_prompt auf, um den Output von Claude zu erhalten.
- Führt die Bewertung (Grading) durch (aktuell noch ein hartkodierter Score von 10).
- Gibt ein zusammenfassendes Dictionary zurück, das folgende Informationen enthält:
- Der Output von Claude.
- Der ursprüngliche Testfall.
- Der berechnete Score.
**3. run_eval(dataset)**
- Zweck: Steuert den gesamten Evaluierungsprozess über das gesamte Datenset.
- Prozess:
- Lädt das gesamte Datenset (oder erhält es als Argument).
- Iteriert (schleift) durch jeden Testfall im Datenset.
- Ruft für jeden Testfall die Funktion run_test_case auf.
- Sammelt alle Ergebnisse in einer Liste und gibt diese zurück.
💡 Wichtige Konzepte und Erkenntnisse
- Pipeline-Struktur: Die Evaluierung ist in drei klare, modulare Funktionen unterteilt.
- Aktueller Stand: Die gesamte Infrastruktur (Testfall → Prompt → Claude → Sammeln) ist implementiert.
- Offener Punkt: Der eigentliche Grader (die Logik zur Bewertung des Outputs) muss noch implementiert werden.
- Ergebnisformat: Die finale Ausgabe von run_eval ist eine große JSON-Liste, wobei jedes Element ein vollständiges Ergebnis eines einzelnen Testfalls darstellt.
Takeaways
- Die Evaluierungspipeline folgt einem sequenziellen Workflow: Testfall → Prompt-Generierung → LLM-Ausführung → Bewertung (Grading).
- Die Funktion run_prompt ist für die Zusammenführung des Testfalls mit dem Prompt und den Aufruf des LLM zuständig.
- run_test_case führt die Bewertung für einen einzelnen Testfall durch und gibt einen zusammenfassenden Score zurück.
- run_eval steuert den gesamten Prozess, indem es iterativ alle Testfälle über run_test_case verarbeitet.
- Die Infrastruktur ist funktionsfähig, jedoch muss die eigentliche Logik des Graders (die Bewertungsfunktion) noch implementiert werden.
Lernkarten 10 Karten
Frage
zum Aufdecken klicken · ←/→
Antwort
zum Zurückdrehen klicken
Wissensüberprüfung 0 Fragen
No quiz for this lesson yet.