Claude On Google Cloud
← Alle Lektionen
Lektion 17Claude On Google Cloud

Running the eval

Zusammenfassung (Audio)

Keine Audio-Zusammenfassung für diese Lektion.

Studiennotizen

📝 Lernnotizen: Evaluierungspipeline (Evaluation Pipeline)

Thema: Aufbau und Funktionsweise einer automatisierten Evaluierungspipeline zur Bewertung von LLM-Outputs.

⚙️ Workflow der Evaluierung

Der gesamte Prozess folgt einem klaren, sequenziellen Workflow:

  • Testfall (Test Case): Ein einzelner Datensatz aus dem Test-Set.
  • Prompt-Generierung: Der Testfall wird mit einem spezifischen Prompt zusammengeführt.
  • LLM-Ausführung: Der erstellte Prompt wird an das Sprachmodell (Claude) gesendet.
  • Ergebnis: Claude liefert einen Output.
  • Bewertung (Grading): Der Output wird durch einen Grader analysiert und bewertet.

🛠️ Hauptfunktionen der Pipeline

**1. run_prompt(test_case)**

  • Zweck: Erstellt die Eingabe für das LLM.
  • Prozess:
  • Nimmt einen einzelnen Testfall als Eingabe.
  • Führt eine Zusammenführung (Merge) des Aufgaben-Tasks mit dem Testfall durch.
  • Ruft das LLM (Claude) auf und gibt den generierten Text (Output) zurück.
  • Hinweis: Der initiale Prompt ist bewusst einfach gehalten und enthält noch keine spezifischen Formatierungsanweisungen (z. B. JSON, Python).

**2. run_test_case(test_case)**

  • Zweck: Führt die Bewertung für einen einzelnen Testfall durch.
  • Prozess:
  • Ruft run_prompt auf, um den Output von Claude zu erhalten.
  • Führt die Bewertung (Grading) durch (aktuell noch ein hartkodierter Score von 10).
  • Gibt ein zusammenfassendes Dictionary zurück, das folgende Informationen enthält:
  • Der Output von Claude.
  • Der ursprüngliche Testfall.
  • Der berechnete Score.

**3. run_eval(dataset)**

  • Zweck: Steuert den gesamten Evaluierungsprozess über das gesamte Datenset.
  • Prozess:
  • Lädt das gesamte Datenset (oder erhält es als Argument).
  • Iteriert (schleift) durch jeden Testfall im Datenset.
  • Ruft für jeden Testfall die Funktion run_test_case auf.
  • Sammelt alle Ergebnisse in einer Liste und gibt diese zurück.

💡 Wichtige Konzepte und Erkenntnisse

  • Pipeline-Struktur: Die Evaluierung ist in drei klare, modulare Funktionen unterteilt.
  • Aktueller Stand: Die gesamte Infrastruktur (Testfall → Prompt → Claude → Sammeln) ist implementiert.
  • Offener Punkt: Der eigentliche Grader (die Logik zur Bewertung des Outputs) muss noch implementiert werden.
  • Ergebnisformat: Die finale Ausgabe von run_eval ist eine große JSON-Liste, wobei jedes Element ein vollständiges Ergebnis eines einzelnen Testfalls darstellt.

Takeaways

  • Die Evaluierungspipeline folgt einem sequenziellen Workflow: Testfall → Prompt-Generierung → LLM-Ausführung → Bewertung (Grading).
  • Die Funktion run_prompt ist für die Zusammenführung des Testfalls mit dem Prompt und den Aufruf des LLM zuständig.
  • run_test_case führt die Bewertung für einen einzelnen Testfall durch und gibt einen zusammenfassenden Score zurück.
  • run_eval steuert den gesamten Prozess, indem es iterativ alle Testfälle über run_test_case verarbeitet.
  • Die Infrastruktur ist funktionsfähig, jedoch muss die eigentliche Logik des Graders (die Bewertungsfunktion) noch implementiert werden.
Lernkarten 10 Karten
Frage
zum Aufdecken klicken · ←/→
Antwort
zum Zurückdrehen klicken
Nach Anki exportieren (.tsv) ↓
Wissensüberprüfung 0 Fragen

No quiz for this lesson yet.