Was ist der allgemeine Workflow nach der Datensatzgenerierung?	Testfall + Prompt -> Claude -> Grader.
Was ist der Hauptzweck der Funktion `run prompt`?	Einen Testfall mit dem Prompt zusammenführen, Claude aufrufen und das generierte Ergebnis zurückgeben.
Welche Schritte beinhaltet die Funktion `run test case`?	`run prompt` aufrufen, das Ergebnis bewerten (gradieren) und ein zusammenfassendes Dictionary zurückgeben.
Was ist die Aufgabe der Funktion `run eval`?	Den gesamten Datensatz laden und für jeden Testfall `run test case` aufrufen, um alle Ergebnisse zu sammeln.
Was ist derzeit ein Mangel im Prompt, der verbessert werden muss?	Es fehlen Formatierungsanweisungen (z. B. für JSON oder Python).
Wie wird die Bewertung (Grading) in der aktuellen Implementierung von `run test case` durchgeführt?	Sie ist derzeit hart codiert (hardcoded) mit einem Score von 10.
