Wie lautet der allgemeine Workflow zur Bewertung eines Testfalls?	Testfall + Prompt -> Claude -> Grader.
Was ist der Hauptzweck der Funktion `run prompt`?	Den Testfall mit dem Prompt zu mergen und das Ergebnis von Claude zu erhalten.
Welche Schritte führt die Funktion `run test case` durch?	Sie ruft `run prompt` auf, bewertet das Ergebnis (Grading) und gibt ein zusammenfassendes Dictionary zurück.
Was ist die Aufgabe der Funktion `run eval`?	Das gesamte Datenset zu laden und für jeden Testfall `run test case` aufzurufen.
Welche Informationen enthält das Dictionary, das von `run test case` zurückgegeben wird?	Die Ausgabe von Claude, den Testfall und den Score.
Was ist eine aktuelle Einschränkung des `run prompt` in Bezug auf die Ausgabe?	Es fehlen Formatierungsanweisungen (z.B. für JSON oder Python).
Was ist der letzte Schritt im gesamten Bewertungsprozess?	Die Eingabe und das Ergebnis an einen Grader zu übergeben.
