Was ist der allgemeine Ablauf des Evaluation-Pipelines?	Test Case wird mit dem Prompt gemergt, an Claude gesendet, und das Ergebnis wird durch den Grader geleitet.
Was ist der Hauptzweck der Funktion `run_prompt`?	Sie mergt die Aufgabe mit dem Testfall, generiert Text mit Claude und gibt das Ergebnis zurück.
Wie sieht der aktuelle Prompt in der Implementierung aus?	Er ist ein einfacher F-String, der die Aufgabe und den Testfall enthält, aber keine Formatierungsanweisungen.
Was ist die Aufgabe der Funktion `run_test_case`?	Sie ruft `run_prompt` auf, bewertet das Ergebnis (Grading) und gibt ein zusammenfassendes Dictionary zurück.
Welche Funktion ist dafür zuständig, den gesamten Datensatz zu verarbeiten?	Die Funktion `run_eval`.
Wie funktioniert die Funktion `run_eval`?	Sie lädt den Datensatz und iteriert durch jeden Testfall, um `run_test_case` aufzurufen und die Ergebnisse zu sammeln.
Was ist der aktuelle Zustand des Grading-Prozesses in der Implementierung?	Er ist noch nicht implementiert und wird durch einen hartkodierten Score (z. B. 10) ersetzt.
Was ist das Ziel des Prompt-Designs in der zukünftigen Verbesserung?	Sicherzustellen, dass Claude nur spezifische Formate wie Python, JSON oder reguläre Ausdrücke ausgibt.
Was ist das Endformat der Ergebnisse, die `run_eval` liefert?	Ein Array von Objekten, wobei jedes Objekt die Ausgabe und den Score eines einzelnen Testfalls darstellt.
Was ist der nächste logische Schritt nach der Erstellung des aktuellen Pipelines-Outlines?	Die Implementierung der Grader (Bewertungslogik).
