Was ist die Funktion eines "Graders" im Prompt-Evaluierungsworkflow?	Ein Grader nimmt die Ausgabe eines Modells entgegen und gibt ein objektives Signal (z.B. eine Zahl) zurück.
Welche drei Arten von Grader werden im Text diskutiert?	Code-based, Model-based und Human-based Graders.
Wie funktioniert ein Code-based Grader?	Er führt programmatische Prüfungen (z.B. Syntax, Länge, Lesbarkeit) auf der Modell-Ausgabe mithilfe eines eigenen Code-Snippets durch.
Was ist ein Model-based Grader?	Er verwendet ein zusätzliches LLM (API-Aufruf), um die Qualität der ursprünglichen Modell-Ausgabe zu bewerten.
Was ist der größte Nachteil der menschlichen Bewertung (Human-based grading)?	Es ist sehr zeitaufwendig und mühsame Arbeit (tedious).
Warum sollte ein Model-based Grader mehr als nur eine Punktzahl liefern?	Um konkretere und weniger "mittlere" Bewertungen zu erhalten, indem Stärken, Schwächen und Begründungen abgefragt werden.
Welche drei Bewertungskriterien wurden im Beispiel genannt?	Format (Python/JSON/Regex), Syntaxvalidierung und allgemeine Aufgabenbefolgung (Task Following).
