Was ist der Zweck eines Graders im Prompt-Evaluierungsworkflow?	Er gibt ein objektives Signal (z. B. eine Zahl oder Wahr/Falsch) über die Ausgabe des Modells.
Welche drei Arten von Grader werden im Text diskutiert?	Code-basiert, Modell-basiert und menschlich.
Was kann ein Code-basierter Grader programmatisch überprüfen?	Länge, Vorhandensein bestimmter Wörter oder die Syntax von JSON/Code.
Wie funktioniert ein modellbasierter Grader?	Er verwendet ein zusätzliches Modell, um die Ausgabe des ursprünglichen Modells zu bewerten.
Was ist der größte Nachteil der menschlichen Bewertung?	Es ist sehr zeitaufwendig und mühsame Arbeit.
Warum ist es wichtig, Bewertungskriterien vorab festzulegen?	Um genau zu definieren, welche Aspekte der Antworten bewertet werden sollen.
Warum sollte ein Modell-Grader Strengths und Weaknesses angeben, anstatt nur eine Punktzahl?	Um eine konkretere und weniger mittelmäßige Bewertung zu erzielen.
Nennen Sie ein Beispiel für eine Aufgabe, die ein Code-Grader übernehmen kann.	Die Validierung der Syntax von Python oder JSON.
Wie wird ein finaler, objektiver Metrikwert im Testfall berechnet?	Durch die Berechnung des Durchschnittswerts aller einzelnen Grader-Scores.
Was ist die übliche Skala, die Grader verwenden?	Eine Zahl zwischen 1 und
