Was ist die Hauptaufgabe eines Graders in einem Prompt-Evaluierungs-Workflow?	Ein Grader nimmt die Ausgabe eines Modells entgegen und gibt ein objektives Signal (z. B. eine Zahl) zurück.
Welche drei Arten von Grader werden im Transkript diskutiert?	Code-basierte, modellbasierte und menschliche Grader.
Wofür wird ein code-basierter Grader verwendet?	Um programmatische Prüfungen durchzuführen, wie z. B. Länge, Wortpräsenz oder Syntaxvalidierung.
Wie funktioniert ein modellbasierter Grader?	Er nimmt die Ausgabe des ursprünglichen Modells und gibt sie an ein zusätzliches Modell (eine weitere API-Anfrage) zur Bewertung.
Was ist der größte Nachteil der menschlichen Bewertung (Human-based Grading)?	Es ist sehr zeitaufwendig und mühsame Arbeit.
Nennen Sie drei spezifische Bewertungskriterien, die im Transkript genannt wurden.	Format (z. B. Python/JSON), Syntax und allgemeines Task Following (Aufgabenerfüllung).
Welcher Grader ist am besten geeignet, um Format und Syntax zu überprüfen?	Ein code-basierter Grader.
Welcher Grader ist am flexibelsten für die Bewertung der allgemeinen Aufgabenbefolgung (Task Following)?	Ein modellbasierter Grader.
Warum wird empfohlen, einem Modellgrader nach Stärken und Schwächen zu fragen?	Um eine präzisere und weniger mittlere (z. B. eine 6) Bewertung zu erhalten.
Wie wird am Ende ein objektiver Metrikwert aus den einzelnen Grader-Scores ermittelt?	Durch die Berechnung des Durchschnittswerts (Mean) aller Scores.
