Was ist die wichtigste Erkenntnis bezüglich Prompt-Evaluations-Workflows?	Es gibt keine einheitliche Standardmethode; Workflows können individuell zusammengestellt werden.
Wie sollte man Prompt-Evaluierungen anfänglich angehen?	Man sollte klein beginnen und einen benutzerdefinierten Workflow (z. B. in einem Jupyter Notebook) implementieren.
Was ist der erste Schritt in einem typischen Prompt-Evaluationsprozess?	Das Verfassen eines initialen Prompt-Entwurfs (Initial Prompt Draft).
Was ist der Zweck eines Evaluierungsdatensatzes (Evaluation Dataset)?	Er enthält eine Liste möglicher Eingaben (Inputs), die in den Prompt eingefügt werden sollen.
Was geschieht nach der Erstellung des Evaluierungsdatensatzes?	Jede Eingabe wird in den Prompt eingefügt und an das Sprachmodell (z. B. Claude) gesendet, um eine Antwort zu erhalten.
Welche Funktion hat der "Grader" (Bewertungsmechanismus) im Workflow?	Er bewertet die Qualität der vom Modell generierten Antworten und vergibt eine Punktzahl (z. B. 1 bis 10).
Was repräsentiert eine Punktzahl von 10 im Grading-Schritt?	Eine perfekte Antwort, bei der keine Verbesserung mehr möglich ist.
Was ist der nächste Schritt nach der Erfassung der einzelnen Bewertungen?	Die Scores werden gemittelt, um eine objektive Gesamtleistung des Prompts zu erhalten.
Warum wird der gesamte Prozess wiederholt?	Um den Prompt iterativ zu verbessern und zu sehen, ob eine neue Version einen höheren Score erzielt.
Welche Methoden gibt es, um Evaluierungsdatensätze zu erstellen?	Man kann sie manuell zusammenstellen oder mithilfe von LLMs (wie Claude) generieren lassen.
