Zusammenfassung (Audio)
Keine Audio-Zusammenfassung für diese Lektion.
Studiennotizen
🎯 Zweck des Graders
- Ein Grader nimmt die Ausgabe eines Modells entgegen und liefert ein objektives Signal.
- Ziel: Messung der Qualität der Modellantwort.
- Häufiges Format: Eine numerische Bewertung zwischen 1 und 10 (1 = sehr geringe Qualität, 10 = sehr hohe Qualität).
⚙️ Drei Arten von Grader-Systemen
1. Code-basierter Grader (Code-based Grader)
- Funktionsweise: Die Modell-Ausgabe wird durch ein selbst geschriebenes Code-Snippet geleitet.
- Anwendungsfälle:
- Prüfung der Länge (zu kurz/zu lang).
- Prüfung auf das Vorhandensein bestimmter Wörter.
- Syntax-Validierung (z. B. für JSON oder Code).
- Komplexe Metriken (z. B. Lesbarkeits-Score).
- Anforderung: Muss ein nutzbares Signal zurückgeben.
2. Modell-basierter Grader (Model-based Grader)
- Funktionsweise: Die Ausgabe des ursprünglichen Modells wird als Input für ein zusätzliches Modell (eine weitere API-Anfrage) verwendet.
- Anwendungsfälle:
- Bewertung der allgemeinen Qualität.
- Prüfung der Einhaltung von Prompt-Anweisungen.
- Bewertung der Vollständigkeit der Antwort.
- Anforderung: Das Modell muss ein objektives Signal (meist 1 bis 10) liefern.
3. Mensch-basierte Bewertung (Human-based Grading)
- Funktionsweise: Die Modell-Ausgaben werden einem menschlichen Evaluator vorgelegt.
- Vorteile: Maximale Flexibilität bei der Definition der Bewertungsmetriken.
- Nachteile: Sehr zeitaufwendig und mühsame Arbeit.
📝 Evaluierungskriterien und Workflow
- Voraussetzung: Die Bewertungskriterien müssen vorab festgelegt werden (z. B. Format, Syntax, Aufgabenbefolgung).
- Anwendungsbeispiel:
- Format und Syntax (Python, JSON, Regex) → Code-basierter Grader.
- Allgemeine Aufgabenbefolgung und Korrektheit → Modell-basierter Grader.
💡 Best Practices für den Modell-basierten Grader
- Prompt-Struktur: Der Prompt muss eine Rolle festlegen, die Aufgabe definieren, die generierte Lösung auflisten und klare Antwortrichtlinien geben.
- Qualität der Bewertung: Um konkretere und weniger "mittlere" Scores zu erhalten, sollte der Grader nicht nur nach einem Score gefragt werden.
- Empfehlung: Fordern Sie zusätzlich Stärken, Schwächen und Begründungen an.
- Implementierung: Die Ausgabe des Graders sollte idealerweise als JSON-Objekt strukturiert sein.
📊 Gesamt-Workflow
- Testfälle definieren.
- Modell-Ausgabe generieren.
Takeaways
- Ein Grader liefert ein objektives Signal zur Messung der Modellqualität, oft als numerische Bewertung (z. B. 1 bis 10).
- Code-basierte Grader nutzen selbst geschriebenes Code-Snippet zur Prüfung spezifischer Kriterien wie Syntax, Länge oder Wortvorhandensein.
- Modell-basierte Grader verwenden ein zweites Modell (API-Anfrage), um die allgemeine Qualität oder die Einhaltung von Prompt-Anweisungen zu bewerten.
- Mensch-basierte Bewertungen bieten maximale Flexibilität bei den Metriken, sind jedoch zeitaufwendig.
- Bei Modell-basierten Grader ist es wichtig, dem Grader eine klare Rolle zu geben und zusätzlich zu einem Score Stärken, Schwächen und Begründungen anzufordern.
Lernkarten 10 Karten
Frage
zum Aufdecken klicken · ←/→
Antwort
zum Zurückdrehen klicken
Wissensüberprüfung 0 Fragen
No quiz for this lesson yet.