Claude With Amazon Bedrock
← Alle Lektionen
Lektion 17Claude With Amazon Bedrock

Model based grading

Zusammenfassung (Audio)

Keine Audio-Zusammenfassung für diese Lektion.

Studiennotizen

🎯 Zweck des Graders

  • Ein Grader nimmt die Ausgabe eines Modells entgegen und liefert ein objektives Signal.
  • Ziel: Messung der Qualität der Modellantwort.
  • Häufiges Format: Eine numerische Bewertung zwischen 1 und 10 (1 = sehr geringe Qualität, 10 = sehr hohe Qualität).

⚙️ Drei Arten von Grader-Systemen

1. Code-basierter Grader (Code-based Grader)

  • Funktionsweise: Die Modell-Ausgabe wird durch ein selbst geschriebenes Code-Snippet geleitet.
  • Anwendungsfälle:
  • Prüfung der Länge (zu kurz/zu lang).
  • Prüfung auf das Vorhandensein bestimmter Wörter.
  • Syntax-Validierung (z. B. für JSON oder Code).
  • Komplexe Metriken (z. B. Lesbarkeits-Score).
  • Anforderung: Muss ein nutzbares Signal zurückgeben.

2. Modell-basierter Grader (Model-based Grader)

  • Funktionsweise: Die Ausgabe des ursprünglichen Modells wird als Input für ein zusätzliches Modell (eine weitere API-Anfrage) verwendet.
  • Anwendungsfälle:
  • Bewertung der allgemeinen Qualität.
  • Prüfung der Einhaltung von Prompt-Anweisungen.
  • Bewertung der Vollständigkeit der Antwort.
  • Anforderung: Das Modell muss ein objektives Signal (meist 1 bis 10) liefern.

3. Mensch-basierte Bewertung (Human-based Grading)

  • Funktionsweise: Die Modell-Ausgaben werden einem menschlichen Evaluator vorgelegt.
  • Vorteile: Maximale Flexibilität bei der Definition der Bewertungsmetriken.
  • Nachteile: Sehr zeitaufwendig und mühsame Arbeit.

📝 Evaluierungskriterien und Workflow

  • Voraussetzung: Die Bewertungskriterien müssen vorab festgelegt werden (z. B. Format, Syntax, Aufgabenbefolgung).
  • Anwendungsbeispiel:
  • Format und Syntax (Python, JSON, Regex) → Code-basierter Grader.
  • Allgemeine Aufgabenbefolgung und Korrektheit → Modell-basierter Grader.

💡 Best Practices für den Modell-basierten Grader

  • Prompt-Struktur: Der Prompt muss eine Rolle festlegen, die Aufgabe definieren, die generierte Lösung auflisten und klare Antwortrichtlinien geben.
  • Qualität der Bewertung: Um konkretere und weniger "mittlere" Scores zu erhalten, sollte der Grader nicht nur nach einem Score gefragt werden.
  • Empfehlung: Fordern Sie zusätzlich Stärken, Schwächen und Begründungen an.
  • Implementierung: Die Ausgabe des Graders sollte idealerweise als JSON-Objekt strukturiert sein.

📊 Gesamt-Workflow

  • Testfälle definieren.
  • Modell-Ausgabe generieren.

Takeaways

  • Ein Grader liefert ein objektives Signal zur Messung der Modellqualität, oft als numerische Bewertung (z. B. 1 bis 10).
  • Code-basierte Grader nutzen selbst geschriebenes Code-Snippet zur Prüfung spezifischer Kriterien wie Syntax, Länge oder Wortvorhandensein.
  • Modell-basierte Grader verwenden ein zweites Modell (API-Anfrage), um die allgemeine Qualität oder die Einhaltung von Prompt-Anweisungen zu bewerten.
  • Mensch-basierte Bewertungen bieten maximale Flexibilität bei den Metriken, sind jedoch zeitaufwendig.
  • Bei Modell-basierten Grader ist es wichtig, dem Grader eine klare Rolle zu geben und zusätzlich zu einem Score Stärken, Schwächen und Begründungen anzufordern.
Lernkarten 10 Karten
Frage
zum Aufdecken klicken · ←/→
Antwort
zum Zurückdrehen klicken
Nach Anki exportieren (.tsv) ↓
Wissensüberprüfung 0 Fragen

No quiz for this lesson yet.