Claude With Amazon Bedrock
← Alle lessen
Les 16Claude With Amazon Bedrock

Running the eval

Samenvatting (audio)

Geen audio-samenvatting voor deze les.

Studienotities

📝 Studie-notities: Evaluatie Pipeline (Eval Pipeline)

Doel van de Pipeline:

  • Het systematisch testen van een model door elke record in een dataset (testcase) te verwerken.
  • De output van het model te verzamelen en te beoordelen.

De Evaluatie Workflow (Stroom):

  • Testcase: Neem een individuele record uit de dataset.
  • Prompt Merge: Combineer de testcase met de vooraf gedefinieerde prompt.
  • LLM Call: Voer de gecombineerde prompt in Clod (Claude).
  • Output: Ontvang het resultaat van Clod.
  • Grading: Voer de output door de Grader (beoordelaar).

Kernfuncties:

  • run_prompt(test_case):
  • Taak: Merge de taak (uit de testcase) met de prompt.
  • Actie: Roep Claude aan met de gemergde prompt.
  • Output: Retourneert de ruwe tekstuele output van Claude.
  • Opmerking: De initiële prompt is eenvoudig en bevat nog geen instructies voor specifieke formaten (zoals JSON of Python).
  • run_test_case(test_case):
  • Taak: Verwerkt één individuele testcase.
  • Actie 1: Roep run_prompt aan met de testcase.
  • Actie 2: Voer de ontvangen output door de grader (momenteel hardcoded).
  • Output: Retourneert een dictionary met een samenvatting van de run (output, testcase, score).
  • run_eval(dataset):
  • Taak: Voert de volledige evaluatie uit op de gehele dataset.
  • Actie: Loop door elke testcase in de dataset.
  • Actie 2: Roep run_test_case aan voor elke testcase.
  • Output: Verzamel en retourneer alle resultaten in een lijst.

Belangrijke Concepten:

  • De run_eval functie is de orkestrator die de gehele dataset door de run_test_case functie stuurt.
  • De Grader is de cruciale laatste stap die de kwaliteit van de LLM-output beoordeelt.
  • De huidige implementatie van de grader is nog niet functioneel en is hardcoded (score = 10).

Takeaways

  • De Eval Pipeline test een model systematisch door elke record (testcase) te verwerken en de output te beoordelen.
  • De workflow verloopt via: Testcase → Prompt Merge → LLM Call (Clod) → Output → Grading.
  • De functie run_eval fungeert als de orkestrator die de gehele dataset via run_test_case verwerkt.
  • De Grader is de cruciale laatste stap die de kwaliteit van de LLM-output beoordeelt.
  • Let op: De huidige implementatie van de Grader is nog niet functioneel en is hardcoded.
Flashcards 7 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Exporteren naar Anki (.tsv) ↓
Kenniscontrole 0 vragen

No quiz for this lesson yet.