Claude On Google Cloud
← Alle lessen
Les 48Claude On Google Cloud

Contextual retrieval

Samenvatting (audio)

Geen audio-samenvatting voor deze les.

Studienotities

Contextual Retrieval (Contextuele Ophalen)

  • Doel: Het verbeteren van de nauwkeurigheid van een RAG (Retrieval-Augmented Generation) pipeline.
  • Het Probleem: Wanneer een bronbestand wordt opgesplitst in chunks, verliest elk individueel chunk de context van het oorspronkelijke document.
  • De Oplossing (Pre-processing): Voeg een pre-processing stap toe voordat chunks in de retriever database worden geplaatst.
  • Stap 1: Neem een individuele tekstchunk en het volledige bronbestand.
  • Stap 2: Plaats deze in een prompt voor een LLM (bijv. Claude).
  • Stap 3: Vraag de LLM om extra context te genereren die de chunk situeert binnen het grotere document.
  • Stap 4: Combineer de extra context met de oorspronkelijke chunk om een contextualized chunk te vormen.
  • Stap 5: Gebruik deze contextualized chunk als input voor de vector- en BM25-index.

Omgaan met Grote Documenten

  • Beperking: Het volledige bronbestand past vaak niet in één prompt.
  • Strategie: Als het document te groot is, gebruik dan een selectie van chunks in plaats van het geheel:
  • Starter Chunks: Chunks van het begin van het document (voor algemene samenvatting/abstract).
  • Preceding Chunks: Chunks die direct voorafgaan aan de doelchunk (voor lokale context).
  • Proces: Deze geselecteerde chunks worden samengevoegd en aan de add context functie gepresenteerd om de context te genereren.

Kernconcepten

  • Contextualized Chunk: De uiteindelijke, verrijkte tekst die zowel de oorspronkelijke chunk als de door de LLM gegenereerde context bevat.
  • Voordeel: Verbetert de retrieval-kwaliteit, vooral bij complexe documenten met sterke verbanden tussen verschillende secties.

Takeaways

  • Contextuele Ophalen (Contextual Retrieval) verbetert de nauwkeurigheid van RAG door contextverlies aan te pakken bij het opsplitsen van documenten in chunks.
  • De oplossing is een pre-processing stap waarbij een LLM extra context genereert voor een tekstchunk op basis van het volledige bronbestand.
  • Het resultaat is een 'contextualized chunk', een verrijkte tekst die zowel de oorspronkelijke chunk als de LLM-gegenereerde context bevat.
  • Bij te grote documenten wordt context gegenereerd door specifieke chunks te selecteren, zoals Starter Chunks (begin) of Preceding Chunks (lokale context).
Flashcards 10 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Exporteren naar Anki (.tsv) ↓
Kenniscontrole 0 vragen

No quiz for this lesson yet.