Samenvatting (audio)
Geen audio-samenvatting voor deze les.
Studienotities
Contextual Retrieval (Contextuele Ophalen)
- Doel: Het verbeteren van de nauwkeurigheid van een RAG (Retrieval-Augmented Generation) pipeline.
- Het Probleem: Wanneer een bronbestand wordt opgesplitst in chunks, verliest elk individueel chunk de context van het oorspronkelijke document.
- De Oplossing (Pre-processing): Voeg een pre-processing stap toe voordat chunks in de retriever database worden geplaatst.
- Stap 1: Neem een individuele tekstchunk en het volledige bronbestand.
- Stap 2: Plaats deze in een prompt voor een LLM (bijv. Claude).
- Stap 3: Vraag de LLM om extra context te genereren die de chunk situeert binnen het grotere document.
- Stap 4: Combineer de extra context met de oorspronkelijke chunk om een contextualized chunk te vormen.
- Stap 5: Gebruik deze contextualized chunk als input voor de vector- en BM25-index.
Omgaan met Grote Documenten
- Beperking: Het volledige bronbestand past vaak niet in één prompt.
- Strategie: Als het document te groot is, gebruik dan een selectie van chunks in plaats van het geheel:
- Starter Chunks: Chunks van het begin van het document (voor algemene samenvatting/abstract).
- Preceding Chunks: Chunks die direct voorafgaan aan de doelchunk (voor lokale context).
- Proces: Deze geselecteerde chunks worden samengevoegd en aan de add context functie gepresenteerd om de context te genereren.
Kernconcepten
- Contextualized Chunk: De uiteindelijke, verrijkte tekst die zowel de oorspronkelijke chunk als de door de LLM gegenereerde context bevat.
- Voordeel: Verbetert de retrieval-kwaliteit, vooral bij complexe documenten met sterke verbanden tussen verschillende secties.
Takeaways
- Contextuele Ophalen (Contextual Retrieval) verbetert de nauwkeurigheid van RAG door contextverlies aan te pakken bij het opsplitsen van documenten in chunks.
- De oplossing is een pre-processing stap waarbij een LLM extra context genereert voor een tekstchunk op basis van het volledige bronbestand.
- Het resultaat is een 'contextualized chunk', een verrijkte tekst die zowel de oorspronkelijke chunk als de LLM-gegenereerde context bevat.
- Bij te grote documenten wordt context gegenereerd door specifieke chunks te selecteren, zoals Starter Chunks (begin) of Preceding Chunks (lokale context).
Flashcards 10 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Kenniscontrole 0 vragen
No quiz for this lesson yet.