Samenvatting (audio)
Geen audio-samenvatting voor deze les.
Studienotities
Studie-opmerkingen: RAG Workflow en Chunking Strategieën
**I. Basis RAG Pipeline**
- Doel: Het genereren van antwoorden op basis van externe, relevante documentkennis.
- Stappen:
- Bron document → Opdelen in tekstchunks (Chunking).
- Gebruiker stelt vraag → Relevant chunk vinden (Retrieval).
- Chunk toevoegen aan prompt → Antwoord genereren.
- Belang van Chunking: Dit is een cruciale stap. Een slechte strategie leidt tot contextfouten (bijv. verkeerde thematische match).
**II. Chunking Strategieën (Theorie)** Chunking is het segmenteren van een bron document. De keuze hangt af van de documentstructuur.
- **A. Grootte-gebaseerde Chunking (Size-based):**
- Methode: Document wordt opgedeeld in strings van een vaste lengte.
- Voordeel: Eenvoudig te implementeren.
- Nadeel: Risico op afgesneden woorden (cutoff words) en verlies van context.
- Verbetering (Overlap): Het toevoegen van overlap tussen aangrenzende chunks behoudt context, maar veroorzaakt tekstduplicatie.
- **B. Structuur-gebaseerde Chunking (Structure-based):**
- Methode: Opdeling op basis van inherente documentstructuur (bijv. koppen, paragrafen, secties).
- Voordeel: Creëert thematisch coherente secties.
- Nadeel: Zeer moeilijk bij documenten zonder voorspelbare structuur (bijv. platte PDF's).
- **C. Semantisch-gebaseerde Chunking (Semantic-based):**
- Methode: Gebruik van NLP om de relatie tussen opeenvolgende zinnen/secties te bepalen.
- Kenmerk: Meest geavanceerde techniek.
**III. Praktische Implementatie en Keuze** De beste strategie is afhankelijk van de aard van het document.
- Chunk per Karakter: Implementatie van de grootte-gebaseerde strategie.
- Optimalisatie: Door de lengte en overlap te verhogen, wordt de kwaliteit van de chunks verbeterd.
- Fallback: Dit is de laatste optie, omdat het garandeert dat er altijd output is, maar niet gegarandeerd optimaal is.
- Chunk per Zin (Chunk by Sentence):
- Methode: Gebruikt reguliere expressies om te splitsen.
- Resultaat: Sterk; levert een solide hoeveelheid informatie per chunk.
- Geschikt voor: Documenten zonder duidelijke structuur.
- Chunk per Sectie (Chunk by Section):
- Geschikt voor: Documenten met een duidelijke, voorspelbare structuur (bijv. hoofdstukken, samenvattingen).
- Let op: Werkt slecht bij onvoorspelbare of platte input.
- Keuzegids:
- Geen gegarandeerde structuur → Gebruik 'Chunk per Zin'.
- Duidelijke structuur → Gebruik 'Chunk per Sectie'.
- Geen structuur en geen zin-splitsingen mogelijk → Gebruik 'Chunk per Karakter'.
Takeaways
- De RAG-pipeline bestaat uit het opdelen van documenten (Chunking), het vinden van relevante stukken (Retrieval) en het genereren van antwoorden.
- Chunking is een cruciale stap; een slechte strategie leidt tot contextfouten.
- Grootte-gebaseerde chunking kan overlap gebruiken om context te behouden, maar dit veroorzaakt tekstduplicatie.
- De keuze van de chunking-methode hangt af van de structuur: 'Chunk per Zin' voor ongestructureerde teksten en 'Chunk per Sectie' voor duidelijke structuur.
- Semantisch-gebaseerde chunking is de meest geavanceerde techniek die NLP gebruikt om de relatie tussen zinnen te bepalen.
Flashcards 12 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Kenniscontrole 0 vragen
No quiz for this lesson yet.