Samenvatting (audio)
Geen audio-samenvatting voor deze les.
Studienotities
🧠 RAG Pipeline Basis
- RAG Workflow: Een typische RAG-pipeline volgt deze stappen:
Bron Document → Chunking (Verdelen) → Retrieval (Relevant blok vinden) → Prompt (In prompt plaatsen) → Generatie (Antwoord).
- Cruciaal: De kwaliteit van de RAG-pipeline is sterk afhankelijk van de chunking-strategie.
- Risico Slechte Chunking: Te kleine of onjuiste chunks leiden tot het ophalen van irrelevante context in de prompt.
🧱 Chunking Strategieën
Chunking is het proces van het opdelen van een groot document in kleinere, beheersbare tekstblokken.
1. Grootte-gebaseerd Chunking (Size-based)
- Principe: Het document wordt verdeeld in strings van een vaste lengte.
- Voordeel: Eenvoudig te implementeren en veel gebruikt in productie.
- Nadeel: Kan leiden tot het afkappen van woorden en verlies van omliggende context.
- Overlap: Het toevoegen van een overlap tussen opeenvolgende chunks behoudt context over de grenzen van de chunks, maar veroorzaakt tekstduplicatie.
- Optimalisatie: Standaardinstellingen (bijv. lengte 150, overlap 20) zijn vaak onvoldoende; aanpassing (bijv. lengte 500, overlap 150) kan betekenisvolle secties opleveren.
2. Specifieke Chunking Methoden
- Chunk per Zin (Chunk by Sentence):
- Gebruikt reguliere expressies (regex) om te splitsen.
- Standaard: 5 zinnen per chunk met 1 zin overlap.
- Geschikt voor algemene documenten, maar kan fouten maken bij onverwachte zinsstructuren.
- Chunk per Sectie (Chunk by Section):
- Splitst op basis van de inherente structuur van het document (bijv. 'Hoofdstuk 1', 'Samenvatting').
- Zeer effectief voor gestructureerde documenten.
- Niet geschikt voor ongestructureerde of ongarandeerde documenten.
- Chunk per Karakter (Chunk by Character):
- De meest basale en gegarandeerde methode.
- Gegarandeerd, maar garandeert niet de beste semantische resultaten.
💡 Belangrijke Overwegingen
- Keuze: De gekozen strategie hangt volledig af van de aard van het document en de structurele garanties.
- Code: Het splitsen van code in individuele zinnen is vaak onjuist vanwege onverwachte zinsstructuren.
- Fallback: Als sectie-chunking faalt, is 'chunk per zin' vaak de beste fallback, tenzij de data zeer complex is.
Takeaways
- De RAG-pipeline volgt de stappen: Bron Document → Chunking → Retrieval → Prompt → Generatie.
- De kwaliteit van de RAG-pipeline is sterk afhankelijk van de chunking-strategie, aangezien slechte chunking leidt tot irrelevante context.
- Grootte-gebaseerd chunking verdeelt tekst in vaste lengtes; het gebruik van overlap helpt context te behouden over de grenzen van de chunks.
- De keuze voor een chunking-methode (bijv. per zin, per sectie, per karakter) moet volledig worden bepaald door de aard en structuur van het bron-document.
- Chunk per sectie is zeer effectief voor gestructureerde documenten, terwijl 'chunk per zin' vaak de beste fallback is voor algemene teksten.
Flashcards 16 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Kenniscontrole 0 vragen
No quiz for this lesson yet.