Samenvatting (audio)
Geen audio-samenvatting voor deze les.
Studienotities
Studieopmerkingen: RAG Workflow en Chunking Strategieën
🧠 Basis RAG Pipeline
- Doel: Het genereren van antwoorden op basis van externe, specifieke documentkennis.
- Stappen:
- Bron document → Tekst opdelen in 'chunks'.
- Gebruikersvraag → Relevant chunk vinden (Retrieval).
- Chunk in prompt plaatsen (Context).
- Antwoord genereren.
- Cruciaal: De kwaliteit van de chunking bepaalt de kwaliteit van de RAG-pipeline. Slechte chunking leidt tot contextfouten.
🧩 Chunking Principes
- Doel: Het opdelen van grote documenten in kleinere, beheersbare stukken (chunks) die relevant context bieden.
- Overlap: Het toevoegen van een overlap tussen aangrenzende chunks is essentieel om context te behouden, ondanks dat dit leidt tot tekstduplicatie.
- Aanpassing: Standaardinstellingen zijn vaak onvoldoende; het aanpassen van lengte en overlap is cruciaal voor betekenisvolle chunks.
🛠️ Chunking Strategieën
Er zijn drie hoofdcategorieën, elk met specifieke implementaties:
**1. Grootte-gebaseerd (Size-based)**
- Methode: Document wordt opgedeeld in strings van ongeveer gelijke lengte.
- Voordeel: Eenvoudig en vaak gebruikt in productie.
- Nadeel: Kan leiden tot 'cutoff words' (woorden die over chunks worden gesplitst) en gebrek aan context.
**2. Structuur-gebaseerd (Structure-based)**
- Methode: Splits de tekst op basis van de inherente structuur (bijv. secties, headers, paragrafen).
- Implementatie: 'Chunk per sectie'.
- Voordeel: Creëert logisch gevormde, coherente secties.
- Nadeel: Werkt alleen bij voorspelbare documentstructuren (bijv. Markdown); faalt bij platte, ongestructureerde teksten.
**3. Semantisch-gebaseerd (Semantic-based)**
- Methode: Gebruikt Natural Language Processing (NLP) om de relatie tussen zinnen te bepalen en chunks te bouwen uit gerelateerde zinnen.
- Kenmerk: De meest geavanceerde techniek.
🪜 Praktische Implementaties (Fallback)
De keuze van de strategie hangt af van de documentstructuur:
- Chunk per sectie: Meest effectief voor goed gestructureerde documenten.
- Chunk per zin: Gebruikt reguliere expressies (regex) om op zinsniveau te splitsen (bijv. 5 zinnen per chunk). Goed voor informatieve chunks.
- Chunk per karakter: De 'veilige' fallback-methode, gebruikt wanneer andere methoden falen (bijv. bij code).
Conclusie: De beste strategie is afhankelijk van de aard van het document. De hiërarchie van keuze is: Sectie → Zin → Karakter.
Takeaways
- De kwaliteit van de chunking is cruciaal voor het succes van de RAG-pipeline; slechte chunking leidt tot contextfouten.
- Het toevoegen van overlap tussen aangrenzende chunks is essentieel om context te behouden, ondanks dat dit leidt tot tekstduplicatie.
- Er zijn drie hoofdcategorieën voor chunking: Grootte-gebaseerd, Structuur-gebaseerd en Semantisch-gebaseerd.
- De praktische hiërarchie voor de keuze van een chunkingsstrategie is: Sectie → Zin → Karakter (als fallback).
Flashcards 14 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Kenniscontrole 0 vragen
No quiz for this lesson yet.