Wat is het basisproces van een RAG-pipeline?	Een bron-document opsplitsen (chunking), relevante stukken vinden, en deze in een prompt plaatsen.
Waarom is de manier waarop een document wordt opgesplitst (chunking) cruciaal voor een RAG-pipeline?	Het heeft een grote invloed op de kwaliteit van de RAG-pipeline en kan fouten introduceren.
Wat houdt size-based chunking in?	Het document wordt opgesplitst in strings van ongeveer gelijke lengte.
Wat is een nadeel van standaard size-based chunking?	Elk chunk kan afgesneden woorden bevatten en context missen.
Hoe lost men het contextverlies op bij size-based chunking?	Door een overlap te implementeren tussen aangrenzende chunks.
Wat is het nadeel van het gebruik van een overlap-strategie?	Er ontstaat duplicatie
Wat zijn de standaard instellingen voor chunking?	Een chunk length van 150 en een overlap van 20.
Wat is het doel van het aanpassen van de chunk length en overlap?	Het verbeteren van de betekenis en de kwaliteit van de gegenereerde chunks.
Hoe werkt de strategie 'Chunk by Sentence' standaard?	Het genereert 5 zinnen per chunk met één zin overlap, gebruikmakend van een reguliere expressie (regex).
Wanneer is de strategie 'Chunk by Section' het meest effectief?	Bij documenten met een duidelijke en gegarandeerde structuur (bijv. executive summary, hoofdstukken).
Wat is het nadeel van 'Chunk by Section' bij ongestructureerde documenten?	Het werkt niet goed als het document geen duidelijke formatting of structuur heeft.
Wanneer wordt 'Chunk by Character' gebruikt?	Als een fallback-methode, omdat het bijna altijd werkt, maar niet gegarandeerd de beste resultaten geeft.
Waarom kan 'Chunk by Sentence' problematisch zijn bij het chunk-en van code?	Code bevat vaak punten in onverwachte plaatsen, wat de zinssplitsing verstoort.
Welke factoren bepalen de beste chunking-strategie?	De aard en de structuur van het document dat verwerkt moet worden.
