Samenvatting (audio)
Geen audio-samenvatting voor deze les.
Studienotities
Studieopmerkingen: De Volledige RAG-Pipeline
- Doel van RAG: Het combineren van tekstchunking, text embeddings en het RAG-proces om een compleet systeem te begrijpen.
- Fase 1: Pre-processing (Indexing)
- Chunking: Het bronbestand wordt opgesplitst in kleinere, beheersbare stukken tekst (chunks).
- Text Embeddings: Elk tekstchunk wordt omgezet in een numerieke representatie (een vector).
- Deze vector bevat scores die aangeven hoe sterk het chunk gerelateerd is aan specifieke onderwerpen (bijv. medisch, software engineering).
- Voorbeeld: Een vector van lengte twee, waarbij de eerste score de medische relevantie aangeeft.
- Normalisatie: De lengte (magnitude) van elke vector wordt geschaald naar 1. 0. Dit zorgt ervoor dat alle vectoren op een eenheidscirkel liggen.
- Vector Database: De geëmbbede vectoren en hun bijbehorende tekstchunks worden opgeslagen in een database die geoptimaliseerd is voor het opslaan en snel zoeken naar lange lijsten van getallen.
- Fase 2: Query (Retrieval & Generation)
- Query Embedding: De gebruikersvraag wordt door exact dezelfde embedding-model gehaald als de oorspronkelijke chunks.
- Zoeken (Retrieval): De query-vector wordt in de Vector Database gezocht om de opgeslagen vector te vinden die het dichtst bij de query-vector ligt.
- Cosine Similarity (Cosinusgelijkenis): Dit is de wiskundige methode om de gelijkenis tussen twee vectoren te meten.
- De berekening geeft een getal tussen min één en één.
- Een waarde dicht bij één betekent hoge gelijkenis.
- Een waarde dicht bij min één betekent lage gelijkenis.
- Cosine Distance (Cosinusafstand): Dit is een alternatieve maat die wordt gebruikt in veel vector databases.
- Berekening: één min Cosine Similarity.
- Een waarde dicht bij nul betekent hoge gelijkenis.
- Generatie: De meest relevante tekstchunk (met de hoogste Cosine Similarity) wordt samen met de oorspronkelijke gebruikersvraag in een prompt geplaatst en naar het taalmodel (LLM) gestuurd voor het genereren van het antwoord.
Takeaways
- RAG werkt door bronteksten op te splitsen (chunking) en deze om te zetten in numerieke representaties (text embeddings).
- Deze geëmbbede vectoren worden opgeslagen in een Vector Database, geoptimaliseerd voor snel zoeken naar lange lijsten getallen.
- De relevantie tussen de gebruikersvraag en de opgeslagen chunks wordt gemeten met Cosine Similarity (waarde dicht bij één = hoge gelijkenis).
- De meest relevante tekstchunk wordt samen met de oorspronkelijke vraag aan het taalmodel (LLM) gestuurd voor antwoordgeneratie.
Flashcards 10 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Kenniscontrole 0 vragen
No quiz for this lesson yet.