Samenvatting (audio)
Geen audio-samenvatting voor deze les.
Studienotities
Studie-opmerkingen: De RAG-Pipeline in Detail
**I. De RAG-Pipeline (Algemeen Proces)**
- RAG (Retrieval-Augmented Generation) combineert drie kernconcepten:
- Text Chunking (Tekst opdelen).
- Text Embeddings (Tekst omzetten in vectoren).
- Het gehele proces (Retrieval → Augmentation → Generation).
**II. Fase 1: Pre-processing (Indexing/Opslag)**
- Chunking: Het bronbestand wordt opgedeeld in kleinere, beheersbare stukken tekst (chunks).
- Embeddings Genereren: Elk tekstchunk wordt door een embedding-model omgezet in een numerieke vector (een reeks getallen).
- Deze vectoren vertegenwoordigen de semantische betekenis van de tekst.
- Voorbeeld: Een vector kan scores bevatten voor verschillende onderwerpen (bijv. Medisch: 0. 9, Software Engineering: 0. 3).
- Normalisatie: De lengte (magnitude) van elke vector wordt geschaald naar 1. 0.
- Dit zorgt ervoor dat alle vectoren op een eenheidscirkel liggen.
- Dit is vaak automatisch ingesteld door de embedding API.
- Vector Database: De geëmbbedde (en genormaliseerde) vectoren worden opgeslagen in een database die geoptimaliseerd is voor het opslaan en vergelijken van lange lijsten getallen.
**III. Fase 2: Query Time (Retrieval/Ophalen)**
- Query Embedding: De vraag van de gebruiker wordt door exact hetzelfde embedding-model gehaald als de oorspronkelijke chunks.
- Vector Database Zoeken: De query-vector wordt in de vector database ingevoerd om de meest relevante opgeslagen vectoren te vinden.
- Berekening van Gelijkenis (Math):
- Cosine Similarity: Dit is de primaire methode om de gelijkenis tussen de query-vector en de opgeslagen vectoren te meten.
- Het meet de hoek tussen de twee vectoren.
- Resultaat ligt tussen -1 en 1.
- Dichter bij 1 = zeer hoge gelijkenis.
- Cosine Distance: Dit is een alternatieve maat die vaak wordt gebruikt in documentatie.
- Berekening: 1 minus Cosine Similarity.
- Dichter bij 0 = zeer hoge gelijkenis.
- Prompt Constructie: De meest relevante tekstchunk (met de hoogste Cosine Similarity) wordt samen met de oorspronkelijke vraag van de gebruiker in een prompt geplaatst.
- Generatie: De geconstrueerde prompt wordt naar een Large Language Model (LLM, bijv. Claude) gestuurd om het uiteindelijke antwoord te genereren.
Takeaways
- RAG (Retrieval-Augmented Generation) combineert tekst opdelen (Chunking), het omzetten van tekst naar vectoren (Embeddings) en het proces van ophalen, aanvullen en genereren.
- Embeddings zetten tekst om in numerieke vectoren die de semantische betekenis van de tekst vertegenwoordigen.
- Deze genormaliseerde vectoren worden opgeslagen in een Vector Database, die geoptimaliseerd is voor het vergelijken van lange lijsten getallen.
- De relevantie tussen de gebruikersvraag en de opgeslagen tekst wordt gemeten met Cosine Similarity (dichter bij 1 = hogere gelijkenis).
- De meest relevante tekstchunk wordt aan de oorspronkelijke vraag toegevoegd (augmentatie) voordat een LLM het uiteindelijke antwoord genereert.
Flashcards 10 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Kenniscontrole 0 vragen
No quiz for this lesson yet.