Claude On Google Cloud
← Alle lessen
Les 43Claude On Google Cloud

The full RAG flow

Samenvatting (audio)

Geen audio-samenvatting voor deze les.

Studienotities

Studie-opmerkingen: De RAG-Pipeline in Detail

**I. De RAG-Pipeline (Algemeen Proces)**

  • RAG (Retrieval-Augmented Generation) combineert drie kernconcepten:
  • Text Chunking (Tekst opdelen).
  • Text Embeddings (Tekst omzetten in vectoren).
  • Het gehele proces (Retrieval → Augmentation → Generation).

**II. Fase 1: Pre-processing (Indexing/Opslag)**

  • Chunking: Het bronbestand wordt opgedeeld in kleinere, beheersbare stukken tekst (chunks).
  • Embeddings Genereren: Elk tekstchunk wordt door een embedding-model omgezet in een numerieke vector (een reeks getallen).
  • Deze vectoren vertegenwoordigen de semantische betekenis van de tekst.
  • Voorbeeld: Een vector kan scores bevatten voor verschillende onderwerpen (bijv. Medisch: 0. 9, Software Engineering: 0. 3).
  • Normalisatie: De lengte (magnitude) van elke vector wordt geschaald naar 1. 0.
  • Dit zorgt ervoor dat alle vectoren op een eenheidscirkel liggen.
  • Dit is vaak automatisch ingesteld door de embedding API.
  • Vector Database: De geëmbbedde (en genormaliseerde) vectoren worden opgeslagen in een database die geoptimaliseerd is voor het opslaan en vergelijken van lange lijsten getallen.

**III. Fase 2: Query Time (Retrieval/Ophalen)**

  • Query Embedding: De vraag van de gebruiker wordt door exact hetzelfde embedding-model gehaald als de oorspronkelijke chunks.
  • Vector Database Zoeken: De query-vector wordt in de vector database ingevoerd om de meest relevante opgeslagen vectoren te vinden.
  • Berekening van Gelijkenis (Math):
  • Cosine Similarity: Dit is de primaire methode om de gelijkenis tussen de query-vector en de opgeslagen vectoren te meten.
  • Het meet de hoek tussen de twee vectoren.
  • Resultaat ligt tussen -1 en 1.
  • Dichter bij 1 = zeer hoge gelijkenis.
  • Cosine Distance: Dit is een alternatieve maat die vaak wordt gebruikt in documentatie.
  • Berekening: 1 minus Cosine Similarity.
  • Dichter bij 0 = zeer hoge gelijkenis.
  • Prompt Constructie: De meest relevante tekstchunk (met de hoogste Cosine Similarity) wordt samen met de oorspronkelijke vraag van de gebruiker in een prompt geplaatst.
  • Generatie: De geconstrueerde prompt wordt naar een Large Language Model (LLM, bijv. Claude) gestuurd om het uiteindelijke antwoord te genereren.

Takeaways

  • RAG (Retrieval-Augmented Generation) combineert tekst opdelen (Chunking), het omzetten van tekst naar vectoren (Embeddings) en het proces van ophalen, aanvullen en genereren.
  • Embeddings zetten tekst om in numerieke vectoren die de semantische betekenis van de tekst vertegenwoordigen.
  • Deze genormaliseerde vectoren worden opgeslagen in een Vector Database, die geoptimaliseerd is voor het vergelijken van lange lijsten getallen.
  • De relevantie tussen de gebruikersvraag en de opgeslagen tekst wordt gemeten met Cosine Similarity (dichter bij 1 = hogere gelijkenis).
  • De meest relevante tekstchunk wordt aan de oorspronkelijke vraag toegevoegd (augmentatie) voordat een LLM het uiteindelijke antwoord genereert.
Flashcards 10 kaarten
Vraag
klik om te onthullen · ←/→
Antwoord
klik om terug te draaien
Exporteren naar Anki (.tsv) ↓
Kenniscontrole 0 vragen

No quiz for this lesson yet.