Claude On Google Cloud
← Alle Lektionen
Lektion 41Claude On Google Cloud

Text chunking strategies

Zusammenfassung (Audio)

Keine Audio-Zusammenfassung für diese Lektion.

Studiennotizen

🧠 RAG-Workflow Grundlagen

  • Ziel: Implementierung eines benutzerdefinierten Retrieval-Augmented Generation (RAG) Workflows.
  • Grundlegende Pipeline:
  • Quell-Dokument (Source Document)
  • Text-Chunking (Zerlegung in Abschnitte)
  • Relevanzsuche (Retrieval)
  • Prompt-Erstellung (Einbettung in den Prompt)
  • Antwortgenerierung

⚠️ Die Bedeutung von Chunking

  • Kernproblem: Die Qualität des Chunkings bestimmt maßgeblich die Qualität der gesamten RAG-Pipeline.
  • Risiko: Falsches Chunking führt zu Kontextfehlern, da thematisch irrelevante Textabschnitte verwendet werden können.

🛠️ Chunking-Strategien (Methoden zur Textzerlegung)

1. Größenbasierte Chunking (Size-Based)

  • Definition: Dokument wird in Strings gleicher oder annähernd gleicher Länge unterteilt.
  • Vorteile: Einfach zu implementieren; Standard in Produktionssystemen.
  • Nachteile:
  • Cutoff-Wörter: Wörter werden mitten im Chunk abgeschnitten.
  • Kontextverlust: Wichtige Kontextinformationen (z. B. Überschriften) gehen verloren.
  • Verbesserung (Overlap): Überlappung von Text zwischen benachbarten Chunks wird hinzugefügt, um den Kontext zu verbessern (führt zu Textduplikaten).

2. Struktur-basierte Chunking (Structure-Based)

  • Definition: Zerlegung erfolgt basierend auf der logischen Struktur des Dokuments (z. B. Abschnitte, Paragraphen, Überschriften).
  • Anwendung: Ideal für Dokumente mit klar definierter Struktur (z. B. Markdown).
  • Einschränkung: Nicht anwendbar bei Dokumenten ohne garantierte Struktur (z. B. einfache PDF-Texte).

3. Semantische Chunking (Semantic-Based)

  • Definition: Nutzung von Natural Language Processing (NLP), um die inhaltliche Verwandtschaft zwischen Sätzen oder Abschnitten zu bestimmen.
  • Vorgehen: Chunks werden aus Gruppen inhaltlich verwandter Sätze gebildet.

⚙️ Spezifische Chunking-Implementierungen

  • Chunk by Sentence: Trennung mittels regulärer Ausdrücke (Regex). Erzeugt typischerweise ca. 5 Sätze pro Chunk.
  • Chunk by Section: Erzeugt sehr starke, strukturierte Chunks (z. B. Kapitel, Executive Summary). Voraussetzung ist eine garantierte Dokumentstruktur.
  • Chunk by Character: Dient als zuverlässige Standard- und Fallback-Strategie, wenn keine Struktur garantiert werden kann.

💡 Fazit

  • Die Wahl der Chunking-Strategie muss immer von der Natur des Dokuments und dessen strukturellen Garantien abhängen.

Takeaways

  • Der RAG-Workflow umfasst die Pipeline: Quell-Dokument → Chunking → Relevanzsuche → Prompt-Erstellung → Antwortgenerierung.
  • Die Qualität des Chunkings ist entscheidend, da falsches Chunking zu Kontextfehlern in der gesamten RAG-Pipeline führt.
  • Es gibt drei Hauptstrategien: Größenbasiert (einfach, aber Kontextverlust), Struktur-basiert (logische Abschnitte) und Semantisch (NLP-basierte Verwandtschaft).
  • Die Wahl der Chunking-Strategie muss immer von der Natur des Dokuments und dessen strukturellen Garantien abhängen.
Lernkarten 16 Karten
Frage
zum Aufdecken klicken · ←/→
Antwort
zum Zurückdrehen klicken
Nach Anki exportieren (.tsv) ↓
Wissensüberprüfung 0 Fragen

No quiz for this lesson yet.