Claude On Google Cloud
← Toutes les leçons
Leçon 41Claude On Google Cloud

Text chunking strategies

Audio récapitulatif

Pas de récapitulatif audio pour cette leçon.

Notes de cours

🧠 I. Le Pipeline RAG (Retrieval-Augmented Generation)

  • Définition : Le RAG permet de générer des réponses en s'appuyant sur des documents externes (base de connaissances).
  • Étapes du Pipeline :
  • Document source → Découpage en chunks (morceaux de texte).
  • Requête utilisateur → Recherche du chunk le plus pertinent.
  • Insertion du chunk dans le prompt.
  • Génération de la réponse finale.
  • Importance du Chunking : C'est une étape critique. La qualité du découpage influence directement la pertinence et la qualité de la réponse RAG.

⚠️ II. Problèmes et Enjeux du Chunking

  • Risque principal : Un découpage inapproprié peut entraîner une perte de contexte ou une erreur de pertinence.
  • Exemple : Un chunk contenant un mot clé peut être sélectionné, mais son contexte réel peut appartenir à un domaine différent.
  • Objectif : Maximiser la signification contextuelle de chaque chunk.

⚙️ III. Stratégies de Chunking

Le choix de la stratégie dépend de la nature et de la structure du document.

A. Méthodes Générales

  • **1. Chunking Basé sur la Taille (Size-based Chunking)**
  • Principe : Diviser le texte en chaînes de caractères de longueur fixe.
  • Amélioration (Chevauchement / Overlap) : Inclure une partie du texte des chunks voisins pour assurer une meilleure continuité contextuelle.
  • Inconvénients : Peut entraîner des mots coupés (cutoff words) et un manque de contexte global.
  • **2. Chunking Basé sur la Structure (Structure-based Chunking)**
  • Principe : Diviser le texte en fonction des éléments hiérarchiques (titres, sections, paragraphes).
  • Avantage : Crée des sections logiques et bien formées.
  • Limitation : Inefficace si le document n'a pas de structure claire (ex. : certains PDF).
  • **3. Chunking Basé sur le Sémantique (Semantic-based Chunking)**
  • Principe : Diviser le texte en fonction des changements de sens ou des idées principales.

B. Implémentations Pratiques

  • Par Phrase (Chunk by Sentence) :
  • Utilise des arguments par défaut (ex. : 5 phrases par chunk).
  • Résultat : Fournit une quantité solide d'informations par chunk.
  • Attention : Le découpage par expression régulière peut parfois échouer à séparer correctement les phrases.
  • Par Section (Chunk by Section) :
  • Très efficace pour les documents structurés (ex. : Table des matières, Section 1, Section 2).
  • Par Caractère (Chunk by Character) :
  • Stratégie de repli (fallback) utilisée lorsque les méthodes précédentes échouent (ex. : découpage de code imprévisible).
  • Résultat : Fonctionne dans la majorité des cas, mais ne garantit pas la meilleure qualité contextuelle.

Takeaways

  • Le RAG (Retrieval-Augmented Generation) génère des réponses en s'appuyant sur une base de connaissances externe.
  • Le découpage (chunking) est une étape critique dont la qualité détermine la pertinence de la réponse RAG.
  • Les stratégies de chunking se divisent en trois types : basé sur la taille, basé sur la structure (sections) ou basé sur le sens (sémantique).
  • L'utilisation d'un chevauchement (overlap) est essentielle pour assurer la continuité contextuelle entre les morceaux de texte.
Cartes mémo 14 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 0 questions

No quiz for this lesson yet.