Claude With The Anthropic Api
← Toutes les leçons
Leçon 45Claude With The Anthropic Api

Text chunking strategies

Audio récapitulatif

Pas de récapitulatif audio pour cette leçon.

Notes de cours

📝 Notes de Cours : Workflow RAG et Découpage (Chunking)

I. Le Pipeline RAG (Retrieval-Augmented Generation)

  • Fonctionnement : Document source → Découpage (Chunking) → Recherche de morceaux pertinents → Insertion dans le prompt → Réponse.
  • Importance du Chunking : C'est une étape critique. La qualité du découpage détermine la performance du pipeline RAG.
  • Risque : Un découpage inapproprié peut introduire des erreurs de contexte (ex: utiliser un morceau médical pour répondre à une question d'ingénierie).

II. Stratégies de Découpage (Chunking Strategies)

Le choix de la méthode dépend de la nature et de la structure du document.

**A. Découpage Basé sur la Taille (Size-Based)**

  • Principe : Diviser le texte en chaînes de caractères de longueur fixe.
  • Avantages : Facile à implémenter.
  • Inconvénients : Risque de couper des mots ou de manquer de contexte environnant.
  • Amélioration (Chevauchement/Overlap) : Inclure une partie des caractères des morceaux voisins dans chaque chunk.
  • → Augmente le contexte de chaque chunk.
  • → Entraîne une duplication de texte.

**B. Découpage Basé sur la Structure (Structure-Based)**

  • Principe : Diviser le texte en fonction de sa hiérarchie intrinsèque (titres, paragraphes, sections).
  • Exemple : Utilisation des marqueurs de section (ex: ##).
  • Idéal pour : Documents hautement structurés.

**C. Découpage Basé sur la Sémantique (Semantic-Based)**

  • Principe : Utiliser des techniques de Traitement du Langage Naturel (NLP) pour évaluer la relation et la cohérence entre les phrases consécutives.

III. Méthodes d'Implémentation Pratiques

  • Par Section (Chunk by Section) : Découpe le texte selon la structure logique du document (ex: résumé, Section 1, Section 2).
  • Par Phrase (Chunk by Sentence) : Utilise des expressions régulières (regex) pour séparer le texte.
  • Configuration typique : 5 phrases par chunk avec 1 phrase de chevauchement.
  • Par Caractère (Chunk by Character) : Méthode de dernier recours. La plus fiable pour les données non structurées, mais n'est pas optimale.

IV. Optimisation et Choix de la Stratégie

  • Paramètres Clés :
  • Longueur de chunk : Détermine la taille du morceau.
  • Chevauchement (Overlap) : Assure que les concepts complexes ne sont pas coupés entre deux chunks.
  • Règles de Décision :
  • Documents structurés : Privilégier la méthode "Par section".
  • Documents non structurés :
  • "Par section" est risquée.
  • Si "Par phrase" échoue (ex: code informatique), revenir à la méthode "Par caractère" pour une couverture fiable.

Takeaways

  • Le pipeline RAG repose sur le découpage (Chunking), une étape critique dont la qualité détermine la performance globale du système.
  • Trois stratégies de découpage existent : Basé sur la Taille (longueur fixe), Basé sur la Structure (hiérarchie du document), et Basé sur la Sémantique (cohérence NLP).
  • Le chevauchement (Overlap) est un paramètre clé qui assure que les concepts complexes ne sont pas coupés entre deux morceaux.
  • Le choix de la méthode doit être adapté au document : privilégier le découpage "Par section" pour les documents structurés, et les méthodes "Par phrase" ou "Par caractère" pour les non structurés.
Cartes mémo 16 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 0 questions

No quiz for this lesson yet.