Quel est le processus général d'un pipeline RAG ?	Document source -> Découpage (chunking) -> Recherche de chunks pertinents -> Prompt -> Réponse.
Pourquoi le découpage (chunking) est-il une étape critique dans un pipeline RAG ?	La manière dont le document est découpé influence fortement la qualité du pipeline RAG.
Qu'est-ce que le découpage basé sur la taille (size-based chunking) ?	Diviser un document en plusieurs chaînes de texte de longueur égale.
Quels sont les deux inconvénients majeurs du découpage basé sur la taille ?	Les mots peuvent être coupés au milieu, et chaque chunk manque souvent de contexte (ex: titres).
Comment la stratégie de chevauchement (overlap) améliore-t-elle le découpage basé sur la taille ?	Elle inclut une partie des chunks voisins pour fournir plus de contexte à chaque morceau.
Qu'est-ce que le découpage basé sur la structure (structure-based chunking) ?	Diviser le texte en utilisant la structure du document (ex: titres, paragraphes, sections).
Dans quelles conditions le découpage basé sur la structure est-il efficace ?	Il nécessite des garanties sur la structure du document (ex: syntaxie Markdown).
Qu'est-ce que le découpage sémantique (semantic-based chunking) ?	Utiliser le traitement du langage naturel (NLP) pour grouper des phrases ou sections liées.
Quels sont les paramètres par défaut de la taille de chunk et du chevauchement ?	Taille de chunk de 150 et chevauchement de 20.
Quel est l'objectif de modifier les paramètres de chunk (ex: 500/150) ?	Permettre la formation de sections individuelles contenant plus de sens.
Comment fonctionne la stratégie "chunk by sentence" par défaut ?	Elle utilise une expression régulière pour diviser le texte, donnant généralement 5 phrases par chunk avec une phrase de chevauchement.
Quand la stratégie "chunk by section" est-elle la plus efficace ?	Lorsque le document possède une structure claire et garantie (ex: résumé, sections numérotées).
Quel est le principal inconvénient de "chunk by section" sur des documents non structurés ?	Le premier chunk peut ne pas contenir d'informations utiles.
Quel est le rôle de la stratégie "chunk by character" ?	C'est une stratégie de repli fiable qui fonctionne dans la majorité des cas, même si elle n'est pas optimale.
Quel facteur détermine la stratégie de chunk la plus appropriée ?	La nature et la structure du document.
Pourquoi "chunk by sentence" est-il problématique pour le code ?	Le code contient souvent des points dans des endroits inattendus, perturbant la division par phrase.
