Quel est le processus général d'un pipeline RAG ?	Prendre un document source, le découper en morceaux (chunks), trouver le morceau pertinent, et l'insérer dans un prompt.
Pourquoi le processus de découpage (chunking) est-il crucial dans un pipeline RAG ?	La manière dont le document est découpé a une influence majeure sur la qualité du pipeline RAG.
Qu'est-ce que le découpage basé sur la taille (size-based chunking) ?	Diviser un grand document en plusieurs chaînes de texte de longueur égale.
Quel est le principal inconvénient du découpage basé sur la taille ?	Les morceaux peuvent contenir des mots coupés (cutoff words) et manquer de contexte.
Quelles sont les valeurs par défaut de longueur et de chevauchement (overlap) pour les chunks ?	Longueur de 150 et chevauchement de 20.
Quel est l'objectif principal de modifier la longueur et le chevauchement des chunks ?	Améliorer la qualité des chunks et s'assurer qu'ils contiennent un sens complet.
Quel rôle joue le chevauchement (overlap) dans le processus de chunking ?	Il garantit que le contexte est maintenu entre les chunks adjacents.
Décrivez la stratégie de "chunk by sentence" (chunk par phrase).	Elle divise le texte en phrases, utilisant généralement une phrase de chevauchement.
Dans quel type de document la stratégie "chunk by section" est-elle la plus efficace ?	Dans les documents structurés (ex: rapports avec sommaires, sections numérotées).
Pourquoi la stratégie "chunk by section" peut-elle échouer ?	Si le document fourni par l'utilisateur n'a pas de formatage ou de structure claire.
Quelle stratégie est considérée comme la solution de repli (fallback) ?	Le "chunk by character" (chunk par caractère).
Pourquoi le chunking par phrase est-il problématique pour le code informatique ?	Le code utilise des points (periods) à des endroits imprévisibles, ce qui perturbe la division par phrase.
