Audio récapitulatif
Pas de récapitulatif audio pour cette leçon.
Notes de cours
Notes de Révision : Amélioration de la Précision de la Recherche (Re-ranking)
🔍 Problématique du Système Hybride
- Approche initiale : Utilisation d'une recherche hybride (Index Vectoriel + Index BM25).
- Limitation : Malgré la complexité ajoutée, le processus de récupération présente des faiblesses (ex: des résultats moins pertinents apparaissent avant les résultats les plus précis pour des requêtes spécifiques).
⚙️ Technique de Re-ranking
- Définition : Le re-ranking est une étape de post-traitement ajoutée après la recherche initiale.
- Objectif : Améliorer la précision en réordonnant les résultats trouvés.
- Processus :
- Exécuter la recherche initiale (Index Vectoriel + BM25) et fusionner les résultats.
- Passer un sous-ensemble des résultats à un Grand Modèle de Langage (LLM, ex: Claude) via un prompt.
- Le LLM reçoit la question de l'utilisateur et les documents potentiellement pertinents.
- Tâche du LLM : Classer les documents trouvés par ordre de pertinence décroissante.
💡 Optimisations et Implémentation
- Efficacité des IDs : Pour optimiser le temps de réponse, il est préférable de demander au LLM de retourner uniquement les identifiants (IDs) des documents plutôt que le texte complet de chaque segment.
- Structure du Prompt : Les documents sont formatés (ex: XML) et insérés dans un prompt structuré.
- Garantie de Format : Utilisation du pré-remplissage du message assistant et d'une séquence d'arrêt (stop sequence) pour assurer un retour au format JSON bien structuré.
✅ Avantages et Compromis
- Avantage (Plus) : Augmentation significative de la précision du pipeline de recherche.
- Inconvénient (Moins) : Augmentation de la latence du pipeline, car il faut attendre l'appel au LLM pour le re-ranking.
Takeaways
- Le re-ranking est une étape de post-traitement ajoutée après la recherche initiale pour améliorer la précision des résultats.
- Le processus consiste à faire classer les documents potentiellement pertinents par un Grand Modèle de Langage (LLM) en fonction de la question de l'utilisateur.
- L'optimisation du temps de réponse est assurée en demandant au LLM de retourner uniquement les identifiants (IDs) des documents plutôt que le texte complet.
- L'utilisation du re-ranking augmente significativement la précision du pipeline, mais entraîne une augmentation de la latence.
Cartes mémo 7 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Vérification des connaissances 0 questions
No quiz for this lesson yet.