Claude With The Anthropic Api
← सभी पाठ
पाठ 45Claude With The Anthropic Api

Text chunking strategies

सारांश ऑडियो

इस पाठ के लिए कोई ऑडियो सारांश नहीं है।

अध्ययन नोट्स

🧠 RAG पाइपलाइन का मूल सेटअप

  • RAG (Retrieval-Augmented Generation): यह एक ऐसी पाइपलाइन है जो बाहरी ज्ञान (External Knowledge) का उपयोग करके AI मॉडल को उत्तर देने में मदद करती है।
  • मुख्य चरण:
  • स्रोत दस्तावेज़: मूल दस्तावेज़ को छोटे हिस्सों (Chunks) में तोड़ना।
  • प्रासंगिकता खोज: उपयोगकर्ता के प्रश्न के लिए सबसे प्रासंगिक चंक ढूँढना।
  • उत्तर निर्माण: उस चंक को प्रॉम्प्ट में डालकर AI से उत्तर प्राप्त करना।

💡 चंकिंग का महत्व

  • परिभाषा: दस्तावेज़ को छोटे, प्रबंधनीय टेक्स्ट सेगमेंट में विभाजित करने की प्रक्रिया।
  • महत्व: चंकिंग की गुणवत्ता सीधे RAG आउटपुट की गुणवत्ता को निर्धारित करती है।
  • समस्या: खराब चंकिंग के कारण, मॉडल अप्रासंगिक या अधूरा संदर्भ (Irrelevant Context) प्रॉम्प्ट में शामिल कर सकता है।

🛠️ दस्तावेज़ विभाजन (Chunking) की मुख्य रणनीतियाँ

1. साइज़-आधारित चंकिंग (Size-Based Chunking)

  • विधि: पूरे दस्तावेज़ को एक निश्चित लंबाई (Fixed Length) के स्ट्रिंग्स में विभाजित करना।
  • फायदे: लागू करना सबसे आसान और प्रोडक्शन में सबसे अधिक उपयोग किया जाता है।
  • सीमाएँ:
  • शब्द बीच में कट सकते हैं (Cut-off words)।
  • चंक में पर्याप्त संदर्भ (Context) नहीं होता है।
  • सुधार (Overlap): अगले चंक से कुछ शब्दों को ओवरलैप करके संदर्भ जोड़ा जाता है।
  • नतीजा: टेक्स्ट में दोहराव (Duplication) होता है, लेकिन प्रत्येक चंक को बेहतर संदर्भ मिलता है।

2. संरचना-आधारित चंकिंग (Structure-Based Chunking)

  • विधि: दस्तावेज़ की आंतरिक संरचना (जैसे हेडर, पैराग्राफ, सेक्शन) के आधार पर विभाजन करना।
  • उदाहरण: मार्कडाउन सिंटैक्स (जैसे ##) का उपयोग करके सेक्शन की पहचान करना।
  • उपयोग: यह रणनीति तभी प्रभावी होती है जब दस्तावेज़ की संरचना स्पष्ट और निश्चित हो।

3. सिमेंटिक-आधारित चंकिंग (Semantic-Based Chunking)

  • विधि: प्राकृतिक भाषा प्रसंस्करण (NLP) का उपयोग करके वाक्यों या विचारों के आधार पर संबंधित समूहों को चंक बनाना।
  • विशेषता: यह सबसे उन्नत तकनीक है, जो अर्थ (Meaning) को प्राथमिकता देती है।

⚙️ व्यावहारिक कार्यान्वयन और निर्णय

  • डिफ़ॉल्ट सेटिंग्स की सीमा: डिफ़ॉल्ट चंक लेंथ (जैसे 150) और ओवरलैप (जैसे 20) अक्सर सार्थक जानकारी प्रदान नहीं करते हैं।
  • कस्टम विभाजन: बेहतर परिणाम के लिए चंक लेंथ और ओवरलैप को मैन्युअल रूप से समायोजित करना आवश्यक है।
  • विभाजन के तरीके:
  • Chunk by Sentence: रेगुलर एक्सप्रेशन (Regex) का उपयोग करके विभाजन। (उदाहरण: 5 वाक्य + 1 वाक्य का ओवरलैप)।
  • Chunk by Section: दस्तावेज़ के ज्ञात खंडों (Sections) के आधार पर विभाजन।
  • Chunk by Character: अंतिम उपाय (Fallback)। यदि अन्य विधियाँ विफल हो जाती हैं, तो यह अक्षर-दर-अक्षर विभाजन करता है।

🎯 निष्कर्ष

  • रणनीति का चुनाव: चंकिंग के लिए कोई निश्चित संख्या नहीं है। सही विधि का चुनाव पूरी तरह से उपयोग के मामले (Use Case) और दस्तावेज़ की संरचना की गारंटी पर निर्भर करता है।
  • अंतिम विकल्प: यदि दस्तावेज़ की संरचना अज्ञात है, तो 'Chunk by Section' काम नहीं करेगा। ऐसे में 'Chunk by Sentence' या 'Chunk by Character' का उपयोग किया जाता है।

Takeaways

  • RAG (Retrieval-Augmented Generation) एक पाइपलाइन है जो बाहरी ज्ञान का उपयोग करके AI मॉडल को उत्तर देने में सहायता करती है।
  • चंकिंग की गुणवत्ता सीधे RAG आउटपुट की गुणवत्ता को निर्धारित करती है, इसलिए यह एक महत्वपूर्ण प्रक्रिया है।
  • मुख्य चंकिंग रणनीतियाँ हैं: साइज़-आधारित (निश्चित लंबाई), संरचना-आधारित (सेक्शन/हेडर), और सिमेंटिक-आधारित (अर्थ के आधार पर)।
  • बेहतर परिणाम के लिए डिफ़ॉल्ट चंक लेंथ और ओवरलैप सेटिंग्स के बजाय उन्हें उपयोग के मामले के अनुसार मैन्युअल रूप से समायोजित करना आवश्यक है।
फ्लैशकार्ड 17 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न

No quiz for this lesson yet.