Claude With Amazon Bedrock
← सभी पाठ
पाठ 17Claude With Amazon Bedrock

Model based grading

सारांश ऑडियो

इस पाठ के लिए कोई ऑडियो सारांश नहीं है।

अध्ययन नोट्स

प्रॉम्प्ट मूल्यांकन में ग्रेडिंग सिस्टम (Grading System in Prompt Evaluation)

यह नोट्स मॉडल आउटपुट की गुणवत्ता को मापने के लिए उपयोग किए जाने वाले ग्रेडिंग सिस्टम के मुख्य अवधारणाओं को कवर करते हैं।

🎯 ग्रेडिंग सिस्टम का उद्देश्य

  • परिभाषा: एक ग्रेडर मॉडल के आउटपुट को लेता है और उसके बारे में एक वस्तुनिष्ठ संकेत (Objective Signal) प्रदान करता है।
  • संकेत का स्वरूप: यह संख्या (जैसे 1 से 10), सत्य/असत्य (True/False), या कोई अन्य मान हो सकता है।
  • सामान्य अभ्यास: अक्सर 1 से 10 के पैमाने पर स्कोर दिया जाता है, जहाँ 10 उच्च गुणवत्ता और 1 निम्न गुणवत्ता दर्शाता है।

⚙️ ग्रेडर के प्रकार (Types of Graders)

  • कोड-आधारित ग्रेडर (Code-based Grader):
  • कार्यप्रणाली: मॉडल के आउटपुट को एक कस्टम कोड स्निपेट में फीड किया जाता है।
  • जाँच के उदाहरण:
  • आउटपुट की लंबाई (बहुत लंबा या बहुत छोटा नहीं होना चाहिए)।
  • विशिष्ट शब्दों की उपस्थिति या अनुपस्थिति।
  • JSON या कोड का सिंटैक्स सत्यापन (Syntax Validation)।
  • पठनीयता स्कोर (Readability Score) की गणना।
  • आवश्यकता: कोड चलाने पर एक वास्तविक संकेत (Signal) वापस आना चाहिए।
  • मॉडल-आधारित ग्रेडर (Model-based Grader):
  • कार्यप्रणाली: मूल मॉडल कॉल के आउटपुट को एक अतिरिक्त LLM (API कॉल) में फीड किया जाता है।
  • लाभ: अत्यधिक लचीलापन; मॉडल को सामान्य गुणवत्ता, निर्देश पालन (Instruction Following), या पूर्णता के आधार पर मूल्यांकन करने के लिए कहा जा सकता है।
  • आवश्यकता: मॉडल को प्रतिक्रिया की सामान्य गुणवत्ता के आधार पर एक वस्तुनिष्ठ संकेत (आमतौर पर 1 से 10 के बीच संख्या) देना चाहिए।
  • मानव-आधारित ग्रेडिंग (Human-based Grading):
  • कार्यप्रणाली: मॉडल के सभी आउटपुट को एक वास्तविक व्यक्ति के सामने रखा जाता है, जो मूल्यांकन करता है।
  • लाभ: अत्यधिक लचीलापन; किसी भी मीट्रिक (Metric) पर मूल्यांकन किया जा सकता है।
  • नुकसान: इसमें बहुत अधिक समय और प्रयास लगता है।

📝 मूल्यांकन मानदंड और कार्यान्वयन (Evaluation Criteria and Implementation)

  • पूर्व-निर्धारण: ग्रेडिंग शुरू करने से पहले मूल्यांकन मानदंड (Evaluation Criteria) तय करना आवश्यक है।
  • उदाहरण के लिए मानदंड:
  • आउटपुट का प्रारूप (Format) सही होना चाहिए (जैसे Python, JSON, या Regular Expression)।
  • आउटपुट में सिंटैक्स (Syntax) की वैधता होनी चाहिए (कोई टाइपो नहीं)।
  • सामान्य कार्य पालन (Task Following) सुनिश्चित करना; मॉडल को उपयोगकर्ता के कार्य का स्पष्ट और सटीक उत्तर देना चाहिए।
  • मॉडल ग्रेडर का उपयोग:
  • प्रॉम्प्ट संरचना: ग्रेडिंग मॉडल को एक विशिष्ट भूमिका (Role) दी जाती है, कार्य (Task) बताया जाता है, मॉडल का समाधान (Solution) दिया जाता है, और प्रतिक्रिया देने के निर्देश (Directions) दिए जाते हैं।
  • बेहतर स्कोर के लिए सुझाव: केवल स्कोर मांगने के बजाय, मॉडल से ताकत (Strengths), कमजोरियाँ (Weaknesses), और तर्क (Reasoning) प्रदान करने को कहें। इससे अधिक ठोस और सटीक स्कोर प्राप्त होते हैं।
  • प्रक्रिया: ग्रेडिंग मॉडल को कॉल करें → JSON आउटपुट प्राप्त करें → JSON को पार्स (Parse) करें।

📊 अंतिम मीट्रिक (Final Metric)

  • लक्ष्य: सभी व्यक्तिगत ग्रेडिंग स्कोर को एकत्र करना और उनका औसत (Average) निकालना।
  • परिणाम: यह प्रॉम्प्ट के प्रदर्शन का एक अंतिम, वस्तुनिष्ठ मीट्रिक प्रदान करता है।

Takeaways

  • ग्रेडिंग सिस्टम मॉडल आउटपुट की गुणवत्ता को मापने के लिए एक वस्तुनिष्ठ संकेत (Objective Signal) प्रदान करता है, जो अक्सर 1 से 10 के पैमाने पर होता है।
  • ग्रेडिंग के तीन मुख्य प्रकार हैं: कोड-आधारित (Code-based), मॉडल-आधारित (Model-based), और मानव-आधारित (Human-based)।
  • प्रभावी मूल्यांकन के लिए पहले मानदंड (Criteria) तय करना आवश्यक है, जैसे आउटपुट का प्रारूप और सिंटैक्स की वैधता।
  • मॉडल ग्रेडर का उपयोग करते समय, केवल स्कोर मांगने के बजाय मॉडल से ताकत, कमजोरियाँ और तर्क (Reasoning) प्रदान करने को कहें ताकि अधिक सटीक स्कोर मिलें।
  • सभी व्यक्तिगत ग्रेडिंग स्कोर को एकत्र करके उनका औसत (Average) निकाला जाता है, जो प्रॉम्प्ट के प्रदर्शन का अंतिम मीट्रिक होता है।
फ्लैशकार्ड 6 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न

No quiz for this lesson yet.