सारांश ऑडियो
इस पाठ के लिए कोई ऑडियो सारांश नहीं है।
अध्ययन नोट्स
प्रॉम्प्ट मूल्यांकन में ग्रेडिंग सिस्टम (Grading System in Prompt Evaluation)
**I. ग्रेडर की परिभाषा और उद्देश्य**
- ग्रेडर (Grader): यह एक प्रणाली है जो मॉडल से प्राप्त आउटपुट लेती है और उसे एक वस्तुनिष्ठ संकेत (Objective Signal) प्रदान करती है।
- संकेत का स्वरूप: यह संख्या (Number), सत्य/असत्य (True/False) या कोई अन्य मान हो सकता है।
- सामान्य अभ्यास: अक्सर 1 से 10 के बीच एक संख्या दी जाती है, जहाँ 10 उच्च गुणवत्ता (High Quality) और 1 निम्न गुणवत्ता (Low Quality) को दर्शाता है।
**II. ग्रेडर के प्रकार (Types of Graders)**
- कोड-आधारित ग्रेडर (Code-based Grader):
- मॉडल के आउटपुट को एक कस्टम कोड स्निपेट में फीड किया जाता है।
- जाँच के प्रकार: प्रोग्रामेटिक जाँच (Programmatic Checks) जैसे:
- आउटपुट की लंबाई (Too long/too short)।
- विशिष्ट शब्दों की उपस्थिति/अनुपस्थिति।
- JSON या कोड की सिंटैक्स सत्यापन (Syntax Validation)।
- पठनीयता स्कोर (Readability Score)।
- मॉडल-आधारित ग्रेडर (Model-based Grader):
- मूल मॉडल के आउटपुट को एक अतिरिक्त मॉडल (Additional Model) में फीड किया जाता है (यह एक नया API अनुरोध है)।
- लचीलापन: यह मॉडल को सामान्य गुणवत्ता, प्रॉम्प्ट निर्देशों का पालन, या प्रतिक्रिया की पूर्णता जैसे किसी भी पहलू का मूल्यांकन करने की अनुमति देता है।
- आवश्यकता: मॉडल को एक वस्तुनिष्ठ संकेत (आमतौर पर 1 से 10 की संख्या) वापस देना चाहिए।
- मानव-आधारित ग्रेडिंग (Human-based Grading):
- मॉडल के आउटपुट को एक वास्तविक व्यक्ति द्वारा मूल्यांकन किया जाता है।
- लाभ: अत्यधिक लचीलापन (किसी भी मीट्रिक पर मूल्यांकन संभव)।
- नुकसान: इसमें बहुत अधिक समय और मेहनत लगती है।
**III. मूल्यांकन मानदंड (Evaluation Criteria)**
- ग्रेडिंग शुरू करने से पहले, मूल्यांकन के मानदंड (Evaluation Criteria) स्पष्ट रूप से परिभाषित किए जाने चाहिए।
- उदाहरण के लिए तीन मानदंड:
- आउटपुट का प्रारूप (Format): केवल Python, JSON, या रेगुलर एक्सप्रेशन होना चाहिए, बिना अतिरिक्त स्पष्टीकरण के।
- सिंटैक्स की वैधता (Syntax Validity): कोड में कोई टाइपो या सिंटैक्स त्रुटि नहीं होनी चाहिए।
- कार्य का पालन (Task Following): मॉडल को उपयोगकर्ता के कार्य को स्पष्ट रूप से संबोधित करना चाहिए और सटीक कोड प्रदान करना चाहिए।
**IV. मॉडल-आधारित ग्रेडर का कार्यान्वयन (Implementation of Model Grader)**
- उपयोग: सामान्य कार्य पालन (General Task Following) जैसे मानदंडों के लिए यह सबसे उपयुक्त है।
- प्रॉम्प्ट की संरचना:
- एक विशिष्ट भूमिका (Role) निर्धारित करें।
- कार्य (Task) और मॉडल द्वारा उत्पन्न समाधान (Solution) को स्पष्ट रूप से सूचीबद्ध करें।
- महत्वपूर्ण सुझाव: केवल स्कोर मांगने के बजाय, मॉडल से ताकत (Strengths), कमजोरियाँ (Weaknesses), और तर्क (Reasoning) प्रदान करने को कहें। इससे अधिक ठोस स्कोर प्राप्त होते हैं।
- अंतिम चरण: सभी टेस्ट केस के स्कोर को जोड़कर औसत स्कोर (Average Score) निकाला जाता है, जो प्रॉम्प्ट
Takeaways
- ग्रेडर एक ऐसी प्रणाली है जो मॉडल के आउटपुट को एक वस्तुनिष्ठ संकेत (Objective Signal) प्रदान करती है, जो अक्सर 1 से 10 के पैमाने पर होता है।
- ग्रेडर मुख्य रूप से तीन प्रकार के होते हैं: कोड-आधारित (प्रोग्रामेटिक जाँच), मॉडल-आधारित (अतिरिक्त मॉडल का उपयोग), और मानव-आधारित (व्यक्ति द्वारा मूल्यांकन)।
- मूल्यांकन शुरू करने से पहले आउटपुट के लिए स्पष्ट मानदंड (जैसे प्रारूप, सिंटैक्स की वैधता, कार्य का पालन) परिभाषित करना आवश्यक है।
- मॉडल-आधारित ग्रेडर का उपयोग करते समय, केवल स्कोर मांगने के बजाय मॉडल से ताकत, कमजोरियाँ और तर्क (Strengths, Weaknesses, Reasoning) पूछना अधिक ठोस परिणाम देता है।
फ्लैशकार्ड 8 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न
No quiz for this lesson yet.