सारांश ऑडियो
इस पाठ के लिए कोई ऑडियो सारांश नहीं है।
अध्ययन नोट्स
प्रॉम्प्ट मूल्यांकन में ग्रेडिंग सिस्टम (Prompt Evaluation Grading System)
**I. ग्रेडिंग सिस्टम का उद्देश्य (Objective of Grading System)**
- परिभाषा: एक ग्रेडर मॉडल के आउटपुट को लेता है और उसे एक वस्तुनिष्ठ संकेत (objective signal) प्रदान करता है।
- संकेत का स्वरूप: यह संख्या (जैसे 1 से 10), सत्य/असत्य (True/False), या कोई अन्य मान हो सकता है।
- सामान्य अभ्यास: अक्सर 1 से 10 के पैमाने का उपयोग किया जाता है, जहाँ 10 उच्च गुणवत्ता और 1 निम्न गुणवत्ता दर्शाता है।
**II. ग्रेडर के प्रकार (Types of Graders)**
- कोड-आधारित ग्रेडर (Code-based Grader):
- मॉडल के आउटपुट को कस्टम कोड स्निपेट में फीड किया जाता है।
- कार्य: प्रोग्रामेटिक जाँच करना (जैसे आउटपुट की लंबाई, विशिष्ट शब्दों की उपस्थिति, JSON/कोड की सिंटैक्स वैलिडेशन, या पठनीयता स्कोर)।
- आवश्यकता: कोड चलाने पर एक उपयोग योग्य संकेत (signal) वापस मिलना चाहिए।
- मॉडल-आधारित ग्रेडर (Model-based Grader):
- मूल मॉडल के आउटपुट को एक अतिरिक्त मॉडल (API कॉल) में फीड किया जाता है।
- लाभ: अत्यधिक लचीलापन। मॉडल को गुणवत्ता, निर्देश पालन, या पूर्णता के आधार पर मूल्यांकन करने के लिए कहा जा सकता है।
- आवश्यकता: मॉडल को एक वस्तुनिष्ठ संकेत (आमतौर पर 1 से 10 के बीच संख्या) वापस देना चाहिए।
- मानव-आधारित ग्रेडिंग (Human-based Grading):
- मॉडल के सभी आउटपुट को वास्तविक व्यक्तियों के सामने रखा जाता है।
- लाभ: मूल्यांकन के लिए असीमित लचीलापन।
- नुकसान: इसमें बहुत अधिक समय और श्रम लगता है।
**III. मूल्यांकन मानदंड (Evaluation Criteria)**
- ग्रेडिंग शुरू करने से पहले मूल्यांकन के मानदंड स्पष्ट रूप से परिभाषित किए जाने चाहिए।
- उदाहरण:
- स्वरूप जाँच (Format Check): क्या आउटपुट केवल Python, JSON, या Regular Expression है, बिना किसी अतिरिक्त स्पष्टीकरण के?
- सिंटैक्स सत्यापन (Syntax Validation): क्या कोड में कोई टाइपो या सिंटैक्स त्रुटि है?
- कार्य पालन (Task Following): क्या मॉडल ने उपयोगकर्ता के कार्य को स्पष्ट रूप से संबोधित किया है और क्या कोड में कोई बड़ी तार्किक त्रुटि नहीं है?
**IV. मॉडल-आधारित ग्रेडर का कार्यान्वयन (Implementation of Model-based Grader)**
- प्रक्रिया:
- एक विस्तृत प्रॉम्प्ट तैयार करना (भूमिका निर्धारित करना, कार्य बताना, समाधान प्रस्तुत करना, और प्रतिक्रिया के लिए निर्देश देना)।
- सुझाव: केवल स्कोर मांगने के बजाय, मॉडल से ताकत (strengths), कमजोरियाँ (weaknesses), और तर्क (reasoning) भी माँगे। इससे अधिक ठोस स्कोर प्राप्त होते हैं।
- मॉडल को कॉल करना और JSON आउटपुट को पार्स (parse) करना।
- परिणाम: ग्रेडर एक JSON ऑब्जेक्ट लौटाता है जिसमें स्कोर, तर्क, और ताकत/कमजोरियों की सूची होती है।
**V. अंतिम स्कोर गणना (Final Score Calculation)**
- एकीकरण: मूल स्कोर को model_grade से बदला जाता है।
- डेटा निष्कर्षण: ग्रेडर से score, reasoning, और strengths/weaknesses जैसे अतिरिक्त डेटा निकाले जाते हैं।
- अंतिम मीट्रिक: सभी प्राप्त स्कोर का औसत (mean) निकाला जाता है।
- परिणाम: यह एक वस्तुनिष्ठ मीट्रिक प्रदान करता है जो प्रॉम्प्ट के प्रदर्शन को
Takeaways
- ग्रेडिंग सिस्टम का मुख्य उद्देश्य मॉडल आउटपुट को एक वस्तुनिष्ठ संकेत (जैसे 1 से 10) प्रदान करना है।
- ग्रेडिंग के तीन मुख्य प्रकार हैं: कोड-आधारित (प्रोग्रामेटिक जाँच), मॉडल-आधारित (अतिरिक्त AI कॉल), और मानव-आधारित।
- मूल्यांकन के लिए स्वरूप जाँच, सिंटैक्स सत्यापन और कार्य पालन जैसे मानदंडों को स्पष्ट रूप से परिभाषित करना आवश्यक है।
- मॉडल-आधारित ग्रेडिंग में, केवल स्कोर के बजाय मॉडल से ताकत, कमजोरियाँ और तर्क भी माँगा जाना चाहिए ताकि ठोस प्रतिक्रिया मिल सके।
- अंतिम स्कोर की गणना सभी प्राप्त व्यक्तिगत स्कोर का औसत (mean) निकालकर की जाती है।
फ्लैशकार्ड 10 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न
No quiz for this lesson yet.