Claude With The Anthropic Api
← सभी पाठ
पाठ 20Claude With The Anthropic Api

Model based grading

सारांश ऑडियो

इस पाठ के लिए कोई ऑडियो सारांश नहीं है।

अध्ययन नोट्स

प्रॉम्प्ट मूल्यांकन में ग्रेडिंग सिस्टम (Prompt Evaluation Grading System)

**I. ग्रेडिंग सिस्टम का उद्देश्य (Objective of Grading System)**

  • परिभाषा: एक ग्रेडर मॉडल के आउटपुट को लेता है और उसे एक वस्तुनिष्ठ संकेत (objective signal) प्रदान करता है।
  • संकेत का स्वरूप: यह संख्या (जैसे 1 से 10), सत्य/असत्य (True/False), या कोई अन्य मान हो सकता है।
  • सामान्य अभ्यास: अक्सर 1 से 10 के पैमाने का उपयोग किया जाता है, जहाँ 10 उच्च गुणवत्ता और 1 निम्न गुणवत्ता दर्शाता है।

**II. ग्रेडर के प्रकार (Types of Graders)**

  • कोड-आधारित ग्रेडर (Code-based Grader):
  • मॉडल के आउटपुट को कस्टम कोड स्निपेट में फीड किया जाता है।
  • कार्य: प्रोग्रामेटिक जाँच करना (जैसे आउटपुट की लंबाई, विशिष्ट शब्दों की उपस्थिति, JSON/कोड की सिंटैक्स वैलिडेशन, या पठनीयता स्कोर)।
  • आवश्यकता: कोड चलाने पर एक उपयोग योग्य संकेत (signal) वापस मिलना चाहिए।
  • मॉडल-आधारित ग्रेडर (Model-based Grader):
  • मूल मॉडल के आउटपुट को एक अतिरिक्त मॉडल (API कॉल) में फीड किया जाता है।
  • लाभ: अत्यधिक लचीलापन। मॉडल को गुणवत्ता, निर्देश पालन, या पूर्णता के आधार पर मूल्यांकन करने के लिए कहा जा सकता है।
  • आवश्यकता: मॉडल को एक वस्तुनिष्ठ संकेत (आमतौर पर 1 से 10 के बीच संख्या) वापस देना चाहिए।
  • मानव-आधारित ग्रेडिंग (Human-based Grading):
  • मॉडल के सभी आउटपुट को वास्तविक व्यक्तियों के सामने रखा जाता है।
  • लाभ: मूल्यांकन के लिए असीमित लचीलापन।
  • नुकसान: इसमें बहुत अधिक समय और श्रम लगता है।

**III. मूल्यांकन मानदंड (Evaluation Criteria)**

  • ग्रेडिंग शुरू करने से पहले मूल्यांकन के मानदंड स्पष्ट रूप से परिभाषित किए जाने चाहिए।
  • उदाहरण:
  • स्वरूप जाँच (Format Check): क्या आउटपुट केवल Python, JSON, या Regular Expression है, बिना किसी अतिरिक्त स्पष्टीकरण के?
  • सिंटैक्स सत्यापन (Syntax Validation): क्या कोड में कोई टाइपो या सिंटैक्स त्रुटि है?
  • कार्य पालन (Task Following): क्या मॉडल ने उपयोगकर्ता के कार्य को स्पष्ट रूप से संबोधित किया है और क्या कोड में कोई बड़ी तार्किक त्रुटि नहीं है?

**IV. मॉडल-आधारित ग्रेडर का कार्यान्वयन (Implementation of Model-based Grader)**

  • प्रक्रिया:
  • एक विस्तृत प्रॉम्प्ट तैयार करना (भूमिका निर्धारित करना, कार्य बताना, समाधान प्रस्तुत करना, और प्रतिक्रिया के लिए निर्देश देना)।
  • सुझाव: केवल स्कोर मांगने के बजाय, मॉडल से ताकत (strengths), कमजोरियाँ (weaknesses), और तर्क (reasoning) भी माँगे। इससे अधिक ठोस स्कोर प्राप्त होते हैं।
  • मॉडल को कॉल करना और JSON आउटपुट को पार्स (parse) करना।
  • परिणाम: ग्रेडर एक JSON ऑब्जेक्ट लौटाता है जिसमें स्कोर, तर्क, और ताकत/कमजोरियों की सूची होती है।

**V. अंतिम स्कोर गणना (Final Score Calculation)**

  • एकीकरण: मूल स्कोर को model_grade से बदला जाता है।
  • डेटा निष्कर्षण: ग्रेडर से score, reasoning, और strengths/weaknesses जैसे अतिरिक्त डेटा निकाले जाते हैं।
  • अंतिम मीट्रिक: सभी प्राप्त स्कोर का औसत (mean) निकाला जाता है।
  • परिणाम: यह एक वस्तुनिष्ठ मीट्रिक प्रदान करता है जो प्रॉम्प्ट के प्रदर्शन को

Takeaways

  • ग्रेडिंग सिस्टम का मुख्य उद्देश्य मॉडल आउटपुट को एक वस्तुनिष्ठ संकेत (जैसे 1 से 10) प्रदान करना है।
  • ग्रेडिंग के तीन मुख्य प्रकार हैं: कोड-आधारित (प्रोग्रामेटिक जाँच), मॉडल-आधारित (अतिरिक्त AI कॉल), और मानव-आधारित।
  • मूल्यांकन के लिए स्वरूप जाँच, सिंटैक्स सत्यापन और कार्य पालन जैसे मानदंडों को स्पष्ट रूप से परिभाषित करना आवश्यक है।
  • मॉडल-आधारित ग्रेडिंग में, केवल स्कोर के बजाय मॉडल से ताकत, कमजोरियाँ और तर्क भी माँगा जाना चाहिए ताकि ठोस प्रतिक्रिया मिल सके।
  • अंतिम स्कोर की गणना सभी प्राप्त व्यक्तिगत स्कोर का औसत (mean) निकालकर की जाती है।
फ्लैशकार्ड 10 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न

No quiz for this lesson yet.