Claude On Google Cloud
← सभी पाठ
पाठ 18Claude On Google Cloud

Model based grading

सारांश ऑडियो

इस पाठ के लिए कोई ऑडियो सारांश नहीं है।

अध्ययन नोट्स

प्रॉम्प्ट मूल्यांकन में ग्रेडिंग सिस्टम (Grading System in Prompt Evaluation)

**I. ग्रेडर की परिभाषा और उद्देश्य**

  • ग्रेडर (Grader): यह एक प्रणाली है जो मॉडल से प्राप्त आउटपुट लेती है और उसे एक वस्तुनिष्ठ संकेत (Objective Signal) प्रदान करती है।
  • संकेत का स्वरूप: यह संख्या (Number), सत्य/असत्य (True/False) या कोई अन्य मान हो सकता है।
  • सामान्य अभ्यास: अक्सर 1 से 10 के बीच एक संख्या दी जाती है, जहाँ 10 उच्च गुणवत्ता (High Quality) और 1 निम्न गुणवत्ता (Low Quality) को दर्शाता है।

**II. ग्रेडर के प्रकार (Types of Graders)**

  • कोड-आधारित ग्रेडर (Code-based Grader):
  • मॉडल के आउटपुट को एक कस्टम कोड स्निपेट में फीड किया जाता है।
  • जाँच के प्रकार: प्रोग्रामेटिक जाँच (Programmatic Checks) जैसे:
  • आउटपुट की लंबाई (Too long/too short)।
  • विशिष्ट शब्दों की उपस्थिति/अनुपस्थिति।
  • JSON या कोड की सिंटैक्स सत्यापन (Syntax Validation)।
  • पठनीयता स्कोर (Readability Score)।
  • मॉडल-आधारित ग्रेडर (Model-based Grader):
  • मूल मॉडल के आउटपुट को एक अतिरिक्त मॉडल (Additional Model) में फीड किया जाता है (यह एक नया API अनुरोध है)।
  • लचीलापन: यह मॉडल को सामान्य गुणवत्ता, प्रॉम्प्ट निर्देशों का पालन, या प्रतिक्रिया की पूर्णता जैसे किसी भी पहलू का मूल्यांकन करने की अनुमति देता है।
  • आवश्यकता: मॉडल को एक वस्तुनिष्ठ संकेत (आमतौर पर 1 से 10 की संख्या) वापस देना चाहिए।
  • मानव-आधारित ग्रेडिंग (Human-based Grading):
  • मॉडल के आउटपुट को एक वास्तविक व्यक्ति द्वारा मूल्यांकन किया जाता है।
  • लाभ: अत्यधिक लचीलापन (किसी भी मीट्रिक पर मूल्यांकन संभव)।
  • नुकसान: इसमें बहुत अधिक समय और मेहनत लगती है।

**III. मूल्यांकन मानदंड (Evaluation Criteria)**

  • ग्रेडिंग शुरू करने से पहले, मूल्यांकन के मानदंड (Evaluation Criteria) स्पष्ट रूप से परिभाषित किए जाने चाहिए।
  • उदाहरण के लिए तीन मानदंड:
  • आउटपुट का प्रारूप (Format): केवल Python, JSON, या रेगुलर एक्सप्रेशन होना चाहिए, बिना अतिरिक्त स्पष्टीकरण के।
  • सिंटैक्स की वैधता (Syntax Validity): कोड में कोई टाइपो या सिंटैक्स त्रुटि नहीं होनी चाहिए।
  • कार्य का पालन (Task Following): मॉडल को उपयोगकर्ता के कार्य को स्पष्ट रूप से संबोधित करना चाहिए और सटीक कोड प्रदान करना चाहिए।

**IV. मॉडल-आधारित ग्रेडर का कार्यान्वयन (Implementation of Model Grader)**

  • उपयोग: सामान्य कार्य पालन (General Task Following) जैसे मानदंडों के लिए यह सबसे उपयुक्त है।
  • प्रॉम्प्ट की संरचना:
  • एक विशिष्ट भूमिका (Role) निर्धारित करें।
  • कार्य (Task) और मॉडल द्वारा उत्पन्न समाधान (Solution) को स्पष्ट रूप से सूचीबद्ध करें।
  • महत्वपूर्ण सुझाव: केवल स्कोर मांगने के बजाय, मॉडल से ताकत (Strengths), कमजोरियाँ (Weaknesses), और तर्क (Reasoning) प्रदान करने को कहें। इससे अधिक ठोस स्कोर प्राप्त होते हैं।
  • अंतिम चरण: सभी टेस्ट केस के स्कोर को जोड़कर औसत स्कोर (Average Score) निकाला जाता है, जो प्रॉम्प्ट

Takeaways

  • ग्रेडर एक ऐसी प्रणाली है जो मॉडल के आउटपुट को एक वस्तुनिष्ठ संकेत (Objective Signal) प्रदान करती है, जो अक्सर 1 से 10 के पैमाने पर होता है।
  • ग्रेडर मुख्य रूप से तीन प्रकार के होते हैं: कोड-आधारित (प्रोग्रामेटिक जाँच), मॉडल-आधारित (अतिरिक्त मॉडल का उपयोग), और मानव-आधारित (व्यक्ति द्वारा मूल्यांकन)।
  • मूल्यांकन शुरू करने से पहले आउटपुट के लिए स्पष्ट मानदंड (जैसे प्रारूप, सिंटैक्स की वैधता, कार्य का पालन) परिभाषित करना आवश्यक है।
  • मॉडल-आधारित ग्रेडर का उपयोग करते समय, केवल स्कोर मांगने के बजाय मॉडल से ताकत, कमजोरियाँ और तर्क (Strengths, Weaknesses, Reasoning) पूछना अधिक ठोस परिणाम देता है।
फ्लैशकार्ड 8 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न

No quiz for this lesson yet.