सारांश ऑडियो
इस पाठ के लिए कोई ऑडियो सारांश नहीं है।
अध्ययन नोट्स
मूल अवधारणा: मूल्यांकन पाइपलाइन (Evaluation Pipeline)
यह नोट्स एक डेटासेट का उपयोग करके AI मॉडल (जैसे Claude) के प्रदर्शन का मूल्यांकन करने की प्रक्रिया को समझाते हैं।
पाइपलाइन का सामान्य प्रवाह (General Workflow):
- डेटासेट के प्रत्येक रिकॉर्ड (टेस्ट केस) को लें।
- टेस्ट केस को प्रॉम्प्ट के साथ मर्ज करें।
- परिणाम को Claude में फीड करें।
- सभी आउटपुट को ग्रेडर (Grader) के माध्यम से पास करें।
मुख्य कार्य (Key Functions):
- run prompt function (प्रॉम्प्ट चलाना):
- कार्य: एक व्यक्तिगत टेस्ट केस लेता है।
- प्रक्रिया: टेस्ट केस को प्रॉम्प्ट के साथ मर्ज करता है → Claude को भेजता है → परिणाम (Output) वापस करता है।
- वर्तमान स्थिति: प्रॉम्प्ट अभी बहुत सरल है (जैसे: "कृपया निम्नलिखित कार्य को हल करें") और इसमें आउटपुट के लिए कोई विशिष्ट फॉर्मेट (जैसे JSON या Python) नहीं मांगा गया है।
- run test case function (टेस्ट केस चलाना):
- कार्य: एक व्यक्तिगत टेस्ट केस का मूल्यांकन करता है।
- प्रक्रिया: run prompt function को कॉल करता है → Claude से आउटपुट प्राप्त करता है → परिणाम को ग्रेड करता है (वर्तमान में स्कोर हार्डकोडेड है) → एक सारांश डिक्शनरी (Test Case, Output, Score) लौटाता है।
- run eval function (मूल मूल्यांकन चलाना):
- कार्य: पूरे डेटासेट का मूल्यांकन करता है।
- प्रक्रिया: पूरे डेटासेट को लोड करता है → प्रत्येक टेस्ट केस के लिए run test case function को लूप में कॉल करता है → सभी परिणामों को एक सूची (List) में इकट्ठा करता है और लौटाता है।
मुख्य निष्कर्ष और सीमाएँ (Key Takeaways and Limitations):
- पाइपलाइन संरचना: एक पूर्ण मूल्यांकन पाइपलाइन के लिए ये तीन मुख्य फ़ंक्शन आवश्यक हैं।
- वर्तमान कमी: इस सेटअप में सबसे बड़ी कमी 'ग्रेडिंग' (Grading) का तंत्र है, जो अभी लागू नहीं किया गया है।
- आउटपुट: run eval फ़ंक्शन अंत में एक बड़ा JSON ऑब्जेक्ट लौटाता है, जिसमें प्रत्येक टेस्ट केस का आउटपुट और स्कोर शामिल होता है।
- सुधार की आवश्यकता: भविष्य में प्रॉम्प्ट में आउटपुट के लिए सख्त फॉर्मेटिंग निर्देश (जैसे JSON) जोड़ने की आवश्यकता होगी।
Takeaways
- मूल्यांकन पाइपलाइन तीन मुख्य कार्यों पर आधारित है: run prompt function, run test case function, और run eval function।
- सामान्य प्रवाह में, टेस्ट केस को प्रॉम्प्ट के साथ मर्ज किया जाता है, Claude में फीड किया जाता है, और फिर ग्रेडिंग के लिए पास किया जाता है।
- वर्तमान सेटअप की मुख्य सीमा यह है कि इसमें एक स्वचालित और मजबूत 'ग्रेडिंग' (Grading) का तंत्र अभी लागू नहीं किया गया है।
- भविष्य के सुधार के लिए प्रॉम्प्ट में आउटपुट के लिए सख्त फॉर्मेटिंग निर्देश (जैसे JSON) जोड़ने की आवश्यकता है।
फ्लैशकार्ड 8 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न
No quiz for this lesson yet.