Claude With Amazon Bedrock
← सभी पाठ
पाठ 16Claude With Amazon Bedrock

Running the eval

सारांश ऑडियो

इस पाठ के लिए कोई ऑडियो सारांश नहीं है।

अध्ययन नोट्स

मुख्य अवधारणाएँ: मूल्यांकन पाइपलाइन (Evaluation Pipeline)

यह नोट्स एक AI मॉडल के प्रदर्शन का मूल्यांकन करने के लिए उपयोग किए जाने वाले वर्कफ़्लो (workflow) और उसके प्रमुख घटकों को समझाते हैं।

**1. संपूर्ण वर्कफ़्लो (Overall Workflow):**

  • प्रक्रिया: प्रत्येक टेस्ट केस (Test Case) को प्रॉम्प्ट (Prompt) के साथ मर्ज किया जाता है → इसे Claude में फीड किया जाता है → परिणाम प्राप्त होता है → परिणाम को ग्रेडर (Grader) के माध्यम से जाँचा जाता है।
  • उद्देश्य: डेटासेट के प्रत्येक रिकॉर्ड (टेस्ट केस) का मूल्यांकन करना।

**2. प्रमुख फ़ंक्शंस (Major Functions):**

  • run prompt फ़ंक्शन:
  • कार्य: एक व्यक्तिगत टेस्ट केस को लेता है और उसे प्रॉम्प्ट के साथ मर्ज करता है।
  • प्रक्रिया: यह मर्ज किया गया टास्क Claude को भेजा जाता है (जैसे chat फ़ंक्शन का उपयोग करके)।
  • आउटपुट: Claude से प्राप्त कच्चा परिणाम (Raw Output)।
  • वर्तमान स्थिति: प्रॉम्प्ट सरल है (जैसे: "कृपया निम्नलिखित कार्य को हल करें") और इसमें अभी कोई विशिष्ट फ़ॉर्मेटिंग निर्देश (जैसे JSON या Python) शामिल नहीं हैं।
  • run test case फ़ंक्शन:
  • कार्य: एक एकल टेस्ट केस का मूल्यांकन करता है।
  • प्रक्रिया:
  • run prompt फ़ंक्शन को कॉल करके Claude से आउटपुट प्राप्त करता है।
  • प्राप्त आउटपुट को ग्रेड किया जाता है (वर्तमान में यह स्कोर 10 पर हार्डकोड किया गया है)।
  • एक सारांश डिक्शनरी (Dictionary) तैयार की जाती है।
  • आउटपुट: एक डिक्शनरी जिसमें आउटपुट, टेस्ट केस और स्कोर शामिल होता है।
  • run eval फ़ंक्शन:
  • कार्य: पूरे डेटासेट का मूल्यांकन करता है।
  • प्रक्रिया:
  • डेटासेट को लोड करता है।
  • डेटासेट के प्रत्येक टेस्ट केस पर लूप (Loop) चलाता है।
  • प्रत्येक केस के लिए run test case को कॉल करता है।
  • सभी परिणामों को एक साथ इकट्ठा करता है।
  • आउटपुट: सभी टेस्ट केस परिणामों की एक सूची (List of results)।

**3. निष्कर्ष और अगला कदम:**

  • पाइपलाइन की स्थिति: मूल्यांकन पाइपलाइन का अधिकांश ढाँचा (Structure) तैयार है।
  • अंतिम कमी: इस पाइपलाइन का सबसे महत्वपूर्ण और अभी बाकी रहने वाला हिस्सा ग्रेडर (Grader) है।
  • परिणाम: run eval फ़ंक्शन चलाने पर, हमें एक बड़े JSON ऑब्जेक्ट में सभी टेस्ट केस के आउटपुट, टेस्ट केस की परिभाषा और स्कोर मिलते हैं।

Takeaways

  • मूल्यांकन पाइपलाइन का उद्देश्य डेटासेट के प्रत्येक टेस्ट केस का प्रदर्शन का मूल्यांकन करना है।
  • run prompt फ़ंक्शन टेस्ट केस को प्रॉम्प्ट के साथ मर्ज करके Claude को भेजता है, जिससे कच्चा आउटपुट प्राप्त होता है।
  • run test case फ़ंक्शन प्राप्त आउटपुट को ग्रेड करता है और एक सारांश डिक्शनरी तैयार करता है।
  • run eval फ़ंक्शन पूरे डेटासेट पर लूप चलाकर प्रत्येक टेस्ट केस का मूल्यांकन करता है और सभी परिणामों को एक सूची में इकट्ठा करता है।
  • वर्तमान में, इस पाइपलाइन का सबसे महत्वपूर्ण और अधूरा हिस्सा 'ग्रेडर' है।
फ्लैशकार्ड 7 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न

No quiz for this lesson yet.