इस डेटासेट में प्रत्येक रिकॉर्ड को क्या कहा जाता है?	टेस्ट केस (Test Case)।
मूल्यांकन (Evaluation) का सामान्य वर्कफ़्लो क्या है?	टेस्ट केस + प्रॉम्प्ट -> Claude -> आउटपुट -> ग्रेडर।
`run prompt` फ़ंक्शन का मुख्य उद्देश्य क्या है?	टेस्ट केस को प्रॉम्प्ट के साथ मर्ज करना और Claude से टेक्स्ट जनरेट करवाना।
`run test case` फ़ंक्शन क्या करता है?	`run prompt` से आउटपुट लेता है, उसे ग्रेड करता है, और सारा विवरण एक डिक्शनरी में लौटाता है।
`run eval` फ़ंक्शन की भूमिका क्या है?	पूरे डेटासेट को लोड करना और प्रत्येक टेस्ट केस के लिए `run test case` को लूप करना।
प्रॉम्प्ट का वास्तविक लक्ष्य क्या होना चाहिए?	केवल विशिष्ट आउटपुट जैसे Python, JSON, या Regular Expression प्राप्त करना।
वर्तमान में इस पाइपलाइन में कौन सा महत्वपूर्ण हिस्सा अनुपस्थित है?	ग्रेडर (Grader)।
