प्रॉम्प्ट मूल्यांकन वर्कफ़्लो में ग्रेडिंग सिस्टम का मुख्य उद्देश्य क्या है?	मॉडल के आउटपुट से एक वस्तुनिष्ठ संकेत (objective signal) प्राप्त करना, जैसे कि संख्या या सत्य/असत्य मान।
ग्रेडिंग के लिए मुख्य रूप से कौन से तीन प्रकार के ग्रेडर्स हैं?	कोड-आधारित (Code), मॉडल-आधारित (Model), और मानव-आधारित (Human)।
कोड-आधारित ग्रेडर (Code-based grader) का उपयोग किस प्रकार के प्रोग्रामेटिक चेक के लिए किया जाता है?	आउटपुट की लंबाई, विशिष्ट शब्दों की उपस्थिति, JSON/कोड की सिंटैक्स वैलिडेशन, या पठनीयता स्कोर (readability score) की जाँच के लिए।
मॉडल-आधारित ग्रेडर (Model-based grader) कैसे काम करता है?	यह मूल मॉडल के आउटपुट को एक अतिरिक्त मॉडल में फीड करता है ताकि वह प्रतिक्रिया का मूल्यांकन कर सके।
मानव-आधारित ग्रेडिंग (Human-based grading) का सबसे बड़ा नुकसान क्या है?	इसमें बहुत अधिक समय लगता है और यह एक थकाऊ (tedious) काम होता है।
मूल्यांकन के लिए तीन मुख्य मानदंड (evaluation criteria) क्या हैं?	1. आउटपुट का प्रारूप (Format), 2. सिंटैक्स की वैधता (Syntax validity), और 3. सामान्य कार्य का पालन (General task following)।
प्रारूप और सिंटैक्स की जाँच के लिए कौन सा ग्रेडर सबसे उपयुक्त है?	कोड-आधारित ग्रेडर।
सामान्य कार्य का पालन और विस्तृत तर्क (reasoning) के लिए कौन सा ग्रेडर सबसे उपयुक्त है?	मॉडल-आधारित ग्रेडर।
मॉडल-आधारित ग्रेडर को केवल स्कोर देने के बजाय 'ताकत और कमजोरियाँ' क्यों पूछनी चाहिए?	इससे मॉडल अधिक केंद्रित होकर एक ठोस और अधिक सटीक स्कोर देता है, न कि केवल औसत स्कोर (जैसे 6)।
मूल्यांकन प्रक्रिया के अंत में प्राप्त अंतिम वस्तुनिष्ठ मीट्रिक (objective metric) क्या होता है?	सभी व्यक्तिगत स्कोर का औसत (Average score)।
