Claude With The Anthropic Api
← सभी पाठ
पाठ 17Claude With The Anthropic Api

A typical eval workflow

सारांश ऑडियो

इस पाठ के लिए कोई ऑडियो सारांश नहीं है।

अध्ययन नोट्स

प्रॉम्प्ट इवैल्यूएशन वर्कफ़्लो (Prompt Evaluation Workflow) के मुख्य बिंदु

  • वर्कफ़्लो की प्रकृति:
  • प्रॉम्प्ट इवैल्यूएशन के लिए कोई एक मानक (standard) पद्धति नहीं है।
  • आप अपनी आवश्यकतानुसार वर्कफ़्लो को असेंबल (assemble) कर सकते हैं।
  • छोटे स्तर से शुरुआत करना संभव है, भारी समाधान (heavyweight solution) की आवश्यकता नहीं है।
  • वर्कफ़्लो के चरण (Workflow Steps):
  • प्रारंभिक प्रॉम्प्ट ड्राफ्ट (Initial Prompt Draft):
  • वह मूल प्रॉम्प्ट लिखें जिसे आप सुधारना चाहते हैं।
  • इसमें उपयोगकर्ता के इनपुट (user input) को इंटरपोलेट (interpolate) किया जाता है।
  • मूल्यांकन डेटासेट बनाना (Create Evaluation Dataset):
  • यह डेटासेट उन सभी संभावित इनपुट (जैसे प्रश्न) को रखता है जिन्हें प्रॉम्प्ट में डाला जाएगा।
  • वास्तविक दुनिया में डेटासेट में सैकड़ों या हजारों रिकॉर्ड हो सकते हैं।
  • प्रॉम्प्ट निष्पादन (Prompt Execution):
  • डेटासेट के प्रत्येक इनपुट को प्रॉम्प्ट में फीड किया जाता है।
  • पूरे प्रॉम्प्ट को LLM (जैसे Claude) में फीड किया जाता है और वास्तविक प्रतिक्रिया (response) प्राप्त की जाती है।
  • ग्रेडिंग/स्कोरिंग (Grading/Scoring):
  • प्रत्येक प्रश्न और LLM द्वारा दी गई प्रतिक्रिया को एक साथ जोड़ा जाता है।
  • इस जोड़े को एक 'ग्रेडर' (grader) को दिया जाता है, जो प्रतिक्रिया की गुणवत्ता के आधार पर एक स्कोर (जैसे 1 से 10) प्रदान करता है।
  • औसत निकालना (Averaging):
  • सभी प्राप्त स्कोर को जोड़ा जाता है और कुल रिकॉर्ड की संख्या से विभाजित किया जाता है।
  • यह एक वस्तुनिष्ठ (objective) तरीका है जिससे पता चलता है कि मूल प्रॉम्प्ट ने कितना अच्छा प्रदर्शन किया।
  • पुनरावृत्ति/सुधार (Iteration/Refinement):
  • स्कोर के आधार पर प्रॉम्प्ट में बदलाव किया जाता है (जैसे अधिक विवरण जोड़ना)।
  • पूरे पाइपलाइन को फिर से चलाया जाता है।
  • नए और पुराने प्रॉम्प्ट के स्कोर की तुलना करके बेहतर संस्करण का चयन किया जाता है।

Takeaways

  • प्रॉम्प्ट इवैल्यूएशन के लिए कोई मानक पद्धति नहीं है; वर्कफ़्लो को आवश्यकतानुसार असेंबल किया जा सकता है।
  • प्रक्रिया में एक मूल्यांकन डेटासेट बनाना और प्रॉम्प्ट को उस पर निष्पादित करके वास्तविक प्रतिक्रिया प्राप्त करना शामिल है।
  • प्रतिक्रिया की गुणवत्ता का आकलन करने के लिए एक 'ग्रेडर' का उपयोग किया जाता है, जो स्कोर (जैसे 1 से 10) प्रदान करता है।
  • सभी स्कोर का औसत निकालकर प्रॉम्प्ट के प्रदर्शन का वस्तुनिष्ठ मूल्यांकन किया जाता है।
  • प्राप्त स्कोर के आधार पर प्रॉम्प्ट में सुधार (Iteration) किया जाता है और बेहतर संस्करण का चयन किया जाता है।
फ्लैशकार्ड 8 कार्ड
प्रश्न
प्रकट करने के लिए क्लिक करें · ←/→
उत्तर
वापस पलटने के लिए क्लिक करें
ज्ञान जाँच 0 प्रश्न

No quiz for this lesson yet.