जिम्मेदार AI, सुरक्षा और जोखिम आर्किटेक्ट्स के लिए
इस पाठ के लिए कोई ऑडियो सारांश नहीं है।
स्क्रीन 1: सुरक्षा स्टैक: प्रत्येक परत का मालिक कौन है, और जब एक विफल हो तो क्या होता है
अभिविन्यास मॉड्यूल 2 मिनट सुरक्षा स्टैक: प्रत्येक परत का मालिक कौन है, और जब एक विफल हो तो क्या होता है
पहले के मॉड्यूल एक परिचालन उत्पादन प्रणाली के साथ समाप्त हुए: एक साथी समस्या के प्रत्येक चरण को सही मालिक को सौंपा गया था, एक संदर्भ आर्किटेक्चर और एक मॉडल चुना गया था, उपयोग केस को आकार दिया गया था, evals को स्वीकृति मानदंड के रूप में बनाया गया था, और एकीकरण परतें Claude को एक एंटरप्राइज स्टैक में एम्बेड करने के लिए रखी गई थीं।
यह मॉड्यूल प्रमुख सुरक्षा प्रश्न को संबोधित करता है: एक वैध अनुरोध को अस्वीकार करने, एक अन्यायपूर्ण परिणाम उत्पन्न करने, या किसी को मंजूरी न देने वाली कार्रवाई करने से सिस्टम को रोकने के लिए कौन से नियंत्रण हैं? सुरक्षा नियंत्रणों का एक पूर्ण सेट है, प्रत्येक अनुरोध पथ के एक अलग हिस्से को कवर करता है, प्रत्येक के पास एक अंधा स्थान है जो अगला एक पकड़ना है। आर्किटेक्ट प्रत्येक नियंत्रण को रखने और यह तय करने के लिए जिम्मेदार है कि यदि यह विफल हो तो क्या करना है।
इस मॉड्यूल के अंत तक, आप सक्षम होंगे: 1 यह अंतर करें कि मॉडल का प्रशिक्षण क्या कम करता है और आपकी एप्लिकेशन परत को अभी भी क्या लागू करना चाहिए। 2 इनपुट स्क्रीनिंग, आउटपुट स्क्रीनिंग, और टूल-कॉल प्राधिकरण को अनुरोध पथ पर उपयुक्त बिंदुओं पर रखें और यह निर्धारित करें कि मॉडल-आधारित बनाम नियतात्मक जांच का उपयोग कब करें, ताकि सिस्टम खुले के बजाय बंद हो जाए। 3 एक सिस्टम के भीतर असमान परिणाम कहां उत्पन्न हो सकते हैं, इसकी पहचान करें और उपयोगकर्ताओं, नियामकों, और अपनी स्वयं की डिबगिंग टीम के लिए आवश्यक व्याख्याओं को परिभाषित करें, ताकि निष्पक्षता और पारदर्शिता डिजाइन में निर्मित हों। 4 आत्मविश्वास, प्रतिवर्तनीयता, और गलत उत्तर की लागत के आधार पर निर्णयों को उपयुक्त समीक्षक/निर्णय निर्माता को रूट करें, ताकि समीक्षा प्रयास उन निर्णयों पर केंद्रित हो जो उन्हें वारंट करते हैं। 5 प्रत्येक अनुपालन दायित्व को एक नामित नियंत्रण, एक मालिक, और एक साक्ष्य कलाकृति के लिए मैप करें, ताकि आर्किटेक्चर को सटीक रूप से ऑडिट किया जा सके।
यह मॉड्यूल उस आर्किटेक्ट के लिए है जिसने पहले से ही एक कार्यशील सिस्टम बनाया है: स्वामित्व सौंपा गया, आर्किटेक्चर चुना गया, evals बनाए गए, और Claude को एक एंटरप्राइज स्टैक में वायर किया गया। Claude व्यापक सुरक्षा व्यवहार के साथ आता है, लेकिन यह साथी के डेटा-हैंडलिंग नियमों, प्राधिकरण मॉडल, या डोमेन नीति को नहीं जानता। यह मानना कि Claude एक नियम को लागू करता है जो उसे कभी नहीं दिया गया था, सुरक्षा डिजाइन विफल होने का सबसे आम तरीका है।
इस मॉड्यूल में सब कुछ एक संदर्भ के चारों ओर बनाया गया है: एक सिस्टम जो हर आर्किटेक्चर समीक्षा पास करता है और फिर भी उत्पादन में विफल हो जाता है। जिम्मेदारी परत अधूरी थी, मान ली गई थी, या डिजाइन समय पर सही थी लेकिन किसी ने इसे ऑडिट करने के समय गलत थी। साथी विनियमित सेटिंग्स में एंटरप्राइज खरीदार हैं, जहां एक नियंत्रण जो एक डेमो में ठोस दिखता है, जब कॉन्फ़िगरेशन बहाव या एक समीक्षक सबूत के लिए पूछता है तो एक ऑडिट खोज बन जाता है कि नियंत्रण चल रहा है।
निर्णय अनुभाग के लिए मैप करते हैं जो अनुसरण करते हैं
संरेखण सीमा वह जगह है जहां आप यह रेखा खींचते हैं कि मॉडल का प्रशिक्षण पहले से ही क्या कम करता है और आपकी एप्लिकेशन परत को अभी भी क्या लागू करना चाहिए। यह मानना कि प्रशिक्षित संरेखण एक डोमेन नीति को कवर करता है, नियम को हर परत में अप्रवर्तित छोड़ देता है। मॉड्यूल यहां शुरू होता है क्योंकि यह हर नीचे की ओर निर्णय को प्रभावित करता है।
गार्डरेल प्लेसमेंट वह जगह है जहां आप इनपुट स्क्रीनिंग, आउटपुट स्क्रीनिंग, और टूल-कॉल प्राधिकरण को अनुरोध पथ पर स्थित करते हैं, चुनते हैं कि क्या प्रत्येक जांच मॉडल-आधारित या नियतात्मक है, और यह तय करते हैं कि नियंत्रण विफल होने पर क्या करता है। पथ के अंत में एक एकल फ़िल्टर अन्य दो बिंदुओं को कवर नहीं करता है, और एक नियंत्रण जो खुले में विफल हो जाता है, कोई नियंत्रण नहीं होने से बदतर है, क्योंकि यह सुरक्षा का दिखावा प्रदान करता है बिना किसी कार्य के।
निष्पक्षता और पारदर्शिता वह जगह है जहां आप पहचानते हैं कि असमान परिणाम सिस्टम में कहां प्रवेश कर सकते हैं, और वे लॉगिंग बनाते हैं जो आपको बाद में किसी भी निर्णय की व्याख्या करने देता है। चार इंजेक्शन बिंदु आपके हैं।
मानव-समीक्षा रूटिंग वह जगह है जहां आप यह तय करते हैं कि कौन से निर्णय एक व्यक्ति को तौलना चाहिए और उस समीक्षक को उनका काम करने के लिए क्या चाहिए। केवल मात्रा से रूटिंग करने से कतार भर जाती है और अक्सर समीक्षाओं को अनुमोदन में ढहने के लिए मजबूर करता है। जो निर्णय ध्यान देने योग्य हैं वे उच्च दांव और कम आत्मविश्वास वाले हैं, और उन दांवों को पहले से पहचाना जाना चाहिए।
अनुपालन नियंत्रण रजिस्टर वह जगह है जहां प्रत्येक दायित्व एक पहचाने गए नियंत्रण, एक जवाबदेह मालिक, और एक साक्ष्य कलाकृति बन जाता है जो एक समीक्षक निरीक्षण कर सकता है। एक अनुपालन प्रवेश बिंदु चुनना एक पूर्वापेक्षा है। एक नियंत्रण जिसका कोई मालिक नहीं है और कोई जीवंत कलाकृति नहीं है, बिना किसी को ध्यान दिए गैर-परिचालन हो सकता है, और फिर एक ऑडिट के दौरान एक अंतर के रूप में दिखाई दे सकता है।
ये विषय एक दूसरे पर निर्मित होते हैं। पहले खंड में आप जो सीमा खींचते हैं, वह दूसरे में नियंत्रणों द्वारा लागू की जाती है, निष्पक्षता के लिए जो लॉगिंग आप बनाते हैं, वह चौथे खंड में समीक्षक द्वारा उपयोग की जाती है, और पांचवें खंड में नियंत्रण रजिस्टर ऊपर की हर उपकरणीकृत परत से खींचता है। अंत में संचयी कार्य आपको सभी पाँचों को एक एकल संक्षिप्त से एक रक्षणीय तैनाती में इकट्ठा करने के लिए कहता है, जो बिल्कुल वही है जो यह मॉड्यूल आपको एक सुरक्षा समीक्षक या अनुपालन ऑडिटर के सामने करने के लिए सुसज्जित करता है।
शिक्षा सामग्री के लिए अस्वीकरण / सूचना
हमने यह आर्किटेक्ट कोर्स मॉड्यूल 3: जिम्मेदार AI, सुरक्षा, और आर्किटेक्ट्स के लिए जोखिम बनाया है ताकि आप Claude के साथ वास्तविक काम करने में मदद पा सकें। इसे शैक्षणिक सामग्री के रूप में मानें। यह कानूनी, वित्तीय, या अन्य व्यावसायिक सलाह का गठन नहीं करता है, इसलिए अपनी स्थिति के अनुसार जो सीखते हैं उसे अनुकूलित करें। हमारे उत्पाद और सेवाएं तेजी से विकसित होती हैं, इसलिए कुछ सामग्री में त्रुटियां हो सकती हैं या पुरानी हो सकती हैं; Anthropic की वेबसाइट या दस्तावेज़ों पर सत्यापित करना याद रखें। पाठ्यक्रम में उपयोग किए गए उदाहरण और परिदृश्य सचित्र हैं और अक्सर काल्पनिक हैं। यदि पाठ्यक्रम सामग्री किसी कंपनी या उत्पाद का उल्लेख करती है, तो इसका मतलब यह नहीं है कि Anthropic उन्हें समर्थन करता है, वे Anthropic को समर्थन करते हैं, या कि हम संबद्ध हैं। यह भी ध्यान दें कि Anthropic उत्पादों और सेवाओं का आपका उपयोग हमारी शर्तों, नीतियों और दस्तावेज़ों द्वारा कवर किया गया है; यदि इस पाठ्यक्रम में कुछ उनके साथ संघर्ष करता है, तो वे नियंत्रण करते हैं।
स्क्रीन 2: मॉडल का प्रशिक्षण क्या लागू करता है बनाम आप क्या मालिक हैं
शिक्षणसंरेखण11 मिनट मॉडल का प्रशिक्षण क्या लागू करता है बनाम आप क्या मालिक हैं पहले का काम आर्किटेक्चर, मॉडल, और एकीकरण स्थापित करता है। यहां हम उत्तर देते हैं: इससे पहले कि आप नियंत्रण जोड़ना शुरू करें, मॉडल द्वारा कितना सुरक्षित व्यवहार पहले से ही संभाला जाता है, और कितना अभी भी आपका है? आपको इस सीमा को स्पष्ट रूप से समझने की आवश्यकता है ताकि डुप्लिकेट सुरक्षा बनाने या यह मानने से बचा जा सके कि मॉडल एक नियम को लागू कर रहा है जो उसने कभी नहीं देखा।
Anthropic Claude को एक संविधान के विरुद्ध प्रशिक्षित करता है: एक लिखित दस्तावेज जो मूल्यों और व्यवहार का वर्णन करता है जो मॉडल को प्रदर्शित करना चाहिए, इसलिए मॉडल पहले से ही व्यापक सुरक्षा व्यवहार के साथ तैनात किया जाता है। Anthropic समय के साथ इस दस्तावेज़ को संशोधित करता है, और सबसे हाल ही में प्रकाशित संस्करण जनवरी 2026 से है। दस्तावेज़ का उपयोग प्रशिक्षण के दौरान उदाहरण उत्पन्न करने के लिए किया जाता है जो मॉडल सीखता है और उम्मीदवार प्रतिक्रियाओं को रैंक करने के लिए। यह अस्पष्ट या संवेदनशील अनुरोधों के लिए मॉडल की प्रतिक्रिया को आकार देता है लेकिन जरूरी नहीं कि खराब आउटपुट को पकड़ता है। यह मॉडल के लिए एक प्राथमिकता क्रम निर्धारित करता है जब लक्ष्य संघर्ष करते हैं: व्यापक रूप से सुरक्षित हो, नैतिक हो, दिशानिर्देशों का पालन करो, और ऑपरेटरों और उपयोगकर्ताओं के लिए वास्तव में सहायक हो। वह क्रम महत्वपूर्ण है क्योंकि एक सहायक उत्तर कभी-कभी असुरक्षित होता है। क्रम समग्र है बजाय कठोर के, इसलिए उच्च-प्राथमिकता लक्ष्य आम तौर पर तब प्राथमिकता लेते हैं जब वे संघर्ष करते हैं, हालांकि मॉडल उन्हें एक कठोर अनुक्रम में लागू करने के बजाय एक साथ तौलता है। मॉडल पहले से ही व्यापक, सामान्य-उद्देश्य नुकसान के साथ आता है, इससे पहले कि आप एक भी संकेत लिखें। निर्मित परत व्यापक, सामान्य-उद्देश्य नुकसान को संभालती है, लेकिन आपके विशिष्ट डोमेन को कवर नहीं करती है: आपके उपयोगकर्ताओं और उत्पाद के लिए विशिष्ट कोई भी नीति अभी भी आपकी है।
प्रशिक्षण-समय संरेखण और अनुमान-समय नियंत्रण दो परतें हैं जिनके अलग-अलग उद्देश्य हैं प्रशिक्षण-समय संरेखण तैनाती से पहले मॉडल व्यवहार को आकार देता है। यह Claude को खतरनाक अनुरोधों को अस्वीकार करने और सुरक्षित प्रतिक्रियाओं की ओर डिफ़ॉल्ट करने के लिए निर्देशित करके हानिकारक आउटपुट के व्यापक वर्गों को कम करता है। क्योंकि यह किसी भी तैनाती से पहले सेट किया जाता है, यह डिजाइन द्वारा सामान्य है। यह एक शक्ति और एक कमजोरी दोनों है: यह आपके साथी के डोमेन नीति, डेटा-हैंडलिंग नियमों, या प्राधिकरण मॉडल को नहीं जानता। एक अनुरोध Claude के सामान्य संरेखण को फिट कर सकता है और फिर भी एक तैनाती-विशिष्ट नियम का उल्लंघन कर सकता है, जैसे किसी अन्य ग्राहक की ऑर्डर जानकारी का खुलासा करना या अनुमोदित स्क्रिप्ट के बाहर सलाह देना। याद रखें, Claude एक नियम को लागू नहीं कर सकता जो उसे कभी नहीं दिया गया था। तैनाती-विशिष्ट नियमों को दूसरी परत द्वारा लागू किया जाता है: अनुमान-समय नियंत्रण। इसमें आपकी तैनाती के लिए कॉन्फ़िगर किए गए रनटाइम गार्डरेल शामिल हैं, जैसे सिस्टम निर्देश, इनपुट और आउटपुट जांच, टूल अनुमतियां, और मानव समीक्षा गेट। सिस्टम निर्देश मॉडल के व्यवहार को आकार देते हैं, लेकिन तैनाती-विशिष्ट नीति केवल तब लागू होती है जब उन निर्देशों को स्क्रीनिंग, प्राधिकरण, और समीक्षा जैसे रनटाइम नियंत्रणों के साथ जोड़ा जाता है। प्रशिक्षण-समय संरेखण आधारभूत जोखिम को कम करता है, और अनुमान-समय नियंत्रण आपकी तैनाती के लिए विशिष्ट नियमों को लागू करता है।
एक स्तरीय दृश्य: प्रत्येक परत के पास एक काम और एक अंधा स्थान है सुरक्षा को Claude के बाहर से चार परतों के रूप में मानें। प्रत्येक एक ऐसी चीज को कवर करता है जो नीचे की परत नहीं कर सकती, और प्रत्येक एक तरीके से विफल हो जाता है जो अगला पकड़ना चाहिए। प्रत्येक परत को देखने के लिए चुनें कि यह क्या विश्वसनीय रूप से कवर करता है, यह क्या नहीं करता है, और इसका मालिक कौन है।
प्रशिक्षित व्यवहार सिस्टम-प्रॉम्प्ट निर्देश रनटाइम स्क्रीनिंग प्राधिकरण
यह विश्वसनीय रूप से क्या कवर करता है: हानिकारक या असुरक्षित आउटपुट के व्यापक वर्ग, कॉन्फ़िगरेशन के बिना हर अनुरोध पर लागू। यह क्या कवर नहीं करता है: आपकी डोमेन नीति, आपके डेटा नियम, आपका प्राधिकरण मॉडल। इसका मालिक कौन है: Anthropic।
यह विश्वसनीय रूप से क्या कवर करता है: भूमिका, टोन, और बताए गए बाधाएं जो Claude को एक अनुरोध के अंदर निर्देशित करती हैं। यह क्या कवर नहीं करता है: कुछ भी जो एक प्रतिकूल या असामान्य इनपुट Claude को बाहर निकाल सकता है, क्योंकि निर्देश प्रवर्तन नहीं हैं। इसका मालिक कौन है: आर्किटेक्ट।
यह विश्वसनीय रूप से क्या कवर करता है: इनपुट और आउटपुट स्क्रीनिंग जो अनुमति न दी गई सामग्री का पता लगाता है। यह क्या कवर नहीं करता है: साइड इफेक्ट्स वाली कार्रवाइयां, जो स्क्रीनिंग अधिकृत नहीं करती हैं, और उपन्यास हमले जो एक वर्गीकरण को याद करता है। इसका मालिक कौन है: आर्किटेक्ट।
यह विश्वसनीय रूप से क्या कवर करता है: क्या एक विशिष्ट कार्रवाई साइड इफेक्ट्स के साथ इस कॉलर के लिए इस संदर्भ में अनुमत है। यह क्या कवर नहीं करता है: सामग्री गुणवत्ता और निष्पक्षता। इसका मालिक कौन है: आर्किटेक्ट।
लागत · जटिलता · जोखिम लागत: प्रत्येक जोड़ी गई परत विलंबता और इंजीनियरिंग की लागत करती है। इनपुट पर एक प्री-स्क्रीन और आउटपुट पर एक जांच हर अनुरोध में दो अतिरिक्त कॉल या नियम जोड़ते हैं। जटिलता: चार परतें मतलब चार जगहें डिजाइन, संस्करण, और परीक्षण करने के लिए। सिस्टम प्रॉम्प्ट और स्क्रीनिंग लॉजिक स्वतंत्र रूप से बहाव करते हैं यदि शासित नहीं। जोखिम: सबसे खतरनाक विफलता एक मौन है: यह मानना कि Claude एक डोमेन नियम को लागू करता है जो उसे कभी नहीं दिया गया था। चूंकि नियम किसी भी परत में मौजूद नहीं है, कुछ भी एक उल्लंघन को रोकता नहीं है।
स्क्रीन 3: जब प्रशिक्षित अस्वीकार एक डोमेन नीति के लिए गलत हैं
सावधान रहेंसंरेखण3 मिनट जब प्रशिक्षित अस्वीकार एक डोमेन नीति के लिए गलत हैं
सेटअप हुक आप एक मजबूत सिस्टम आर्किटेक्ट हैं। Claude पहले से ही परीक्षण में व्यापक रूप से हानिकारक अनुरोधों को अस्वीकार करता है, इसलिए आप मानते हैं कि इसका प्रशिक्षण आपके साथी की डेटा हैंडलिंग नीति को भी कवर करता है। आप एक अलग प्रवर्तन परत बनाए बिना आगे बढ़ते हैं।
एक पोस्टमॉर्टम: एक नीति जो किसी भी परत में कभी एन्कोड नहीं की गई थी एक टीम ने एक साथी के लिए एक आंतरिक सहायक तैनात किया जिसकी डेटा-हैंडलिंग नीति उपयोगकर्ताओं को अन्य व्यावसायिक इकाइयों से संबंधित रिकॉर्ड तक पहुंचने से प्रतिबंधित करती थी। समीक्षा में, Claude ने हर हानिकारक संकेत को अस्वीकार कर दिया था जो टीम ने इसे फेंका था, इसलिए उन्होंने माना कि क्रॉस-यूनिट प्रकटीकरण एक ही सुरक्षा व्यवहार द्वारा कवर किया गया था और कभी भी इसके लिए एक प्राधिकरण जांच नहीं बनाई। उत्पादन में, एक सामान्य दिखने वाला, इन-डोमेन अनुरोध एक निषिद्ध रिकॉर्ड के लिए पूछा। अनुरोध में कुछ भी सामान्य शर्तों में हानिकारक नहीं दिखता था, इसलिए Claude ने इसका उत्तर दिया। नियम जो टीम को विश्वास था कि वह लागू था वास्तव में मौजूद नहीं था। यह कभी Claude के प्रशिक्षण का हिस्सा नहीं था, और टीम ने इसे एक वर्गीकरण, सिस्टम प्रॉम्प्ट, या एप्लिकेशन नियंत्रण में कभी एन्कोड नहीं किया, क्योंकि उन्होंने माना कि मॉडल पहले से ही इसे कवर करता है।
यह क्यों टूट गया एक डोमेन नीति को प्रशिक्षित संरेखण के साथ भ्रमित किया गया था। प्रशिक्षित अस्वीकार व्यापक नुकसान को कवर करते हैं, तैनाती-विशिष्ट नियमों को नहीं। कोई भी नियम जो आपके साथी के लिए विशिष्ट है, आपके द्वारा बनाई गई एक परत में लागू किया जाना चाहिए। याद रखें, Claude एक नियम को लागू नहीं कर सकता जो उसे कभी नहीं दिया गया था।
स्क्रीन 4: जिम्मेदारी को सॉर्ट करें
चेकपॉइंटसंरेखण3 मिनट जिम्मेदारी को सॉर्ट करें अभी कोशिश करें। आप एक साथी के Claude सहायक के लिए सुरक्षा डिजाइन की समीक्षा कर रहे हैं। प्रत्येक दायित्व को उस बाल्टी में खींचें जो इसे लागू करना चाहिए: या तो Claude का प्रशिक्षित व्यवहार, या एप्लिकेशन परत। प्रतिक्रिया बताती है कि प्रत्येक एक क्यों गिरता है।
एक खतरनाक हथियार संश्लेषण करने में मदद करने से इनकार करना कभी भी किसी अन्य किरायेदार के डेटा को वापस न करना स्पष्ट रूप से घृणास्पद सामग्री का उत्पादन करने से इनकार करना साथी की अनुमोदित स्क्रिप्ट के बाहर सलाह को अवरुद्ध करना रिफंड जारी करने से पहले साइन ऑफ की आवश्यकता है
Claude का प्रशिक्षित व्यवहार
एप्लिकेशन परत (आप इसके मालिक हैं)
उत्तर जांचें अभी के लिए छोड़ें
स्क्रीन 5: LLM सिस्टम के जोखिम, सीमाएं, और विफलता मोड
शिक्षणगार्डरेल9 मिनट LLM सिस्टम के जोखिम, सीमाएं, और विफलता मोड आपने नियंत्रण रखे हैं; अब पहचानें कि वे क्या बचाव करते हैं। एक आर्किटेक्ट से एक सुरक्षा डिलीवरेबल के रूप में एक प्रस्तावित सिस्टम के लिए एक जोखिम मूल्यांकन संचालित और दस्तावेज़ करने की अपेक्षा की जाती है। यह स्क्रीन LLM सिस्टम में पुनरावृत्ति होने वाली जोखिम श्रेणियों को कवर करती है और उन्हें एक लिखित मूल्यांकन में बदल देती है जो आप चला सकते हैं।
LLM सिस्टम में पुनरावृत्ति होने वाली जोखिम श्रेणियां अधिकांश LLM-सिस्टम जोखिम एक छोटे से श्रेणियों में गिरता है। इन श्रेणियों की पहचान करें और अपने डिजाइन को प्रत्येक के विरुद्ध जांचें:
प्रत्यक्ष संकेत इंजेक्शन: एक उपयोगकर्ता इनपुट तैयार करता है जो सिस्टम के निर्देशों को ओवरराइड करता है और इसके व्यवहार को पुनर्निर्देशित करता है। अप्रत्यक्ष संकेत इंजेक्शन: दुर्भावनापूर्ण निर्देश पुनः प्राप्त सामग्री या टूल आउटपुट के माध्यम से आते हैं जो मॉडल विश्वस्त के रूप में मानता है और वेक्टर इनपुट स्क्रीनिंग पकड़ नहीं करता है। टोकन-बजट समाप्ति: ओवरसाइज़्ड या प्रतिकूल रूप से पैडेड इनपुट संदर्भ या आउटपुट बजट का उपभोग करते हैं, काम को छोटा करते हैं या लागत को बढ़ाते हैं। टूल और कार्रवाई दुरुपयोग: मॉडल को नीति के बाहर एक साइड-इफेक्टिंग टूल को कॉल करने के लिए प्रेरित किया जाता है, विफलता जो कार्रवाई-प्राधिकरण नियंत्रण मौजूद है। डेटा एक्सपोजर: संवेदनशील फ़ील्ड संदर्भ विंडो या लॉग में प्रवेश करते हैं जहां वे नहीं होने चाहिए, मॉडल व्यवहार से स्वतंत्र एक रिसाव बनाते हैं।
सिस्टम कमजोरी मूल्यांकन: कहां देखना है अनुरोध और डेटा पथ को एक साथ चलाएं। प्रत्येक प्रवेश बिंदु पर, उपयोगकर्ता इनपुट, पुनः प्राप्त सामग्री, टूल आउटपुट, मॉडल का अपना आउटपुट, और लॉग, पूछते हैं कि एक प्रतिद्वंद्वी क्या कर सकता है और कौन सा नियंत्रण रास्ते में खड़ा है। कहीं भी बिना नियंत्रण के देखें जहां एक प्रशंसनीय हमला हो सकता है।
जोखिम मूल्यांकन को एक डिलीवरेबल के रूप में दस्तावेज़ करना जोखिम मूल्यांकन एक लिखित कलाकृति होना चाहिए। प्रत्येक पहचाने गए जोखिम के लिए, श्रेणी, प्रभावित घटक, एक संभावना-और-प्रभाव निर्णय, और मालिक और साक्ष्य कलाकृति के साथ शमन नियंत्रण रिकॉर्ड करें। वह दस्तावेज़ वह है जो सुरक्षा समीक्षक पर हस्ताक्षर करेगा, और यह वह है जो इस मॉड्यूल के अंत में संचयी व्यायाम आपको उत्पादन करने में सक्षम होने की अपेक्षा करता है।
स्क्रीन 6: एक प्रस्तावित आर्किटेक्चर में जोखिमों का मूल्यांकन करें
चेकपॉइंटगार्डरेल4 मिनट एक प्रस्तावित आर्किटेक्चर में जोखिमों का मूल्यांकन करें अभी कोशिश करें। आप एक प्रस्तावित आर्किटेक्चर की समीक्षा कर रहे हैं: एक ग्राहक-समर्थन एजेंट जो एक साथी ज्ञान आधार से उत्तर पुनः प्राप्त करता है और एक जुड़े हुए टूल के माध्यम से रिफंड जारी करता है, सभी गतिविधि एक अनुरोध लॉग में लिखी जाती है। इस डिजाइन में मौजूद कम से कम तीन जोखिम श्रेणियों की पहचान करें, और प्रत्येक के लिए एक कार्यशील शमन का नाम दें। जोखिम और एक शमन दोनों जो इसे संबोधित करते हैं आवश्यक हैं।
इस डिजाइन में मौजूद जोखिम श्रेणियों की पहचान करें और प्रत्येक को एक शमन के साथ जोड़ें।
मॉडल उत्तर प्रकट करें अभी के लिए छोड़ें
मॉडल उत्तर
- ज्ञान आधार के माध्यम से अप्रत्यक्ष संकेत इंजेक्शन। पुनः प्राप्त सामग्री निर्देश ले सकती है; शमन उपयोगकर्ता इनपुट को नहीं, बल्कि टूल/सामग्री इनपुट को स्क्रीन करना है।
- रिफंड टूल पर टूल और कार्रवाई दुरुपयोग। शमन एक कार्रवाई-प्राधिकरण जांच है जो रिफंड टूल को निष्पादित करने से पहले चलती है, मॉडल के आउटपुट से स्वतंत्र।
- बड़े ज्ञान-आधार दस्तावेज़ों पर टोकन-बजट समाप्ति। शमन चंकिंग और इनपुट सीमाएं साथ ही बजट निगरानी है ताकि एक बड़ा दस्तावेज़ चुप्पी से काम को छोटा न कर सके।
- अनुरोध लॉग में डेटा एक्सपोजर। शमन सर्वर-साइड रिडैक्शन संवेदनशील फ़ील्ड का है कुछ भी लॉग किए जाने से पहले।
स्क्रीन 7: स्क्रीनिंग और प्राधिकरण को रखना ताकि सिस्टम सुरक्षित रूप से गिरावट आए
शिक्षणगार्डरेल14 मिनट स्क्रीनिंग और प्राधिकरण को रखना ताकि सिस्टम सुरक्षित रूप से गिरावट आए एक नियंत्रण जो अनुरोधों को स्क्रीन करता है, किसी भी निर्भरता के समान तरीके से विफल हो सकता है। यह समय समाप्त हो सकता है, एक त्रुटि वापस कर सकता है, या लोड के तहत अप्राप्य हो सकता है। अंतर यह है कि एक विफल गार्डरेल अभी भी स्वस्थ दिख सकता है: जब एक स्क्रीनिंग सेवा त्रुटि करती है लेकिन फिर भी ट्रैफिक को पास करती है, अनुरोध प्रवाहित होते रहते हैं जबकि नियंत्रण इसे रखने के लिए रखा गया था। तो, जब एक गार्डरेल त्रुटि करता है, सिस्टम दो चीजों में से एक करना चाहिए: इसे जाने दें या इसे अवरुद्ध करें। यदि आपने स्पष्ट रूप से वह विकल्प नहीं बनाया है, तो आसपास का कोड आपके लिए तय करता है। डिफ़ॉल्ट लगभग हमेशा इसे जाने देना है, जिसका मतलब है कि असुरक्षित पथ पर वापस गिरना। यही कारण है कि आपके मॉडल कॉल के चारों ओर पुनः प्रयास और सर्किट ब्रेकर लागू करने वाली तर्क यहां लागू होती है: तय करें कि नियंत्रण विफल होने पर कैसे व्यवहार करता है, बजाय इसके कि ट्रैफिक प्रवाहित रखने के लिए क्या व्यवहार होता है।
एक अनुरोध पथ में गार्डरेल कहां बैठते हैं एक संरक्षित अनुरोध पथ के कुछ निर्णय बिंदु हैं, प्रत्येक एक अलग प्रश्न का उत्तर देता है।
इनपुट स्क्रीनिंग मॉडल कॉल से पहले चलती है और तय करती है कि क्या अनुरोध मॉडल तक पहुंचना चाहिए। आउटपुट स्क्रीनिंग प्रतिक्रिया उपयोगकर्ता तक पहुंचने से पहले चलती है और तय करती है कि क्या मॉडल ने जो उत्पादन किया है वह वापस करने के लिए सुरक्षित है। टूल-कॉल प्राधिकरण किसी भी कार्रवाई से पहले चलता है साइड इफेक्ट्स के साथ, जैसे एक ईमेल भेजना, डेटाबेस में लिखना, या एक रिफंड जारी करना, और यह निर्धारित करता है कि क्या यह कॉलर इस संदर्भ में यह कार्रवाई कर सकता है।
क्योंकि वे विभिन्न बिंदुओं पर बैठते हैं और विभिन्न चीजों की जांच करते हैं, एक जगह पर एक नियंत्रण दूसरों के लिए कुछ नहीं करता है, जो यह है कि एक एकल फ़िल्टर पूरे पथ को कवर नहीं कर सकता है।
प्रत्येक जांच फिट बैठता है: निर्णय बिंदु द्वारा मॉडल-आधारित बनाम नियतात्मक निर्णय बिंदुएक मॉडल-आधारित जांच की आवश्यकता है जबएक नियतात्मक जांच बेहतर है जब
इनपुट स्क्रीनिंग (मॉडल कॉल से पहले)आशय अस्पष्ट है और आप जेलब्रेक या संकेत-इंजेक्शन पैटर्न को पकड़ रहे हैं जो नियमों के साथ संपूर्ण रूप से कब्जा नहीं किए जा सकते। एक हल्का मॉडल इनपुट को वर्गीकृत करता है।नियम स्पष्ट और परिभाषित है: एक ब्लॉकलिस्ट, एक regex, एक लंबाई या प्रारूप जांच। यह तेजी है, अनुमानित है, और इसके निर्णय से बाहर बात नहीं की जा सकती। आउटपुट स्क्रीनिंग (प्रतिक्रिया उपयोगकर्ता तक पहुंचने से पहले)आप विषाक्तता या नीति अनुपालन जैसी गुणवत्ता का मूल्यांकन कर रहे हैं जिसे भाषा समझ की आवश्यकता है। एक न्यायाधीश मॉडल आउटपुट को स्कोर करता है।आप एक ज्ञात स्ट्रिंग, एक निषिद्ध फ़ील्ड, या एक स्कीमा उल्लंघन की जांच कर रहे हैं जो एक सत्यापक निश्चितता के साथ पकड़ता है। टूल-कॉल प्राधिकरण (किसी भी साइड-इफेक्टिंग कार्रवाई से पहले)शायद ही कभी। प्राधिकरण नियतात्मक होना चाहिए, इसलिए यह ऑडिट योग्य है।लगभग हमेशा: अनुमत कार्यों की एक अनुमति सूची, पहचान जांच, और दायरा सत्यापन। प्राधिकरण एक निर्णय होना चाहिए जो आप साबित कर सकते हैं और दोहरा सकते हैं, इसलिए यह नियतात्मक होना चाहिए।
मॉडल-आधारित और नियतात्मक जांच अलग-अलग विफल क्यों होती हैं, और आप उन्हें क्यों श्रृंखलाबद्ध करते हैं एक मॉडल-आधारित वर्गीकरण को बचा जा सकता है: एक उपयोगकर्ता एक इनपुट को इस तरह से वाक्य दे सकता है जो सबसे मजबूत न्यायाधीश मॉडल को भी बायपास करता है। एक नियतात्मक नियम नाजुक है: यह बिल्कुल वही ब्लॉक करता है जो इसे प्रोग्राम किया गया है और कुछ नहीं। यह कुछ भी याद करता है जो इसे प्रत्याशा नहीं करता है और कुछ भी ओवर-ब्लॉक करता है जो एक प्रतिबंधित पैटर्न जैसा दिखता है। कोई नियंत्रण नहीं है जो सब कुछ पकड़ता है, इसलिए ये नियंत्रण श्रृंखला में तैनात किए जाते हैं। पहचानना कि प्रत्येक क्या याद करता है, यह सुनिश्चित करता है कि प्रत्येक अंतर एक अलग नियंत्रण द्वारा जानबूझकर कवर किया जाता है बजाय खुला छोड़ा जाता है।
एक दूसरा इंजेक्शन वेक्टर: निर्देश पुनः प्राप्त सामग्री और टूल आउटपुट के माध्यम से आते हैं उपयोगकर्ता-इनपुट स्क्रीनिंग निर्देशों को पकड़ता है जो उपयोगकर्ता सीधे भेजता है। यह निर्देशों को पकड़ता नहीं है जो सामग्री में एम्बेड किए गए हैं जो सिस्टम पुनः प्राप्त करता है या टूल से प्राप्त करता है। एक RAG सिस्टम में, एक पुनः प्राप्त दस्तावेज़ में एक दुर्भावनापूर्ण निर्देश मॉडल तक पहुंचता है इनपुट स्क्रीनिंग पहले से ही अनुरोध को पास कर चुकी है। एक एजेंटिक सिस्टम में, एक टूल प्रतिक्रिया निर्देश ले सकती है जो मॉडल आधिकारिक के रूप में मानता है। यह एंटरप्राइज तैनाती में प्रमुख इंजेक्शन वेक्टर है जिसमें पुनर्प्राप्ति या टूल उपयोग है, और इसके लिए एक अलग नियंत्रण की आवश्यकता है: पुनः प्राप्त सामग्री और टूल आउटपुट को स्क्रीन करें इससे पहले कि वे मॉडल के संदर्भ में जोड़े जाएं, उपयोगकर्ता इनपुट पर लागू करने वाले एक ही मॉडल-आधारित वर्गीकरण का उपयोग करके। अंधा स्थान अलग है क्योंकि स्रोत अलग है; इसे अपने नियंत्रण डिजाइन में स्पष्ट रूप से पहचानें ताकि कवरेज सुनिश्चित हो।
API पर, प्रतिक्रियाएं एक अस्वीकार वापस करती हैं जब स्ट्रीमिंग वर्गीकरण हस्तक्षेप करते हैं। Messages API इसे stop_reason: "refusal" के रूप में रिपोर्ट करता है जो एक stop_details ऑब्जेक्ट के साथ होता है (Claude Opus 4. 7 के बाद से उपलब्ध)। वह ऑब्जेक्ट एक नीति श्रेणी के साथ एक पठनीय व्याख्या ले जाता है; दोनों फ़ील्ड null होते हैं जब अस्वीकार एक नामित श्रेणी के लिए मैप नहीं करता है। श्रेणी सेट platform. claude. com पर stop-reasons दस्तावेज़ में गणना की जाती है। इस लेखन के अनुसार इसमें cyber, bio, frontier_llm, और reasoning_extraction शामिल हैं। प्रकाशन समय पर इसे हार्डकोड करने के बजाय सूची को फिर से जांचें। आपकी एप्लिकेशन को श्रेणी को पढ़ना चाहिए और विभिन्न अस्वीकार वर्गों को अलग तरीके से रूट करना चाहिए, बजाय हर अस्वीकार को एक एकल, अविभाजित घटना के रूप में मानने के। उन मॉडल पर जो stop_details वापस नहीं करते हैं, आपके हैंडलर को एक अनुपस्थित ऑब्जेक्ट को सहन करना चाहिए और सामान्य हैंडलिंग में वापस गिरना चाहिए। प्रकाशन समय पर platform. claude. com के विरुद्ध वर्तमान मॉडल समर्थन सत्यापित करें। एक नियम के रूप में, एक बार अस्वीकार प्राप्त होने के बाद, बातचीत संदर्भ को रीसेट करें: अस्वीकार को ट्रिगर करने वाले मोड़ को हटाएं या फिर से वाक्य दें, या इतिहास को साफ करें। एक ही अस्वीकृत संदर्भ पर अगला अनुरोध भेजने से आगे अस्वीकार मिलते हैं।
खुले बनाम बंद विफल: आपकी गार्डरेल परत विफलता के तहत कैसे व्यवहार करती है जब ऑपरेटर-निर्मित वर्गीकरण लोड के तहत त्रुटि करता है, या आपकी ऑपरेटर-निर्मित स्क्रीनिंग सेवा अप्राप्य है, एप्लिकेशन दो चीजों में से एक करता है। यह खुले में विफल हो सकता है और ट्रैफिक को अनस्क्रीन किए गए माध्यम से पास कर सकता है, या यह बंद में विफल हो सकता है और नियंत्रण स्वस्थ होने तक किसी भी अतिरिक्त कार्रवाई को अवरुद्ध कर सकता है। विकल्प आपके पास है आर्किटेक्ट के रूप में; ये आपकी टीम द्वारा निर्मित, होस्ट किए गए और कॉन्फ़िगर किए गए घटक हैं। वे Anthropic के निर्मित-में मॉडल सुरक्षा नियंत्रणों से अलग हैं, जो ऑपरेटर-कॉन्फ़िगरेबल नहीं हैं और खुले में विफल नहीं होते हैं। एक ऑपरेटर-निर्मित गार्डरेल जो चुप्पी से ट्रैफिक को पास करता है जब यह त्रुटि करता है, एक से बदतर है जो ट्रैफिक को अवरुद्ध करता है, क्योंकि यह आपको नियंत्रण होने का आश्वासन देता है जबकि कोई सुरक्षा प्रदान नहीं करता है। यह उत्पादन कार्य से सर्किट ब्रेकर के समान तर्क है: जब आपके स्टैक में एक निर्भरता विफल हो रही है, स्थिति के आधार पर जानबूझकर गिरावट करें।
पूर्ण संरक्षित अनुरोध पथ, एक सिस्टम के रूप में एक अनुरोध क्रम में पथ के माध्यम से चलता है: यह आता है, इनपुट स्क्रीनिंग तय करती है कि क्या यह मॉडल तक पहुंचता है, मॉडल एक प्रतिक्रिया उत्पादन करता है, आउटपुट स्क्रीनिंग तय करती है कि क्या वह प्रतिक्रिया वापस की जाती है, और मॉडल द्वारा उत्सर्जित कोई भी टूल कॉल इससे पहले प्राधिकरण के माध्यम से जाता है यह चलता है। प्रत्येक गेट पास, ब्लॉक, या विफल हो सकता है, और प्रत्येक विफलता उस दिशा में हल करती है जो आपने चुनी है। हर अवरुद्ध या विफल गेट लॉग किया जाता है, इसलिए एक घटना को रिकॉर्ड से पुनर्निर्मित किया जा सकता है।
पूर्ण संरक्षित अनुरोध पथ उपयोगकर्ता अनुरोध → इनपुट स्क्रीनिंग (अस्पष्ट आशय के लिए मॉडल-आधारित, परिभाषित नियमों के लिए नियतात्मक, बंद विफल के लिए सेट) → मॉडल कॉल → आउटपुट स्क्रीनिंग (न्यायाधीश मॉडल या सत्यापक, बंद विफल के लिए सेट) → किसी भी साइड-इफेक्टिंग कार्रवाई से पहले टूल-कॉल प्राधिकरण (नियतात्मक अनुमति सूची साथ ही पहचान और दायरा) → उपयोगकर्ता को प्रतिक्रिया, हर अवरुद्ध या विफल गेट बाद में पुनर्निर्माण के लिए लॉग किए गए
कौशल आपूर्ति-श्रृंखला सुरक्षा आप निम्नलिखित आपत्ति क्षेत्र में सुन सकते हैं: "कौशल एक काली पेटी हैं। मैं एक तक सब कुछ नहीं देख सकता जब तक यह चलता है, तो मैं इसे कैसे विश्वास करूं? " आर्किटेक्ट का काम एक नियंत्रण बनाना है जो इसके लिए क्षतिपूर्ति करता है। एक अनुस्मारक के रूप में, कौशल पुनः प्रयोग योग्य, वितरणीय कोड हैं जो एक निर्देश सेट के साथ जोड़े गए हैं, एक साथ बंडल किए गए हैं और आपके वातावरण में गिराए गए हैं। वह वितरण मॉडल यह है जो इसे एक आपूर्ति-श्रृंखला जोखिम बनाता है। एक अविश्वसनीय कौशल एक कोड-निष्पादन शोषण ले सकता है: तर्क जो आदेश चलाता है, नेटवर्क तक पहुंचता है, या फ़ाइलों को छूता है जिस क्षण इसे आमंत्रित किया जाता है। यह जोखिम भरा है क्योंकि कौशल में छिपे हुए दुर्भावनापूर्ण निर्देश शामिल हो सकते हैं जो आपकी इनपुट फ़िल्टर और संकेत स्क्रीनिंग नहीं देख सकते; ये बातचीत को देखते हैं, लेकिन खतरा कौशल में अपस्ट्रीम बंडल में बेक किया गया था। आउटपुट निगरानी एक डाउनस्ट्रीम प्रभाव को बाद में पकड़ सकती है, लेकिन तब तक कोड पहले से ही चल चुका होगा। तो, बचाव को श्रृंखला में पहले जाना चाहिए। इससे पहले कि आप एक कौशल को विश्वास कर सकें और कॉल कर सकें, आपको इसे ऑडिट करना चाहिए: बंडल को खोलें और इसे दो चीजों के लिए पढ़ें। पहला, विसंगत कॉल के लिए देखें: नेटवर्क अनुरोध, शेल निष्पादन, फ़ाइल-सिस्टम पहुंच, क्रेडेंशियल पढ़ता है। दूसरा, दायरे से बाहर संचालन: व्यवहार जो इसे करने का दावा करता है उससे मेल नहीं खाता। एक स्वरूपण कौशल जो घर फोन करता है दायरे से बाहर है; एक सारांशकार जो डिस्क में लिखता है दायरे से बाहर है। एक कौशल का बताया गया उद्देश्य आपका ऑडिट आधारभूत होना चाहिए, और कुछ भी जो इसे परे जाता है एक खोज है जो आपको जांचना चाहिए। आपका ऑडिट आपको बताता है कि आपके बंडल में क्या है; एक ऑडिट समीक्षा को साफ पास करने वाला कौशल अभी भी रनटाइम पर कोड को लाने के लिए पहुंच सकता है जो कभी पैकेज में नहीं था जो आपने पढ़ा। यही कारण है कि गेट को एक नेट की आवश्यकता है। कौशल को कम से कम विशेषाधिकार के साथ चलाएं और एक सैंडबॉक्स में सीमित फ़ाइल पहुंच, सीमित नेटवर्क, कोई स्थायी क्रेडेंशियल नहीं जो उन्हें चाहिए। ऑडिट तय करता है कि क्या अंदर जाता है; रनटाइम कनफाइनमेंट इसे रखता है यदि ऑडिट कुछ याद करता है। आपको दोनों का उपयोग करना चाहिए, क्योंकि कोई भी एकल नियंत्रण दूसरे के बिना पूरी तरह से काम नहीं करेगा। आपको यह भी विचार करना चाहिए कि कौशल कहां से आने की अनुमति है; केवल एक जांचे गए आंतरिक रजिस्ट्री, सत्यापित प्रकाशकों, हस्ताक्षरित रिलीज़ से कौशल पर विश्वास करें। एक विश्वसनीय-स्रोत नीति आपको ऑडिट करने के लिए सतह को सिकुड़ता है और अविश्वसनीय बंडल को समीक्षा से पहले रोकता है। एक नियम की एक नियमितता हमेशा लागू होती है: यह न मानें कि प्लेटफॉर्म कौशल को आपके लिए स्क्रीन करता है। सत्यापित करें कि स्वचालित जांच वास्तव में क्या मौजूद है; दस्तावेज़ पढ़ें, किसी भी स्कैनिंग के दायरे की पुष्टि करें, पता लगाएं कि यह क्या करता है और नहीं करता है। हर ऑडिट को एक स्पष्ट रूप से दर्ज किए गए फैसले में समाप्त होना चाहिए: अनुमोदन, अस्वीकार, या सुधार। अनुमोदन का मतलब है यह साफ है और उपयोग के लिए मंजूरी दी गई है। अस्वीकार का मतलब है यह वातावरण में प्रवेश नहीं करता है। सुधार का मतलब है आपको एक ठीक करने योग्य समस्या मिली; इस मामले में, अपराधी कॉल को हटाएं, संचालन को सैंडबॉक्स करें, एक सुरक्षित संस्करण को पिन करें, और फिर इसे फिर से ऑडिट करें। भले ही आप कभी भी सब कुछ नहीं देख सकते हैं कि एक कौशल क्या कर सकता है, ऑडिट फैसला और एक विश्वसनीय-स्रोत नीति वह क्षतिपूर्ति नियंत्रण हैं जो आपको जिम्मेदारी से कार्य करने देते हैं।
लागत · जटिलता · जोखिम लागत: प्रत्येक स्क्रीनिंग बिंदु हर अनुरोध में एक कॉल या नियम मूल्यांकन जोड़ता है। आउटपुट पर एक न्यायाधीश मॉडल मोटे तौर पर उस मोड़ के लिए मॉडल लागत को दोगुना करता है। जटिलता: तीन नियंत्रण बिंदु, प्रत्येक एक जांच प्रकार, एक विफलता दिशा, और एक लॉग लाइन के साथ, एक एकल फ़िल्टर की तुलना में बनाने और परीक्षण करने के लिए काफी अधिक है। जोखिम: खुले में विफल होना महंगी गलती है: सिस्टम को कम लोड करना चुप्पी से सुरक्षा को गिराता है जबकि अभी भी संरक्षित दिखता है, इसलिए अंतर केवल एक घटना में सतह करता है। यह जोखिम Anthropic के API-स्तर नियंत्रणों पर लागू नहीं होता है, जो आपके कॉन्फ़िगरेशन के बाहर हैं। यह विशेष रूप से उन घटकों पर लागू होता है जो आपकी टीम बनाती है और संचालित करती है।
स्क्रीन 8: जब एक एकल आउटपुट फ़िल्टर एक समाप्त डिजाइन की तरह दिखता है
सावधान रहेंगार्डरेल4 मिनट जब एक एकल आउटपुट फ़िल्टर एक समाप्त डिजाइन की तरह दिखता है
सेटअप हुक आउटपुट फ़िल्टरिंग एक स्पष्ट नियंत्रण है जो आप इंगित कर सकते हैं; यह आर्किटेक्चर आरेख पर एक साफ बॉक्स के रूप में दिखाई देता है, यह एक जगह पर आग लगाता है जहां एक समीक्षक इसे काम करते हुए देख सकता है, और यह पथ के अंत में बैठता है जहां जोखिम सबसे ठोस महसूस होता है, सही पहले उपयोगकर्ता एक प्रतिक्रिया देखता है। तो, यदि आप आउटपुट पर एक वर्गीकरण जोड़ते हैं, तो आरेख पूर्ण दिखता है, और समीक्षा पास करता है। समस्या यह है कि सबसे महत्वपूर्ण चीज जो सिस्टम करता है वह उस वर्गीकरण के चलने से पहले हो सकती है।
एक ट्रेस अंश जहां साइड-इफेक्टिंग टूल कुछ भी जांचने से पहले चला मॉडल को एक अनुरोध प्राप्त हुआ, एक टूल को कॉल किया जो एक रिफंड जारी करता है, और टूल चला। एक रिफंड एक वित्तीय कार्रवाई है: टूल एक चार्ज को उलट देता है और कंपनी से ग्राहक के खाते में पैसा वापस करता है। केवल इसके बाद ही आउटपुट फ़िल्टर कुछ भी देखा। इसने मॉडल द्वारा उत्पन्न पाठ का निरीक्षण किया, कुछ भी असुरक्षित नहीं पाया, और पास किया। रिफंड पहले से ही हुआ था। एक नियंत्रण इस पथ पर तीन जगहों पर बैठ सकता था: अनुरोध को रास्ते में स्क्रीन करना, इसे निष्पादित करने से पहले टूल कॉल को अधिकृत करना, और प्रतिक्रिया को फ़िल्टर करना। यह सिस्टम केवल अंतिम था, और यह पथ पर एकमात्र कार्रवाई के डाउनस्ट्रीम बैठा था जो पूर्ववत नहीं किया जा सकता था।
एक ग्राहक सेवा एजेंट के पास एक issue_refund टूल तक पहुंच है। एक उपयोगकर्ता एक अनुरोध प्रस्तुत करता है। 1 अनुरोध प्राप्त (कोई इनपुट स्क्रीनिंग कॉन्फ़िगर नहीं) 2 मॉडल उत्सर्जन tool_use: issue_refund(order=…) 3 टूल निष्पादित, रिफंड जारी (साइड इफेक्ट से पहले कोई प्राधिकरण गेट नहीं) 4 आउटपुट फ़िल्टर उत्पन्न पाठ का निरीक्षण (यह पास करता है, क्योंकि कार्रवाई जो इसने वर्णन किया था पहले से ही हुई थी)
यह क्यों टूट गया एक नियंत्रण को एक जगह पर रखा गया था लेकिन तीन जगहों को कवर करने के रूप में माना जाता था। आउटपुट स्क्रीनिंग पाठ को न्यायाधीश करता है, कार्यों को नहीं। एक साइड-इफेक्टिंग टूल को इसे चलाने से पहले प्राधिकरण की आवश्यकता है, और एक अनस्क्रीन किए गए इनपुट के पास कोई गेट नहीं है। अंत में एक फ़िल्टर एक संरक्षित पथ नहीं है, आपको सभी तीन फ़िल्टर जोड़ने चाहिए जब आवश्यक हो।
स्क्रीन 9: पथ पर नियंत्रण रखें
चेकपॉइंटगार्डरेल4 मिनट पथ पर नियंत्रण रखें अभी कोशिश करें। आपको चार नियंत्रण दिए गए हैं। प्रत्येक दो प्रश्नों का उत्तर देता है: यह अनुरोध पथ पर कहां बैठता है, और यह किस प्रकार की जांच है। प्रत्येक नियंत्रण को एक ग्रिड पर ड्रॉप करें। क्षैतिज अक्ष इनपुट स्क्रीनिंग से कार्रवाई प्राधिकरण से पहले एक टूल चलता है, आउटपुट फ़िल्टरिंग के लिए प्लेसमेंट बिंदु है। ऊर्ध्वाधर अक्ष यह है कि क्या एक नियतात्मक जांच या मॉडल-आधारित जांच फिट बैठता है। सही प्लेसमेंट तर्क को प्रकट करता है। हर क्षेत्र भरा नहीं जाएगा, दो कोशिकाएं खाली रहेंगी।
A. जेलब्रेक और संकेत-इंजेक्शन स्क्रीन B. उपयोगकर्ता संदेश पर प्रतिबंधित शब्द ब्लॉकलिस्ट C. उत्पन्न प्रतिक्रिया पर विषाक्तता न्यायाधीश D. टूल चलने से पहले रिफंड प्राधिकरण नीति जांच
मॉडल-आधारित नियतात्मक
इनपुट स्क्रीनिंग
आउटपुट स्क्रीनिंग
कार्रवाई प्राधिकरण
उत्तर जांचें अभी के लिए छोड़ें
स्क्रीन 10: असमान परिणाम कहां प्रवेश करते हैं, और सिस्टम को क्या समझाना चाहिए
शिक्षणनिष्पक्षता11 मिनट असमान परिणाम कहां प्रवेश करते हैं, और सिस्टम को क्या समझाना चाहिए रनटाइम नियंत्रण अनुमति न दी गई आउटपुट को सिस्टम से छोड़ने से रोकते हैं, यह सुनिश्चित करते हैं कि उपयोगकर्ता कभी उन्हें नहीं देखते हैं। हालांकि, रनटाइम नियंत्रण एक आउटपुट के लिए खाता नहीं देते हैं जो तकनीकी रूप से हर जांच को पास करता है लेकिन विभिन्न लोगों के लिए विभिन्न परिणाम उत्पन्न करता है। वह विफलता पहचानने के लिए कठिन है और विशेषता के लिए कठिन है, क्योंकि, इसकी सतह पर, यह एक सामान्य आउटपुट की तरह दिखता है।
असमान परिणाम पहचानने योग्य बिंदुओं पर प्रवेश करते हैं निष्पक्षता डिजाइन करना आसान हो जाता है एक बार जब आप इसे मॉडल की एक एकल विशेषता के रूप में मानना बंद कर देते हैं और इसे कुछ के रूप में मानना शुरू करते हैं जो विशिष्ट, पहचानने योग्य बिंदुओं पर प्रवेश करता है। एक Claude सिस्टम में चार सामान्य प्रवेश बिंदु हैं:
पुनर्प्राप्ति कॉर्पस समूहों को अधिक-प्रतिनिधित्व या कम-प्रतिनिधित्व कर सकता है, इसलिए संदर्भ जो मॉडल देखता है पहले से ही तिरछा है। संकेत की फ्रेमिंग एक धारणा को एन्कोड कर सकती है जो परिणामों को एक दिशा में धकेलती है। कुछ-शॉट संकेत में उपयोग किए गए उदाहरण कॉर्पस के समान तिरछा ले सकते हैं। और डाउनस्ट्रीम रूटिंग, मॉडल के आउटपुट के बाद क्या होता है, कुछ समूहों को विभिन्न पथों के नीचे निर्देशित कर सकता है।
इनमें से प्रत्येक एक इंजेक्शन बिंदु है जो आप निरीक्षण कर सकते हैं, जो निष्पक्षता को एक सच्ची आर्किटेक्चर संपत्ति बनाता है।
कौन पूछता है यह निर्धारित करता है कि सिस्टम क्या समझाता है
दर्शकउन्हें क्या चाहिएयह क्या आवश्यक है कि आप कब्जा करें
एक प्रभावित उपयोगकर्ताएक स्पष्ट व्याख्या कि क्यों एक निर्णय उन्हें प्रभावित करता है या उन शर्तों में व्यक्त किया जाता है जो वे कार्य कर सकते हैं।निर्णय को चलाने वाले इनपुट और कारण परिणाम एक पचने योग्य रूप में पहुंचा गया था। एक नियामकसबूत कि सिस्टम तुलनीय मामलों को लगातार मानता है और एक विशिष्ट निर्णय को मांग पर पुनर्निर्मित किया जा सकता है।एक टिकाऊ, प्रश्नयोग्य इनपुट, आउटपुट, और निर्णय पथ का रिकॉर्ड। आपकी बिल्ड टीमएक फ्लैग किए गए निर्णय को गलत क्यों गया और इसे ठीक करने के लिए पर्याप्त विवरण।पूर्ण ट्रेस: संकेत, पुनः प्राप्त संदर्भ, मॉडल आउटपुट, और हर रूटिंग चरण, मौजूदा अवलोकनीयता से जुड़ा।
निर्णय लॉगिंग वह है जो उन व्याख्याओं को संभव बनाता है एक एकल निर्णय को दोहराने और समझाने के लिए, इनपुट को कैप्चर करें जो इसे चलाता है, पुनः प्राप्त संदर्भ, मॉडल आउटपुट, और रूटिंग यह चला गया। यह उत्पादन कार्य से एक ही अवलोकनीय उपकरण है, एक अलग प्रश्न पर लागू। इस बार, इसके बजाय पूछने के लिए कि सिस्टम स्वस्थ है, हम पूछ रहे हैं कि एक विशिष्ट निर्णय क्यों हुआ। उपकरण समान है, लेकिन प्रतिधारण और प्रश्न पथ अलग हैं।
कार्रवाई में निष्पक्षता-और-पारदर्शिता चेकलिस्ट एक क्रेडिट-निर्णय समर्थन प्रणाली पर विचार करें। चेकलिस्ट को एक बार समीक्षा करें और मानदंड अमूर्त होना बंद कर देते हैं:
चार प्रवेश बिंदुओं में से कौन सा इस परिणाम को तिरछा कर सकता है, और क्या प्रत्येक उपकरणीकृत है? एक प्रतिकूल निर्णय के लिए, क्या आप इनपुट और कारण उत्पादन कर सकते हैं उन शर्तों में जो आवेदक कार्य कर सकते हैं? यदि एक नियामक पूछता है कि क्या समान आवेदकों को तुलनीय रूप से माना गया था, क्या आप लॉग को प्रश्न कर सकते हैं और एक उत्तर प्रदान कर सकते हैं? क्या आपकी टीम किसी भी फ्लैग किए गए निर्णय के लिए पूर्ण ट्रेस खींच सकती है?
कहीं भी एक 'नहीं' एक डिजाइन अंतर है।
विवेक: असमान उपचार के लिए आउटपुट का न्याय करना विवेक चार AI Fluency दक्षताओं में से एक है: AI आउटपुट और व्यवहार का मूल्यांकन। व्यावहारिक रूप से इसका मतलब है कि एक मॉडल आउटपुट को स्वीकार्य, संशोधन की आवश्यकता, या ओवरराइड की आवश्यकता के रूप में न्याय करना, बजाय इसे स्वीकार करने के। निष्पक्षता पर लागू, विवेक वह है जो एक समीक्षक को एक तिरछा या अन्यायपूर्ण परिणाम को पहचानने देता है बजाय केवल पुष्टि करने के कि एक मूल्य का उत्पादन किया गया था। एक पारदर्शिता रिकॉर्ड वह है जो पहली जगह में उस मान्यता को संभव बनाता है।
लागत · जटिलता · जोखिम लागत: हर अनुरोध पर निर्णय-स्तर लॉग को कैप्चर और बनाए रखना भंडारण और एक प्रश्न पथ जोड़ता है, और लागत ट्रैफिक के साथ बढ़ती है बजाय स्थिर रहने के। जटिलता: चार प्रवेश बिंदुओं को उपकरणीकृत करना और तीन दर्शकों को सेवा देना एक एकल ऑडिट लॉग की तुलना में अधिक डिजाइन कार्य है, क्योंकि प्रत्येक दर्शक को एक ही रिकॉर्ड का एक अलग स्लाइस चाहिए। इसके शीर्ष पर, प्रतिधारण नीति को अब शासित किया जाना चाहिए, क्योंकि आप निर्णय-स्तर डेटा को लंबे समय तक और एक विशिष्ट उद्देश्य के लिए रखते हैं। जोखिम: परिणाम मीट्रिक समग्र रूप से ठीक दिख सकता है जबकि नुकसान एक उप-समूह में केंद्रित है। एक अनलॉग किया गया या अनमापा इंजेक्शन बिंदु अंतर को तब तक छिपा सकता है जब तक कोई टीम के बाहर इसे नहीं पाता। डेटा हैंडलिंग: निर्णय लॉग स्वयं अनुपालन रजिस्टर के दायरे में है। HIPAA या GDPR संदर्भों में, लॉग किए गए इनपुट और पुनः प्राप्त संदर्भ संवेदनशील व्यक्तिगत डेटा शामिल हैं। न्यूनतमकरण, प्रतिधारण सीमाएं, और लॉग तक पहुंच नियंत्रण लागू करें, और इसे अपने अनुपालन रजिस्टर में एक नामित नियंत्रण के रूप में मैप करें। पारदर्शिता के लिए सब कुछ लॉगिंग और अनुपालन के लिए डेटा पिन करना संघर्ष में नहीं हैं, क्योंकि वे एक ही लॉग की आवश्यकता है, अलग तरीके से शासित।
स्क्रीन 11: जब निष्पक्षता को मॉडल प्रदाता की समस्या के रूप में माना जाता है
सावधान रहेंनिष्पक्षता3 मिनट जब निष्पक्षता को मॉडल प्रदाता की समस्या के रूप में माना जाता है
सेटअप हुक निष्पक्षता मॉडल की एक संपत्ति की तरह लग सकती है। मॉडल प्रदाता ने इसे प्रशिक्षित किया, पूर्वाग्रह मूल्यांकन चलाए, और परिणाम प्रकाशित किए, इसलिए निष्पक्षता को कुछ के रूप में मानना उचित लगता है जो मॉडल आपके आर्किटेक्चर तक पहुंचने से पहले अपस्ट्रीम संभाला जाता है। वह फ्रेमिंग तब तक पकड़ता है जब तक आपका सिस्टम मॉडल को अपने पुनर्प्राप्ति कॉर्पस के साथ जोड़ता है, क्योंकि एक कॉर्पस जो कुछ मामलों को अधिक-प्रतिनिधित्व करता है असमान परिणाम उत्पन्न करता है जो मॉडल प्रदाता ने कभी परीक्षण नहीं किया और नहीं देख सकता।
एक पोस्ट-घटना समीक्षा यह विफलता मोड जल्दी पहचानने के लायक है; टीम ने एक उचित धारणा बनाई जो गलत निकली। उन्होंने एक मॉडल का उपयोग किया जो अपने निष्पक्षता मूल्यांकन को पास किया, और तिरछा एक बिंदु पर प्रवेश किया जो उन्होंने देखने के लिए नहीं सोचा था। निम्नलिखित एक आर्किटेक्ट है जो एक पोस्ट-घटना समीक्षा में अंतर का वर्णन करता है। "हमने माना कि निष्पक्षता मॉडल का काम था। तिरछा हमारे पुनर्प्राप्ति कॉर्पस में था, और हमने इतना कम लॉग किया था कि हम इसे साबित नहीं कर सकते थे।" असमान परिणाम मॉडल के प्रशिक्षण से नहीं आए। इसके बजाय वे एक कॉर्पस से आए जो कुछ मामलों को अधिक-प्रतिनिधित्व करता है, एक इंजेक्शन बिंदु जो टीम ने कभी निगरानी नहीं की क्योंकि उन्होंने निष्पक्षता को विक्रेता को सौंपा था। जब परिणामों पर सवाल उठाया गया, तो टीम के पास निर्णय-स्तर लॉग नहीं था जो पुनर्निर्माण करने के लिए क्या हुआ। वे न तो विशिष्ट निर्णयों को समझा सकते थे जो सिस्टम ने किए थे और न ही कॉर्पस को नियम से बाहर कर सकते थे, जिससे वे नियामक द्वारा पूछे जाने वाले एकमात्र प्रश्न का उत्तर देने में असमर्थ रह गए: तिरछा कहां से आया?
यह क्यों टूट गया निष्पक्षता को मॉडल संपत्ति के रूप में माना जाता था जो विक्रेता मालिक है। असमान परिणाम आर्किटेक्ट नियंत्रण करने वाले बिंदुओं पर प्रवेश करते हैं, और पुनर्प्राप्ति कॉर्पस उनमें से एक है। उन बिंदुओं पर निर्णय लॉगिंग के बिना, टीम नुकसान को समझा नहीं सकती या इसके स्रोत को नियम से बाहर नहीं कर सकती। निष्पक्षता और व्याख्यात्मकता आर्किटेक्चर आवश्यकताएं हैं। उन्हें उन बिंदुओं पर उपकरणीकृत करें जहां तिरछा प्रवेश कर सकता है। यह मानना कि वे मॉडल के साथ आते हैं उन बिंदुओं को अनमॉनिटर छोड़ देता है।
स्क्रीन 12: निर्णय-लॉगिंग डिजाइन की आलोचना करें
चेकपॉइंटनिष्पक्षता3 मिनट निर्णय-लॉगिंग डिजाइन की आलोचना करें अभी कोशिश करें। आप एक निर्णय-समर्थन प्रवाह के लिए एक सिस्टम स्केच देख रहे हैं। उन घटकों पर क्लिक करें जहां पारदर्शिता अनुपस्थित या अपर्याप्त है, जैसे एक रूटिंग चरण जो कभी लॉग नहीं किया जाता है या एक निर्णय जो पुनर्निर्मित नहीं किया जा सकता है। प्रत्येक क्लिक प्रकट करता है कि वह अंतर एक प्रभावित उपयोगकर्ता या नियामक के लिए क्या मतलब है। सभी अंतराल का चयन करें। पर्याप्त रूप से लॉग किए गए घटकों को अनुपयोगी छोड़ें।
✓ अंतरालएक रूटिंग चरण जो कुछ मामलों को एक अलग पथ के नीचे भेजता है कोई लॉग प्रविष्टि के साथ।
↓
✓ अंतरालएक पुनर्प्राप्ति चरण जिसका वापस किया गया संदर्भ कैप्चर नहीं किया जाता है।
↓
✓ अंतरालएक मॉडल आउटपुट इनपुट के बिना संग्रहीत जो इसे उत्पादन किया।
↓
✓ पर्याप्तइनपुट, आउटपुट, और रूटिंग सभी लॉग किए गए हैं और एक सत्र ID से जुड़े हैं।
✓ पर्याप्तलॉग प्रति निर्णय प्रश्नयोग्य है और 90 दिनों के लिए बनाए रखा जाता है।
✓ अंतरालएक कुल सटीकता डैशबोर्ड कोई प्रति-उप-समूह टूटने के साथ।
उत्तर जांचें अभी के लिए छोड़ें
स्क्रीन 13: मात्रा के बजाय दांव से लोगों को निर्णय रूट करना
शिक्षणसमीक्षा रूटिंग10 मिनट मात्रा के बजाय दांव से लोगों को निर्णय रूट करना निर्णय लॉगिंग ने आपको एक रिकॉर्ड दिया कि प्रत्येक स्वचालित निर्णय किस पर आधारित था: इनपुट जो इसे देखा, पथ जो इसे लिया, और आउटपुट जो इसे उत्पादन किया। एक लॉग किया गया निर्णय बाद में समझाया जा सकता है, लेकिन एक लॉग अकेले तय नहीं करता है कि कौन से निर्णय एक व्यक्ति को प्रभाव लेने से पहले तौलना चाहिए। एक लॉग बाद में निर्णयों को समझाता है। एक रूटिंग नियम गलत लोगों को प्रभाव लेने से रोकता है। आप यह काम करेंगे कि कौन से निर्णय एक मानव समीक्षा चरण वारंट करते हैं और उस समीक्षक को जल्दी कॉल करने के लिए स्क्रीन पर क्या होना चाहिए। लॉग जो आपने पहले से ही बनाया है वह कच्चा सामग्री है उस दृश्य के लिए, इसलिए यह इसे सतह से बाहर निकालने और कब करने का मामला है, बजाय शुरुआत से सिस्टम को फिर से उपकरणीकृत करने के।
एक निर्णय के दांव क्या सेट करता है मानव समीक्षा को एक बजट के रूप में सोचें: आपके पास समीक्षक ध्यान की एक सीमित राशि है, और आपको इसे उच्चतम-दांव वाली वस्तुओं पर ध्यान केंद्रित करना चाहिए। निम्नलिखित चर एक साथ काम करते हैं एक निर्णय के दांव को सेट करने के लिए।
प्रतिवर्तनीयता यह है कि एक गलत निर्णय को कितनी आसानी से पूर्ववत किया जा सकता है। एक गलत निर्णय की लागत यह है कि गलती अगर यह अनुपयोगी जाती है तो क्या कारण बनती है। ये दोनों निर्णय के दांव को सेट करते हैं: एक विकल्प जो पूर्ववत करने के लिए कठिन है और गलत होने पर महंगा है उच्च दांव है, भले ही सिस्टम इसे कैसे पहुंचे। आत्मविश्वास तीसरा चर है जो इन दोनों के शीर्ष पर बैठता है। यह स्कोर है जो सिस्टम अपने आउटपुट के बारे में उत्पादन करता है, और यह केवल उस डिग्री तक उपयोगी है जो यह अंशांकित है, क्योंकि एक मॉडल आत्मविश्वास से गलत हो सकता है। आत्मविश्वास निर्णय के दांव को नहीं बदलता है; यह अनुमान लगाता है कि यह आउटपुट कितना गलत होने की संभावना है, जो आपको बताता है कि आपकी मात्रा का कितना समीक्षा के लिए रूट किया जाना चाहिए।
इन चर को एक नियम में संयोजित करें: जब वे कम-आत्मविश्वास और या तो अप्रतिवर्तनीय या उच्च-लागत हों तो निर्णयों को एक व्यक्ति के पास रूट करें; आत्मविश्वास, प्रतिवर्तनीय, कम-लागत निर्णयों को जाने दें। एक आत्मविश्वास, आसानी से उलट, कम-लागत निर्णय आमतौर पर एक मानव के बिना चल सकता है। एक कम-आत्मविश्वास, अप्रतिवर्तनीय, उच्च-लागत निर्णय लगभग हमेशा मानव समीक्षा की आवश्यकता है। जब ये चर असहमत होते हैं तो निर्णय जो आपकी समीक्षा बजट का उपभोग करते हैं। एक मामला उच्च लागत हो सकता है लेकिन आसानी से उलट, या कम आत्मविश्वास कुछ तुच्छ पर पूर्ववत करने के लिए। जब वे संघर्ष करते हैं, लागत और प्रतिवर्तनीयता को अधिक वजन दें, क्योंकि वे एक गलती के परिणाम निर्धारित करते हैं। आत्मविश्वास को तय करने दें कि आप उस उच्च-दांव मात्रा का कितना सुरक्षित रूप से अनुपयोगी जा सकते हैं। आत्मविश्वास पर रूटिंग एक धारणा ले जाता है जो पहचानने के लायक है: आत्मविश्वास संकेत को नियम के लिए पकड़ने के लिए अंशांकित किया जाना चाहिए, और पुष्टि करना कि अंशांकन एक कार्य है।
मानव कहां बैठता है सुरक्षा और गति के बीच एक ट्रेडऑफ है एक बार निर्णय एक व्यक्ति के पास रूट किया जाता है, आप चुनते हैं कि वे प्रवाह में कहां बैठते हैं। एक मानव को जल्दी शामिल करना सुरक्षित और धीमा है।
प्लेसमेंटयह आपको क्या देता हैयह क्या लागत करता है
प्री-एक्शन अनुमोदिनकार्रवाई प्रभाव में नहीं आ सकती जब तक एक व्यक्ति इसे मंजूरी नहीं देता है, इसलिए कोई अप्रतिवर्तनीय कार्रवाई अनुपयोगी होती है।यह हर रूट किए गए निर्णय में विलंबता जोड़ता है और एक व्यक्ति उपलब्ध होना चाहिए, इसलिए यह उच्च मात्रा के लिए स्केल नहीं करता है। पोस्ट-एक्शन ऑडिटकार्रवाई तुरंत चलती है और एक व्यक्ति बाद में इसकी समीक्षा करता है, इसलिए थ्रूपुट उच्च रहता है।एक गलत कार्रवाई पहले से ही प्रभाव में है जब तक यह पकड़ा जाता है, इसलिए यह केवल प्रतिवर्तनीय, कम-लागत निर्णयों के लिए उपयुक्त है। नमूना समीक्षानिर्णयों का एक अंश समीक्षा किया जाता है समग्र प्रक्रिया को धीमा किए बिना गुणवत्ता की निगरानी के लिए।एक गलत निर्णय अनमूल्य के माध्यम से फिसल सकता है, यह सिस्टम की निगरानी करता है बजाय व्यक्तिगत परिणामों की रक्षा करने के।
समीक्षक क्या देखता है यह तय करता है कि समीक्षा सटीक है या नहीं एक समीक्षक जो अपनी कतार में क्यों एक निर्णय उतरा यह नहीं देख सकता है वह अपनी आवश्यकता वाली निर्णय के बिना अनुमोदन कर सकता है। सुनिश्चित करें कि आपके समीक्षकों के पास तीन चीजें हैं: इनपुट जो निर्णय को चलाता है, मॉडल का आउटपुट, और कारण यह फ्लैग किया गया था। इस कारण के बिना, वे एक किनारे के मामले और दिनचर्या ट्रैफिक के बीच अंतर नहीं बता सकते। इनपुट के बिना, वे नहीं बता सकते कि आउटपुट सही है या नहीं। आप समीक्षक के दृश्य में क्या रखते हैं यह निर्धारित करता है कि समीक्षा सटीक है या नहीं।
Anthropic के एजेंट स्वायत्तता पर अनुसंधान ने पाया कि हर कार्रवाई पर साइन-ऑफ की आवश्यकता सार्थक सुरक्षा लाभ के बिना घर्षण जोड़ता है। एक बेहतर दृष्टिकोण एक व्यक्ति को निगरानी करना है कि क्या हो रहा है और जब आवश्यक हो तो कदम में। Claude Code में एक Anthropic पैटर्न प्रति-चरण अनुमोदन को कम करना और योजना समीक्षा या अपवाद हैंडलिंग जैसे उच्च-मूल्य चेकपॉइंट पर समीक्षा को स्थानांतरित करना है, सहमति थकान से बचने के लिए; सटीक समीक्षा डिजाइन वर्कफ़्लो के जोखिम पर निर्भर करता है। इस विवेक के बिना, सहमति थकान हो सकती है। सहमति थकान तब होती है जब एक सिस्टम एक पंक्ति में दर्जनों बार अनुमोदन के लिए पूछता है, और समीक्षक पढ़ने और प्रदान करने की गुणवत्ता की आवश्यकता वाली समीक्षा के बिना क्लिक करना शुरू करते हैं। वह पैटर्न वह था जो Claude Code में योजना-स्तर समीक्षा की ओर ले गया, जहां एक व्यक्ति प्रत्येक चरण के बजाय योजना को मंजूरी देता है। Anthropic. com/research/measuring-agent-autonomy और anthropic. com/research/trustworthy-agents पर प्रकाशन समय पर वर्तमान फ्रेमिंग सत्यापित करें।
परिश्रम: मानव समीक्षा के पीछे की दक्षता परिश्रम चार AI Fluency दक्षताओं में से एक है: जिम्मेदार AI सहयोग सुनिश्चित करना। तैनाती पर लागू, इसका मतलब है स्पष्ट मानव जवाबदेही चेकपॉइंट बनाए रखना, यह पहचानना कि जब स्वचालन दबाव निरीक्षण को कम कर रहा है, और वर्कफ़्लो को अंतराल के लिए ऑडिट करना जहां AI बिना समीक्षा के कार्य करता है, विशेष रूप से जैसे-जैसे स्वचालन स्केल करता है। एजेंट वर्कफ़्लो के लिए, रूटिंग नियम एक चेकपॉइंट पैटर्न बन जाता है: एक गेट जो उस कार्य के जोखिम और प्रतिवर्तनीयता के आधार पर मानव समीक्षा के लिए निष्पादन को रोकता है। किसी भी अप्रतिवर्तनीय या उच्च-दांव कार्रवाई से पहले एक गेट रखें जो एक एजेंट अन्यथा स्वायत्त रूप से लेगा, और बजाय प्रत्येक को गेट करने के बजाय कम-दांव कार्यों को नमूना करें। यह वही गेट शब्दावली है जो बहु-एजेंट डिजाइन पर निर्भर करता है।
लागत · जटिलता · जोखिम लागत: प्री-एक्शन समीक्षा हर रूट किए गए निर्णय में विलंबता जोड़ता है और समीक्षक समय की आवश्यकता है, जो एक आवर्ती परिचालन लागत है। जटिलता: रूटिंग तर्क, एक समीक्षक इंटरफेस जो इनपुट और फ्लैग कारण दिखाता है, और तीन प्लेसमेंट पथ एक एकल समीक्षा कतार की तुलना में अधिक जटिल हैं। जोखिम: मात्रा के बजाय दांव से रूटिंग या तो समीक्षकों को अभिभूत करता है और समीक्षा गुणवत्ता गिरावट का जोखिम, या एक उच्च-दांव, अप्रतिवर्तनीय कार्रवाई को कोई गेट के साथ अनुमति देता है।
स्क्रीन 14: जब सब कुछ समीक्षा के लिए रूटिंग समीक्षा को अर्थहीन बनाता है
सावधान रहेंसमीक्षा रूटिंग3 मिनट जब सब कुछ समीक्षा के लिए रूटिंग समीक्षा को अर्थहीन बनाता है
सेटअप हुक यह तय करना कि कौन से निर्णय उच्च दांव के रूप में गिनते हैं निर्णय लेता है, और सब कुछ समीक्षा के लिए रूटिंग करना उस महत्वपूर्ण चरण को हटा देता है। यह रूढ़िवादी डिफ़ॉल्ट की तरह महसूस हो सकता है: यह एक अनुपालन समीक्षक या एक ऑडिटर को बचाव करना आसान है, और इसके लिए कोई कॉल की आवश्यकता नहीं है कि दांव कहां बैठते हैं। सब कुछ रूटिंग सुरक्षित उत्तर की तरह महसूस होता है क्योंकि यह आपको उस महत्वपूर्ण लाइन को खींचने से बचाता है।
एक हैंडऑफ का एक छोटा प्रतिलेख जो लापरवाही से समीक्षा किया गया था एक समीक्षक की कतार शायद ही कभी तब तक देखी जाती है जब तक यह विफल न हो। नीचे दिया गया पैटर्न दिखाता है कि क्या होता है जब एक सिस्टम हर आउटपुट को एक व्यक्ति के पास रूट करता है और उस व्यक्ति को समीक्षा करने के लिए कुछ नहीं देता है। दो अलग-अलग चीजें एक बार गलत हो जाती हैं, और संवाद दोनों को सतह करता है: मात्रा जो कोई भी पढ़ सकता है, और प्रत्येक आइटम जो समीक्षक को न्याय करने देने वाले संदर्भ के बिना आता है।
समीक्षक: मेरी कतार में आज चार सौ आइटम हैं। कल जैसा ही। लीड: क्या आप प्रत्येक पर इनपुट पढ़ रहे हैं? समीक्षक: कोई रास्ता नहीं। मुझे आउटपुट और एक अनुमोदन बटन मिलता है, बस इतना ही। मैं इनपुट भी नहीं देखता, या यह क्यों मेरे साथ उतरा। पहले घंटे के बाद मुझे गति बनाए रखने के लिए अनुमोदन करना होगा।
डिजाइन ने सभी आउटपुट को एक व्यक्ति के पास भेजा और उस व्यक्ति को आउटपुट अकेले दिया, कोई इनपुट और कोई फ्लैग कारण नहीं। मात्रा ने सावधान समीक्षा को असंभव बना दिया, और लापता संदर्भ ने इसे बेकार बना दिया, इसलिए समीक्षा अनुमोदन में ढह गई। एक उच्च-दांव निर्णय उस कतार में एक तुच्छ के समान दिनचर्या अनुमोदन मिला।
यह क्यों टूट गया दो स्वतंत्र विफलताएं यहां ढेर हो गईं, और अकेले कोई भी एक समीक्षा को ढीला होने के लिए पर्याप्त है। पहला मात्रा है। जब किसी व्यक्ति के पास रूट किए गए आइटम की संख्या उस समय से अधिक हो जाती है जो उनके पास पढ़ने के लिए है, निरीक्षण जो सब कुछ को कवर करता है कुछ भी समीक्षा नहीं करता है, क्योंकि समीक्षक गति बनाए रखने के लिए अलग हो जाता है। फिक्स रूटिंग नियम है: दांव का उपयोग करके निर्णयों को एक व्यक्ति के पास भेजें, आत्मविश्वास, प्रतिवर्तनीयता, और लागत का उपयोग करके, इसलिए कतार केवल उन निर्णयों को रखती है जो ध्यान देने योग्य हैं बजाय सभी के। दूसरा लापता संदर्भ है। एक समीक्षक जो केवल आउटपुट और एक अनुमोदन बटन देखता है उसके पास आउटपुट की जांच करने के लिए कुछ नहीं है, इसलिए यहां तक कि एक छोटी कतार भी सटीक रूप से न्याय करना कठिन है। फिक्स समीक्षक के दृश्य में क्या बैठता है यह स्थानांतरित करना है: इनपुट को सतह करें जो निर्णय को चलाता है और कारण आइटम को फ्लैग किया गया था, इसलिए समीक्षक देख सकता है कि वे क्या तौल रहे हैं। यदि आप इन विफलताओं में से केवल एक को ठीक करते हैं, तो समीक्षा अभी भी विफल हो सकती है। एक छोटी कतार कोई संदर्भ और एक अच्छी तरह से निर्मित समीक्षक दृश्य मात्रा में डूबा दोनों विफल।
स्क्रीन 15: समीक्षा-रूटिंग नियम बनाएं
चेकपॉइंटसमीक्षा रूटिंग3 मिनट समीक्षा-रूटिंग नियम बनाएं अभी कोशिश करें। एक रूटिंग नियम के तीन नियंत्रण हैं: एक आत्मविश्वास थ्रेशोल्ड, एक गलत उत्तर की लागत, और एक प्रतिवर्तनीयता सेटिंग। लक्ष्य उच्च-दांव, कम-आत्मविश्वास निर्णयों को एक व्यक्ति के पास रूट करना है इससे पहले कि वे प्रभाव लें, जबकि समीक्षक छत के तहत समीक्षा कतार रखते हैं। दोनों लक्ष्यों को एक बार में पूरा करने वाला नियम चुनें।
A. एक उच्च आत्मविश्वास थ्रेशोल्ड के नीचे सब कुछ समीक्षा के लिए रूट करें, दांव की परवाह किए बिना। B. निर्णयों को रूट करें जो कम-आत्मविश्वास हैं और या तो अप्रतिवर्तनीय या उच्च-लागत हैं प्री-एक्शन समीक्षा के लिए; आत्मविश्वास, प्रतिवर्तनीय, कम-लागत निर्णयों को जाने दें। C. आत्मविश्वास अकेले द्वारा रूट करें, कतार को छोटा रखने के लिए काफी कम सेट करें। D. सुरक्षित होने के लिए हर निर्णय को समीक्षा के लिए भेजें।
अब इस चरण को पूरा करें: 1-2 वाक्यों में, एकल निर्णय नियंत्रण का नाम दें, क्या एक कम-आत्मविश्वास मामला अभी भी एक व्यक्ति के पास रूट करता है भले ही आत्मविश्वास सहनशीलता के भीतर हो?
मॉडल उत्तर प्रकट करें
मॉडल उत्तर प्रतिवर्तनीयता और एक गलत उत्तर की लागत निर्णय नियंत्रण हैं, आत्मविश्वास नहीं। आत्मविश्वास आपको रूट करने वाली मात्रा को फ़िल्टर करता है, लेकिन यह निर्णय के दांव को नहीं बदलता है। एक मामला आत्मविश्वास के भीतर हो सकता है और अभी भी एक मानव के पास रूट कर सकता है यदि यह अप्रतिवर्तनीय या उच्च-लागत के लिए पर्याप्त है।
पूर्ण चिह्नित करें
अभी के लिए छोड़ें
स्क्रीन 16: प्रत्येक अनुपालन दायित्व को एक नियंत्रण में बदलना साक्ष्य के साथ
शिक्षणअनुपालन10 मिनट प्रत्येक अनुपालन दायित्व को एक नियंत्रण में बदलना साक्ष्य के साथ एकीकरण मॉडल की अनुपालन परत ने शासन दायित्व को एक प्री-फ़िल्टर के रूप में उपयोग किया: HIPAA, GDPR, FedRAMP, वकील-क्लाइंट विशेषाधिकार, या एक डेटा-निवास नीति प्रत्येक लागत या इंजीनियरिंग वरीयता प्रवेश करने से पहले डिलीवरी मार्ग और प्रवेश बिंदु को नियम में या बाहर निकाल दिया। वह काम आपको एक प्रवेश बिंदु और एक मार्ग तक पहुंचाता है जो दायित्व को जीवित रखता है, लेकिन अगला चरण संकीर्ण और कठिन है। प्रत्येक जीवित दायित्व को अब एक नियंत्रण के साथ एक नामित मालिक के साथ बदलना चाहिए। एक समीक्षक एक अनुपालन प्रवेश बिंदु अकेले सबूत के रूप में नहीं मानता है कि नियम का पालन किया जा रहा है। वे भी पूछते हैं कि नियंत्रण का मालिक कौन है और क्या साक्ष्य दिखाता है कि यह व्यवहार में चल रहा है।
एक विनियमन एक परिणाम बताता है, लेकिन आप नियंत्रण और सबूत की आपूर्ति करते हैं GDPR, HIPAA, और FedRAMP जैसी फ्रेमवर्क परिणाम बताती हैं, कार्यान्वयन नहीं। वे कहते हैं कि क्या सच होना चाहिए: संरक्षित डेटा को एक निश्चित तरीके से संभाला जाना चाहिए, पहुंच को नियंत्रित किया जाना चाहिए, और प्रसंस्करण को एक अधिकृत वातावरण में होना चाहिए, लेकिन वे तकनीकी नियंत्रण को आपके पास छोड़ देते हैं। प्रत्येक दायित्व तीन चीजें बन जाता है जो आप मालिक हैं: एक विशिष्ट तकनीकी नियंत्रण जो परिणाम को प्राप्त करता है, एक मालिक जो इसके लिए जवाबदेह है, और एक साक्ष्य कलाकृति जो दिखाता है कि यह जीवंत है। हमेशा साक्ष्य कलाकृति को शामिल करना याद रखें; यह वह है जो समीक्षक जांच करेगा और सबसे अक्सर याद किया जाता है।
दायित्वों को नियंत्रणों, मालिकों, और साक्ष्य के लिए मैपिंग दायित्वों को नियंत्रणों, मालिकों, और साक्ष्य के लिए मैपिंग दायित्व (फ्रेमवर्क)तकनीकी नियंत्रणएक समीक्षक स्वीकार करता है साक्ष्यमालिक
संरक्षित स्वास्थ्य डेटा एक समझौते के तहत संभाला जाता है (HIPAA)केवल एक HIPAA-तैयार एंटरप्राइज योजना या पहली-पक्ष API कॉन्फ़िगरेशन का उपयोग करें जो एक हस्ताक्षरित व्यावसायिक सहयोगी समझौते द्वारा कवर किया गया है, HIPAA अनुपालन सक्षम और केवल योग्य सुविधाएं दायरे में।हस्ताक्षरित BAA और व्यवस्थापक सेटिंग HIPAA अनुपालन सक्षम दिखा रहा है, साथ ही योग्य-सुविधा सूची।सुरक्षा लीड आवश्यक प्रभाव स्तर पर अमेरिकी सरकार कार्यभार (FedRAMP)एक Anthropic-दस्तावेज़ अधिकृत मार्ग के माध्यम से वितरित करें जो आवश्यक प्रभाव स्तर को पूरा करता है, एक गैर-अधिकृत प्रवेश बिंदु नहीं।चुने गए मार्ग के लिए प्राधिकरण रिकॉर्ड और पुष्टि कि कार्यभार विशेष रूप से इस पर चलता है।प्लेटफॉर्म मालिक डेटा एक अनुमोदित क्षेत्र में संभाला और संग्रहीत (डेटा निवास)समर्थित क्षेत्रीय प्रसंस्करण और भंडारण को अनुमोदित क्षेत्र के लिए कॉन्फ़िगर करें, और सत्यापित करें कि क्या लॉग, कैश, निगरानी, और प्रतिधारण पथ अनुमोदित सीमा के भीतर रहते हैं।निवास कॉन्फ़िगरेशन और एक डेटा-प्रवाह रिकॉर्ड दिखा रहा है कि हर प्रति कहां रहता है।डेटा मालिक मांग पर पुनर्निर्मित निर्णय (पारदर्शिता, क्रॉस-फ्रेमवर्क)निष्पक्षता क्लस्टर में निर्मित निर्णय लॉगिंग, आवश्यक अवधि के लिए बनाए रखा और प्रश्नयोग्य।लाइव लॉग से एक निर्णय का एक नमूना पुनर्निर्माण।आर्किटेक्ट
प्रशिक्षण उपयोग बनाम प्रतिधारण, दो अलग दावे प्रशिक्षण उपयोग और प्रतिधारण को एक ही दावे में ढहाएं नहीं: डेटा को डिफ़ॉल्ट रूप से मॉडल प्रशिक्षण से बाहर रखा जा सकता है जबकि अभी भी लॉगिंग, दुरुपयोग रोकथाम, कानूनी अनुपालन, या कॉन्फ़िगर किए गए ऑडिट उद्देश्यों के लिए बनाए रखा जा सकता है।
साक्ष्य कलाकृति हैंडऑफ को प्रभावी बनाता है एकीकरण कार्य से बाधा-उन्मूलन तर्क यहां आगे बढ़ता है। तब आपने उन डिलीवरी मार्गों को समाप्त किया जो एक बाधा को जीवित नहीं रख सकते। अब आप रिकॉर्ड करते हैं, प्रत्येक दायित्व के लिए, नियंत्रण जो इसे संतुष्ट करता है और कलाकृति जो साबित करता है। एक सुरक्षा और कानूनी समीक्षक सबूत स्वीकार करता है कि एक नियंत्रण जीवंत है: एक हस्ताक्षरित समझौता, एक कॉन्फ़िगरेशन स्क्रीन, एक प्राधिकरण रिकॉर्ड, या एक वापस किया गया लॉग प्रश्न। वह वे स्वीकार नहीं करते हैं एक डिजाइन दस्तावेज़ जो एक नियंत्रण की पहचान करता है कोई मालिक और कोई साक्ष्य के साथ; एक नियंत्रण जो कोई भी प्रदर्शन नहीं कर सकता है एक ऑपरेटिंग से अलग नहीं है।
लागत · जटिलता · जोखिम लागत: हर दायित्व के लिए साक्ष्य का उत्पादन और रखरखाव चल रहा काम है। कॉन्फ़िगरेशन बहाव और कलाकृतियां पुरानी हो जाती हैं, इसलिए रजिस्टर को एक नियमित गति पर पुनः सत्यापित किया जाता है। जटिलता: एक नियंत्रण, एक मालिक, और हर दायित्व के लिए एक जीवंत साक्ष्य कलाकृति एक प्रवेश बिंदु विकल्प की तुलना में अधिक शासन है, और यह सुरक्षा, कानूनी, और प्लेटफॉर्म मालिकों को फैलाता है जो प्रत्येक को सहमत होना चाहिए। जोखिम: एक नियंत्रण कोई मालिक और कोई साक्ष्य के साथ निर्दिष्ट ऑडिट पर अदृश्य है। यह बिना किसी को जवाबदेह किए गैर-परिचालन हो सकता है, और अंतर डिजाइन के बजाय समीक्षा में सतह करता है, जो सबसे महंगी जगह है इसे खोजने के लिए।
स्क्रीन 17: जब प्रवेश बिंदु चयन अनुपालन को समाप्त करने की तरह महसूस होता है
सावधान रहेंअनुपालन3 मिनट जब प्रवेश बिंदु चयन अनुपालन को समाप्त करने की तरह महसूस होता है
सेटअप हुक बाधा प्री-फ़िल्टर को पास करना और अनुपालन साबित करना दो अलग-अलग चीजें हैं। प्री-फ़िल्टर एक साफ संकेत देता है। एक डिलीवरी मार्ग चुनना जो HIPAA, GDPR, या FedRAMP को जीवित रखता है एक तत्काल, दृश्यमान परिणाम उत्पादन करता है: मार्ग अनुमत है, प्रवेश बिंदु साफ है, डिजाइन आगे बढ़ सकता है। साबित करना कि प्रत्येक दायित्व पूरी हो रही है कुछ भी दृश्यमान नहीं उत्पादन करता है डिजाइन समय पर, क्योंकि सबूत एक कलाकृति है जो आपको बनाना, एक मालिक को संलग्न करना, और जीवंत रखना चाहिए जैसे-जैसे कॉन्फ़िगरेशन बदलते हैं। वह अंतर याद करना आसान है, क्योंकि समाप्त महसूस होने वाला क्षण और एक समीक्षक जांच करने वाला क्षण अक्सर महीने अलग होते हैं।
एक तैनाती जो सही मार्ग चुनता है लेकिन कोई सबूत नहीं देता है एक टीम ने एक विनियमित कार्यभार के लिए एक अनुपालन डिलीवरी मार्ग चुना और अनुपालन को निपटाया माना। उन्होंने डिजाइन समय पर, एक दस्तावेज़ में, दायित्वों को नियंत्रणों के लिए एक बार मैप किया। कोई मालिक नियंत्रणों से जुड़ा नहीं था, और कोई लॉगिंग कोई नियंत्रण संचालन दिखाने के लिए वायर नहीं किया गया था। डेटा निवास दायित्व वह जगह है जहां विफलता केंद्रित थी। नियंत्रण कागज पर सही था: अनुमोदित क्षेत्र में प्रसंस्करण पिन किया गया। हालांकि, महीने बाद एक लॉगिंग कॉन्फ़िगरेशन बदल गया और अनुरोध मेटाडेटा को एक दूसरे क्षेत्र में एक स्टोर में लिखना शुरू कर दिया। कुछ भी परिवर्तन की पहचान नहीं की, क्योंकि कोई भी निवास नियंत्रण का मालिक नहीं था और कोई कलाकृति ट्रैक नहीं कर रही थी कि डेटा कहां उतर रहा था। अंतर ऑडिट पर सतह आया, डिजाइन पर नहीं, जब एक समीक्षक सबूत के लिए पूछा कि डेटा क्षेत्र में रहा और टीम के पास एक डिजाइन दस्तावेज़ था एक डेटा-प्रवाह रिकॉर्ड के बजाय।
यह क्यों टूट गया प्री-फ़िल्टर को जीवित रहना अनुपालन स्थापित करने के लिए गलत था। एक अनुपालन मार्ग एक पूर्वापेक्षा है, सबूत नहीं। प्रत्येक दायित्व को एक नियंत्रण, एक नामित मालिक, और एक जीवंत साक्ष्य कलाकृति की आवश्यकता है जो तैनाती परिवर्तन के रूप में पुनः सत्यापित किया जाता है। इस कहानी में निवास नियंत्रण डिजाइन समय पर वास्तविक था और उत्पादन में चुप्पी से गलत था, और कुछ भी अंतर को पकड़ा नहीं क्योंकि कोई भी इसे देख रहा था।
स्क्रीन 18: नियंत्रण विकल्प को न्यायसंगत करें
चेकपॉइंटअनुपालन3 मिनट नियंत्रण विकल्प को न्यायसंगत करें अभी कोशिश करें। आपको एक विनियमित तैनाती के लिए एक अनुपालन दायित्व दिया गया है। तकनीकी नियंत्रण चुनें जो इसे साक्ष्य करता है, फिर एकल लोड-असर कारण चुनें कि एक सुरक्षा और कानूनी समीक्षक उस नियंत्रण को सबूत के रूप में स्वीकार करेगा। आप केवल तब पास करते हैं जब दोनों उतरते हैं: नियंत्रण दायित्व के लिए फिट होना चाहिए, और आपको नाम देना चाहिए कि यह सबूत के रूप में क्यों गिनता है। दायित्व: संरक्षित स्वास्थ्य डेटा को एक औपचारिक समझौते के तहत संभाला जाना चाहिए (HIPAA)।
A. एक HIPAA-तैयार योजना या पहली-पक्ष API एक हस्ताक्षरित BAA के तहत, क्योंकि हस्ताक्षरित समझौता साथ ही सक्षम कॉन्फ़िगरेशन सबूत है जो एक समीक्षक सबूत के रूप में निरीक्षण कर सकता है। B. एक HIPAA-तैयार योजना एक हस्ताक्षरित BAA के तहत, क्योंकि मॉडल को स्वास्थ्य डेटा को सावधानी से संभालने के लिए निर्देश दिया जाता है। C. स्वास्थ्य शर्तों पर एक मॉडल-आधारित सामग्री फ़िल्टर, क्योंकि यह रनटाइम पर संवेदनशील डेटा को पकड़ता है।
उत्तर जांचें अभी के लिए छोड़ें
स्क्रीन 19: एक जिम्मेदार तैनाती को इकट्ठा करें
संचयीमॉड्यूल8 मिनट एक जिम्मेदार तैनाती को इकट्ठा करें अभी कोशिश करें। आपको एक आत्मनिर्भर संक्षिप्त दिया जाता है, और आप पाँच अनुक्रमित निर्णय बनाते हैं जो एक जिम्मेदार तैनाती बनाते हैं। निर्णय क्रम में चलते हैं क्योंकि प्रत्येक अगले के लिए शर्तें सेट करता है। एक कमजोर प्रारंभिक विकल्प बाद वाले को सीमित करता है। यदि आप एक डोमेन नियम को प्रशिक्षित व्यवहार में छोड़ देते हैं तो निर्णय एक में, कोई परत नहीं है जो इसे वापस रख सकता है।
संक्षिप्त एक सार्वजनिक-क्षेत्र लाभ सहायक एक एजेंसी को कार्यक्रम पात्रता निर्धारित करने में मदद करता है, अनुमोदन, अस्वीकार, या संदर्भ की सिफारिश करता है। संक्षिप्त आपको देता है कि निर्णयों को क्या चाहिए और कुछ नहीं: फ्रेमवर्क: एजेंसी के आवश्यक प्रभाव स्तर पर FedRAMP, साथ ही एजेंसी का नियम कि एक अस्वीकृत आवेदक को विशिष्ट कारण मिलता है। उच्च-दांव, कम-आत्मविश्वास मामला: एक आवेदक पात्रता थ्रेशोल्ड के पास अधूरे दस्तावेज़ के साथ, जहां एक गलत अस्वीकार किसी के लाभ को हटा देता है। तिरछा-प्रवण आउटपुट: सिफारिश और कारण एक अस्वीकार से जुड़ा। डेटा: आवेदक-प्रस्तुत फ़ील्ड, निर्णय समय पर पुनः प्राप्त एजेंसी रिकॉर्ड, और कोई भी व्युत्पन्न सुविधाएं।
- प्रशिक्षित व्यवहार और आपकी एप्लिकेशन परत के बीच सीमा सेट करें।
- रनटाइम नियंत्रण रखें।
- निष्पक्षता और पारदर्शिता नियंत्रण निर्दिष्ट करें।
- मानव-समीक्षा रूटिंग परिभाषित करें।
- नियंत्रण रजिस्टर बनाएं।
मॉडल उत्तर प्रकट करें अभी के लिए छोड़ें
मॉडल उत्तर
- प्रशिक्षित व्यवहार और आपकी एप्लिकेशन परत के बीच सीमा सेट करें। प्रशिक्षित व्यवहार व्यापक नुकसान वर्गों को अस्वीकार करता है लेकिन कभी इस कार्यक्रम की पात्रता नियमों को नहीं देखा, इसलिए वे एप्लिकेशन परत से संबंधित हैं। उन्हें प्रशिक्षित व्यवहार में छोड़ दें और कोई परत नीचे उन तक पहुंच नहीं सकता है।
- रनटाइम नियंत्रण रखें। इनपुट स्क्रीनिंग, आउटपुट स्क्रीनिंग, और टूल-कॉल प्राधिकरण को स्थित करें, प्रत्येक पर मॉडल-आधारित या नियतात्मक चुनें, और विफलता दिशा सेट करें। बंद विफल, क्योंकि एक स्क्रीन जो खुले में विफल हो जाता है एक अनस्क्रीन किए गए अस्वीकार को एक आवेदक तक पहुंचने देता है।
- निष्पक्षता और पारदर्शिता नियंत्रण निर्दिष्ट करें। नाम करें कि चार इंजेक्शन बिंदुओं में से कौन सा (कॉर्पस, संकेत फ्रेमिंग, उदाहरण, रूटिंग) इस परिणाम को तिरछा कर सकता है, और निर्णय लॉगिंग एक बार बनाएं, क्योंकि प्रभावित आवेदक, नियामक, बिल्ड टीम, और नियंत्रण रजिस्टर सभी इसे खींचते हैं।
- मानव-समीक्षा रूटिंग परिभाषित करें। आत्मविश्वास, प्रतिवर्तनीयता, और एक गलत उत्तर की लागत से रूट करें, और एक प्लेसमेंट चुनें: प्री-एक्शन अनुमोदन, पोस्ट-एक्शन ऑडिट, या नमूना समीक्षा। कम-आत्मविश्वास, कठिन-से-उलट अस्वीकार को प्री-एक्शन अनुमोदन में भेजें। नियम को दांव के लिए कुंजी करें, मात्रा नहीं, या एक शांत कतार एक उच्च-दांव अस्वीकार को लहराती है।
- नियंत्रण रजिस्टर बनाएं। प्रत्येक FedRAMP दायित्व को एक नियंत्रण, एक मालिक, और साक्ष्य के लिए मैप करें जो एक समीक्षक स्वीकार करता है। एक नियंत्रण कोई साक्ष्य कलाकृति के साथ एक दावा है, सबूत नहीं।
मजबूत उत्तर विशिष्ट हैं: वे नाम देते हैं कि कौन से इंजेक्शन बिंदु, विफलता दिशा का नाम, रूटिंग नियम चर का नाम, और साक्ष्य कलाकृति का नाम। कमजोर उत्तर सामान्य अवधारणा का वर्णन करते हैं बिना इसे इस तैनाती पर लागू किए। प्रत्येक निर्णय को संक्षिप्त, अनुपालन फ्रेमवर्क और उच्च-दांव मामले विवरण के विरुद्ध जांचें आपके उत्तरों में दिखाई देना चाहिए।
पूर्ण चिह्नित करें
स्क्रीन 20: शब्दावली
संदर्भलपेटना शब्दावली इस मॉड्यूल में उपयोग की जाने वाली मुख्य शर्तें, वर्णक्रम क्रम में। एक शब्द को विस्तारित करने के लिए क्लिक करें।
BAA (व्यावसायिक सहयोगी समझौता)एक अनुबंध HIPAA के तहत जो एक विक्रेता को एक कवर इकाई की ओर से संरक्षित स्वास्थ्य डेटा को संसाधित करने की अनुमति देता है, प्रत्येक पक्ष की सुरक्षा और देनदारियों को परिभाषित करता है। इसके बिना, उस डेटा को विक्रेता के माध्यम से संभालना तकनीकी नियंत्रण की परवाह किए बिना गैर-अनुपालन है। सहमति थकानजब एक समीक्षक को बहुत सारी कार्रवाइयों को मंजूरी देने के लिए कहा जाता है तो निरीक्षण का टूटना, इसलिए वे लगभग सब कुछ वास्तविक समीक्षा के बिना मंजूरी देते हैं। यह हर निर्णय को एक मानव के पास रूटिंग की विफलता मोड है। Anthropic. com पर वर्तमान फ्रेमिंग सत्यापित करें। संविधानलिखित दस्तावेज़ Anthropic प्रशिक्षण के दौरान Claude के मूल्यों और व्यवहार को आकार देने के लिए उपयोग करता है, व्यापक रूप से सुरक्षित, नैतिक, दिशानिर्देशों के अनुपालन, और वास्तव में सहायक की प्राथमिकता क्रम बताता है। यह मॉडल के प्रशिक्षित व्यवहार को आकार देता है लेकिन किसी भी तैनाती की डोमेन नीति को एन्कोड नहीं करता है। Anthropic. com पर वर्तमान संस्करण सत्यापित करें। नियंत्रण रजिस्टरएक तालिका जो प्रत्येक अनुपालन दायित्व को इसके तकनीकी नियंत्रण, एक जवाबदेह मालिक, और एक साक्ष्य कलाकृति के लिए मैप करता है, इसलिए एक विनियमित तैनाती को एक आख्यान के रूप में दावा करने के बजाय एक रजिस्टर के रूप में ऑडिट किया जा सकता है। डेटा निवासआवश्यकता कि डेटा एक निर्दिष्ट भौगोलिक क्षेत्र के भीतर संसाधित और संग्रहीत किया जाता है, लॉग और कैश में प्रतियां शामिल हैं। यह कई डेटा-संप्रभुता दायित्वों के पीछे नियंत्रण है। निर्णय लॉगिंगइनपुट को कैप्चर करना, पुनः प्राप्त संदर्भ, मॉडल आउटपुट, और प्रत्येक निर्णय के लिए रूटिंग, कुंजीबद्ध ताकि एक निर्णय बाद में दोहराया और समझाया जा सके। यह उत्पादन कार्य से एक ही अवलोकनीयता उपकरण है जो एक अलग प्रश्न पर इंगित किया जाता है। साक्ष्य कलाकृतिठोस सबूत एक सुरक्षा और कानूनी समीक्षक स्वीकार करता है कि एक नियंत्रण जीवंत है: एक हस्ताक्षरित समझौता, एक कॉन्फ़िगरेशन स्क्रीन, एक प्राधिकरण रिकॉर्ड, या एक वापस किया गया लॉग प्रश्न। एक नियंत्रण एक डिजाइन दस्तावेज़ में कोई कलाकृति के साथ नाम दिया गया एक दावा है, सबूत नहीं। खुले बनाम बंद विफलकैसे एक गार्डरेल व्यवहार करता है जब यह स्वयं त्रुटि करता है। खुले में विफल ट्रैफिक को अनस्क्रीन किए गए माध्यम से पास करता है, जबकि बंद में विफल नियंत्रण स्वस्थ होने तक अवरुद्ध करता है। सुरक्षा नियंत्रणों के लिए, बंद में विफल होना जानबूझकर विकल्प है, क्योंकि एक नियंत्रण जो चुप्पी से ट्रैफिक को पास करता है कोई सुरक्षा प्रदान नहीं करता है। FedRAMPFedRAMP वर्गीकरण (कम, मध्यम, या उच्च) जो सुरक्षा नियंत्रण सेट करता है एक क्लाउड सेवा को एक दिए गए संवेदनशीलता के अमेरिकी सरकार कार्यभार को संभालने के लिए पूरा करना चाहिए। आवश्यक स्तर कार्यभार द्वारा सेट किया जाता है, और डिलीवरी मार्ग को इसके पर या ऊपर अधिकृत होना चाहिए। GDPRयूरोपीय संघ का डेटा सुरक्षा कानून यह है कि संगठन EU और EEA में लोगों के व्यक्तिगत डेटा को कैसे एकत्र, संसाधित, संग्रहीत, और स्थानांतरित करते हैं। यह व्यक्तियों को अपने डेटा पर अधिकार देता है और प्रसंस्करण के लिए एक कानूनी आधार, डेटा न्यूनतमकरण, और सुरक्षा की आवश्यकता है। HIPAAएक अमेरिकी संघीय कानून व्यक्तियों की स्वास्थ्य जानकारी की सुरक्षा के लिए मानक सेट करता है। यह नियंत्रित करता है कि कवर इकाइयों और उनके व्यावसायिक सहयोगियों द्वारा संरक्षित स्वास्थ्य जानकारी (PHI) का उपयोग, प्रकटीकरण, और सुरक्षा कैसे किया जाता है। जब एक विक्रेता एक कवर इकाई की ओर से PHI को संसाधित करता है, HIPAA को एक व्यावसायिक सहयोगी समझौते (BAA) की आवश्यकता होती है जो प्रत्येक पक्ष की सुरक्षा और देनदारियों को परिभाषित करता है। इस मॉड्यूल में यह एक HIPAA-तैयार योजना या पहली-पक्ष API के तहत एक हस्ताक्षरित BAA के माध्यम से वितरण की आवश्यकता को चलाता है। मानव-इन-द-लूप रूटिंगएक नियम जो आत्मविश्वास, प्रतिवर्तनीयता, और एक गलत उत्तर की लागत के आधार पर निर्णयों को एक व्यक्ति के पास भेजता है, मात्रा के बजाय, समीक्षक को प्री-एक्शन, पोस्ट-एक्शन, या नमूना में रखा जाता है। इंजेक्शन बिंदु (निष्पक्षता)एक विशिष्ट जगह जहां असमान परिणाम एक सिस्टम में प्रवेश कर सकते हैं: पुनर्प्राप्ति कॉर्पस, संकेत फ्रेमिंग, चुने गए उदाहरण, या डाउनस्ट्रीम रूटिंग। उन्हें नाम देना निष्पक्षता को एक आर्किटेक्चर संपत्ति बनाता है जो आप उपकरणीकृत कर सकते हैं बजाय एक मॉडल विशेषता आप मानते हैं। इनपुट स्क्रीनिंगएक जांच जो मॉडल कॉल से पहले चलती है यह तय करने के लिए कि क्या एक अनुरोध मॉडल तक पहुंचना चाहिए, एक मॉडल-आधारित वर्गीकरण का उपयोग करके जेलब्रेक या संकेत-इंजेक्शन पैटर्न जैसे अस्पष्ट आशय के लिए या एक नियतात्मक नियम स्पष्ट पैटर्न के लिए। न्यायाधीश मॉडलएक मॉडल जो विषाक्तता या नीति अनुपालन जैसी गुणवत्ता के लिए दूसरे मॉडल के आउटपुट को स्कोर या वर्गीकृत करने के लिए उपयोग किया जाता है जो एक नियतात्मक नियम विश्वसनीय रूप से एन्कोड नहीं कर सकता। इसे बचा जा सकता है, जो यह है कि इसे नियतात्मक जांच के साथ श्रृंखलाबद्ध क्यों किया जाता है। आउटपुट स्क्रीनिंगएक जांच जो प्रतिक्रिया उपयोगकर्ता तक पहुंचने से पहले चलती है, विषाक्तता जैसी गुणवत्ता के लिए एक मॉडल के साथ उत्पन्न सामग्री को न्यायाधीश करना या ज्ञात स्ट्रिंग और स्कीमा उल्लंघन के लिए एक सत्यापक। टूल-कॉल प्राधिकरणएक जांच किसी भी कार्रवाई से पहले साइड इफेक्ट्स के साथ यह तय करने के लिए कि क्या यह कॉलर इस संदर्भ में यह कार्रवाई कर सकता है। यह नियतात्मक होना चाहिए, इसलिए यह ऑडिट योग्य है। प्रशिक्षण-समय संरेखण बनाम अनुमान-समय नियंत्रणप्रशिक्षण-समय संरेखण तैनाती से पहले मॉडल व्यवहार को आकार देता है। अनुमान-समय नियंत्रण स्क्रीनिंग और प्राधिकरण है जो आप अनुरोध समय पर जोड़ते हैं अपनी तैनाती के लिए विशिष्ट नियमों को लागू करने के लिए। दोनों को भ्रमित करना तैनाती-विशिष्ट नियमों को अप्रवर्तित छोड़ देता है।
स्क्रीन 21: पाँच चीजें जो यहाँ सब कुछ में पकड़ में आती हैं
पुनरावृत्तिमॉड्यूल3 मिनट पाँच चीजें जो यहाँ सब कुछ में पकड़ में आती हैं
01
सुरक्षा परतों का एक स्टैक है, एक सेटिंग नहीं प्रशिक्षण हर अनुरोध के लिए व्यापक नुकसान को कम करता है लेकिन कभी आपके साथी की डोमेन नीति, डेटा नियम, या प्राधिकरण मॉडल को नहीं देखा, इसलिए सीमा स्पष्ट रूप से खींचें और पहचानें कि प्रत्येक परत क्या कवर करता है। खतरनाक विफलता मौन है: यह मानना कि Claude एक नियम को लागू करता है जो किसी परत में नहीं रहता है।
02
एक संरक्षित पथ के तीन नियंत्रण बिंदु और एक चुनी गई विफलता दिशा है इनपुट स्क्रीनिंग, आउटपुट स्क्रीनिंग, और टूल-कॉल प्राधिकरण विभिन्न प्रश्नों का उत्तर देते हैं, इसलिए अंत में केवल एक फ़िल्टर अन्य दोनों को कवर नहीं करता है। नियंत्रण त्रुटियों को बंद करने दें उन निर्णयों के लिए जहां एक गलत पास नुकसान का कारण बनता है, क्योंकि एक गार्डरेल जो चुप्पी से ट्रैफिक को पास करता है सुरक्षा के बिना सुरक्षा का दिखावा देता है।
03
निष्पक्षता और पारदर्शिता उपकरणीकृत हैं, मान नहीं असमान परिणाम उन बिंदुओं पर उत्पन्न होते हैं जो आप नियंत्रित करते हैं, जैसे कॉर्पस, संकेत फ्रेमिंग, उदाहरण, और रूटिंग, इसलिए निष्पक्षता को विक्रेता की जिम्मेदारी के रूप में मानना उन बिंदुओं को अनमॉनिटर छोड़ देता है। हर निर्णय लॉग करें ताकि उपयोगकर्ता, नियामक, और आपकी टीम इसे पुनर्निर्मित कर सकें। यदि आप एक व्याख्या को पुनर्निर्मित नहीं कर सकते, तो आप विश्वसनीय रूप से एक प्रदान नहीं कर सकते।
04
मात्रा के बजाय दांव से समीक्षा रूट करें आत्मविश्वास, प्रतिवर्तनीयता, और एक गलत उत्तर की लागत सेट करते हैं कि कौन से निर्णय एक व्यक्ति को समीक्षा करना चाहिए, इसलिए उच्च-दांव, कम-आत्मविश्वास वाले को एक मानव के पास भेजें इनपुट और फ्लैग कारण के साथ और बाकी को जाने दें। सब कुछ रूटिंग कतार को बाढ़ करता है जब तक समीक्षक बिना पढ़े क्लिक नहीं करते।
05
एक अनुपालन प्रवेश बिंदु एक पूर्वापेक्षा है, और एक साक्ष्य नियंत्रण सेट सबूत है एक विनियमन एक परिणाम बताता है और नियंत्रण को आपके पास छोड़ देता है, इसलिए प्रत्येक दायित्व को एक विशिष्ट नियंत्रण, एक नामित मालिक, और एक जीवंत साक्ष्य कलाकृति में बदलें जो आप समय के साथ पुनः सत्यापित करते हैं। एक नियंत्रण कोई मालिक और कोई साक्ष्य के साथ अंततः गैर-परिचालन हो जाता है और ऑडिट पर विफल हो जाता है, क्योंकि एक समीक्षक जो स्वीकार करता है वह सबूत है कि नियंत्रण जीवंत है, नियंत्रण स्वयं नहीं।
अगला क्या है अगला मॉड्यूल एक जिम्मेदार तैनाती बनाने से इसे हाथ से निकालने और इसकी देखभाल करने के लिए स्थानांतरित होता है। आप आर्किटेक्चर को ले जाएंगे जो आप अब साक्ष्य कर सकते हैं और इसके ट्रेडऑफ को गैर-तकनीकी हितधारकों को संवाद करते हैं, इसे एक मानक के लिए दस्तावेज़ करते हैं, और इसे खोज-से-हाथ-बंद जीवनचक्र के माध्यम से देखभाल करते हैं। नियंत्रण रजिस्टर और स्तरीय सीमा जो आपने यहां बनाई है वह दस्तावेज़ीकरण और आधारभूत बन जाता है जो हाथ-बंद पर निर्भर करता है।
स्रोत
Claude API के साथ निर्माण (Skilljar कोर्स 4), मॉडल ग्रेडर, टूल-कॉल यांत्रिकी, संरचित आउटपुट, और मूल्यांकनकर्ता पैटर्न के लिए उपयोग किया जाता है। platform. claude. com/docs और platform. claude. com, सामग्री संशोधन, गार्डरेल गाइड, स्ट्रीमिंग अस्वीकार, और संरचित आउटपुट के लिए उपयोग किया जाता है। anthropic. com, जनवरी 2026 संविधान और वर्तमान सुरक्षा मुद्रा के लिए उपयोग किया जाता है। Anthropic ट्रस्ट सेंटर और गोपनीयता केंद्र, HIPAA, FedRAMP, और डेटा-निवास मुद्रा के लिए उपयोग किया जाता है। आर्किटेक्ट M1 और M2 स्टोरीबोर्ड, मालिक असाइनमेंट, संदर्भ आर्किटेक्चर, मॉडल और संदर्भ रणनीति, evals, एकीकरण परतें, और अवलोकनीयता के बजाय संदर्भ के लिए उपयोग किया जाता है।
आप AI सिस्टम डिजाइन कर सकते हैं जो सुरक्षा और अनुपालन आवश्यकताओं को पूरा करते हैं। नियंत्रण डिजाइन, साक्ष्य संग्रह, मालिक असाइनमेंट, और ऑडिट-तैयारी, एक नियंत्रण कोई मालिक और कोई साक्ष्य के साथ सबसे महत्वपूर्ण समय विफल हो जाता है।
स्क्रीन 22: बधाई! आपने इस मॉड्यूल को सफलतापूर्वक पूरा किया है।
मॉड्यूल पूर्ण · आर्किटेक्ट · 2 मिनट बधाई! आपने इस मॉड्यूल को सफलतापूर्वक पूरा किया है। मॉड्यूल 3 सुरक्षा ढांचे, जोखिम पहचान, और शासन प्रथाओं को कवर करता है जो जिम्मेदार AI आर्किटेक्ट्स उत्पादन तैनाती से पहले और दौरान लागू करते हैं। एक संरक्षित पथ अंत में एक फ़िल्टर नहीं है, यह हर चरण पर एक नियंत्रण है जहां नुकसान प्रवेश कर सकता है।
0 0 चेकपॉइंट पास किए गए
M1
Claude प्लेटफॉर्म और समाधान डिजाइन मॉडल चयन, संकेत आर्किटेक्चर, टूल डिजाइन, और प्लेटफॉर्म-परत ट्रेडऑफ।
M2
एंटरप्राइज एकीकरण और उत्पादन तैनाती पैटर्न, एकीकरण आर्किटेक्चर, और उत्पादन विश्वसनीयता।
M3
जिम्मेदार AI, सुरक्षा और जोखिम सुरक्षा ढांचे, जोखिम पहचान, और शासन प्रथाएं।
आप यहाँ हैं
M4
हितधारक सगाई, जीवनचक्र और गो-टू-मार्केट हितधारक संचार, जीवनचक्र प्रबंधन, और गो-टू-मार्केट रणनीति।
अगला
M5
टीम सक्षमता और परिचालन उत्पादकता टीम उपकरण कॉन्फ़िगरेशन और परिचालन समर्थन प्रथाएं।
मॉड्यूल की समीक्षा करें शुरू से शुरू करें
No flashcards for this lesson.
No quiz for this lesson yet.