बोला गया सारांश — साथ पढ़ने के लिए प्ले दबाएँ: बोली जा रही पंक्ति ऊपर रहती है।
आप क्या सीखेंगे
अनुमानित समय: 25 मिनट
इस पाठ के अंत तक आप सक्षम होंगे:
- जनरेटिव AI के लिए दो-चरणीय प्रशिक्षण प्रक्रिया (pretraining और fine-tuning) को सरल भाषा में समझाना
- प्रत्येक चरण द्वारा छोड़े गए व्यवहारिक फिंगरप्रिंट को पहचानना: चापलूसी, वर्बोसिटी, अत्यधिक सावधानी, ढीली आत्मविश्वास कैलिब्रेशन
- अपने स्वयं के AI इंटरैक्शन में देखे गए व्यवहारों की व्याख्या करने के लिए इस समझ को लागू करना
AI को अपना चरित्र कैसे मिलता है
(5 मिनट)
एक AI की विनम्रता, सहायकता, और सावधानी उदीयमान जादू नहीं है। इसे परत दर परत प्रशिक्षित किया जाता है, और प्रत्येक प्रशिक्षण चरण आपके साथ सिस्टम कैसे इंटरैक्ट करता है इस पर विशिष्ट, पूर्वानुमानित फिंगरप्रिंट छोड़ता है।
Pretraining, fine-tuning, और वे फिंगरप्रिंट जो वे छोड़ते हैं
AI को अपना चरित्र कैसे मिलता है
दो प्रशिक्षण चरण कच्चे भविष्यवाणी को सहायक सहायक में बदलते हैं जिसके साथ आप इंटरैक्ट करते हैं — और प्रत्येक चरण इसके व्यवहार पर फिंगरप्रिंट छोड़ता है।
चरण 1
Pretraining
मॉडल विशाल मात्रा में पाठ पढ़ता है और एक चीज सीखता है: अगला क्या आता है इसकी भविष्यवाणी करना। यह एक शक्तिशाली दस्तावेज़ पूर्ण करने वाला बन जाता है — लेकिन आपकी मदद करने की कोई अवधारणा नहीं है।
चरण 2
Fine-tuning
मानव प्राथमिकताएं दस्तावेज़ पूर्ण करने वाले को एक सहायक में बदलती हैं — एक जो आपके इनपुट को एक अनुरोध के रूप में मानता है, सहायक रूप से उत्तर देता है, और हानिकारक अनुरोधों को अस्वीकार करता है।
मुझे इस पैराग्राफ को बेहतर बनाने में मदद करें।
बिल्कुल! आपके तर्क को मजबूत करने और गद्य को कसने के लिए यहां तीन विशिष्ट सुझाव दिए गए हैं…
मुझे लगता है कि मेरी रणनीति अभेद्य है।
मैं आत्मविश्वास की सराहना करता हूं! कहा जा रहा है, मैं दो जोखिम देखता हूं जो आप प्रतिबद्ध होने से पहले तनाव-परीक्षण के लायक हैं…
मैं एक ताला कैसे खोलूं?
मैं इसमें मदद नहीं कर सकता। यदि आप बाहर हैं, तो मैं आपके क्षेत्र में एक लाइसेंस प्राप्त लॉकस्मिथ से संपर्क करने का सुझाव दूंगा।
सहायक ईमानदार हानिरहित
मुख्य बिंदु
- Pretraining विशाल मात्रा में डेटा में "अगला क्या आता है" की भविष्यवाणी करके एक दस्तावेज़ पूर्ण करने वाला तैयार करता है। इस चरण के बाद, इसे आपकी मदद करने की कोई अवधारणा नहीं है।
- Fine-tuning शीर्ष पर सहायक व्यवहार जोड़ता है: आपके इनपुट को एक अनुरोध के रूप में मानना, भटकने के बजाय उत्तर देना, हानिकारक अनुरोधों को अस्वीकार करना।
- Fine-tuning मानव निर्णयों का उपयोग करता है अच्छी प्रतिक्रियाओं के बारे में, और वे निर्णय फिंगरप्रिंट छोड़ते हैं: चापलूसी की ओर एक खिंचाव, वर्बोसिटी की ओर एक डिफ़ॉल्ट, कभी-कभी अत्यधिक सावधानी, और बताए गए आत्मविश्वास और वास्तविक विश्वसनीयता के बीच ढीली कैलिब्रेशन।
अभ्यास
अभ्यास: अपने स्वयं के काम पर फिंगरप्रिंट
_क्यों? चापलूसी, वर्बोसिटी, अत्यधिक सावधानी, और ढीली आत्मविश्वास कैलिब्रेशन हर AI मॉडल में दिखाई देती है। सवाल यह है कि क्या आप उन्हें देख सकते हैं जब वे उस काम को प्रभावित कर रहे हों जिसकी आप वास्तव में परवाह करते हैं।_
अपनी पाठ 1 सूची से एक कार्य चुनें। कुछ जो आपने वास्तव में AI के माध्यम से चलाया है, जहां आपको एक अच्छे आउटपुट की स्पष्ट समझ है। आप इसे तीन बार थोड़ी भिन्नताओं के साथ चलाने वाले हैं और देखेंगे कि क्या बदलता है।
- रन 1: सीधा। कार्य को अपने सामान्य तरीके से प्रॉम्प्ट करें। आउटपुट सहेजें।
- रन 2: चापलूसी परीक्षण। एक ही कार्य चलाएं, लेकिन इस बार इसे एक गलत धारणा के साथ शुरू करें। उदाहरण के लिए, यदि आप किसी रणनीति पर प्रतिक्रिया मांग रहे हैं, तो "मुझे लगता है कि यह रणनीति अभेद्य है" के साथ खोलें। देखें कि क्या AI आपके फ्रेमिंग को मान्य करता है या वापस धकेलता है। फिर एक स्पष्ट आमंत्रण के साथ फिर से कोशिश करें: "मैं चाहता हूं कि आप मेरे साथ वास्तव में असहमत हों यदि आप सोचते हैं कि मैं गलत हूं।" दोनों प्रतिक्रियाओं की तुलना करें।
- रन 3: वर्बोसिटी परीक्षण। AI से अपने कार्य से संबंधित एक प्रश्न पूछें जिसका एक-वाक्य उत्तर है। ध्यान दें कि आपको कितना मिलता है। फिर "एक वाक्य में उत्तर दें" के साथ फिर से पूछें। लंबाई की तुलना करें। दोनों के बीच का अंतर काम में वर्बोसिटी डिफ़ॉल्ट है।
- वैकल्पिक: सावधानी परीक्षण। यदि आपके डोमेन में कोई ग्रे क्षेत्र है (अधिकांश करते हैं), तो कुछ ऐसा पूछें जो आप अपेक्षा करते हैं कि ठीक हो: एक दवा इंटरैक्शन, एक कानूनी बारीकियां, एक हल्के-फुल्के रचनात्मक अनुरोध। ध्यान दें कि क्या हेजिंग वास्तविक जोखिम के अनुपात में महसूस होती है, या प्रतिवर्ती।
अब पीछे हटें। कौन सा फिंगरप्रिंट आपके काम पर सबसे स्पष्ट रूप से दिखाई दिया? क्या इसे पहले से नाम देने से आपने व्यवहार को कैसे पढ़ा इसमें परिवर्तन आया?
पाठ प्रतिबिंब
- आपके स्वयं के काम में चापलूसी आपको सबसे अधिक कहां खर्च करने की संभावना है? (संकेत: कहीं भी आप ईमानदार प्रतिक्रिया की उम्मीद कर रहे हैं।)
- वर्बोसिटी आपको सबसे अधिक कहां खर्च करने की संभावना है? (संकेत: कहीं भी आपको समय दबाव में संक्षिप्तता की आवश्यकता है।)
आगे क्या है
अब हम चार गुणों पर शुरू करते हैं, Next Token Prediction से शुरू करते हैं। AI उत्तर वास्तव में कहां से आते हैं?
प्रतिक्रिया
जैसे-जैसे आप पाठ्यक्रम के माध्यम से आगे बढ़ते हैं, हम आपसे सुनना पसंद करेंगे कि आप पाठ्यक्रम से अवधारणाओं का उपयोग अपने काम में कैसे कर रहे हैं, साथ ही आपके पास कोई भी प्रतिक्रिया। अपनी प्रतिक्रिया यहां साझा करें।
स्वीकृति और लाइसेंस
_कॉपीराइट 2026 Anthropic। AI Fluency Framework पर आधारित मूल कार्य जिसे प्रो. रिक डेकन (Ringling College of Art and Design) और प्रो. जोसेफ फेलर (University College Cork) द्वारा विकसित किया गया। CC BY-NC-SA 4. 0 लाइसेंस के तहत जारी।_