
#2 How LLM Works? | LLM Explained: GPT Architecture | Build Tokeniser in Python #genai #llm
TechSimPlus Learnings
Overview
यह वीडियो लार्ज लैंग्वेज मॉडल्स (LLMs) की कार्यप्रणाली, विशेष रूप से GPT आर्किटेक्चर, और टोकनाइजेशन की प्रक्रिया को समझाता है। इसमें बताया गया है कि LLMs कैसे विशाल टेक्स्ट डेटा पर प्रशिक्षित होते हैं और 'जनरेटिव प्री-ट्रेंड ट्रांसफार्मर' (GPT) के रूप में कैसे काम करते हैं। वीडियो ट्रांसफार्मर आर्किटेक्चर और अटेंशन मैकेनिज्म पर भी प्रकाश डालता है, जो LLMs को इनपुट में शब्दों के बीच संबंध समझने में मदद करते हैं। इसके अतिरिक्त, यह टोकन और टोकन आईडी की अवधारणाओं को स्पष्ट करता है, और दिखाता है कि कैसे टेक्स्ट को टोकन में बदला जाता है और फिर कंप्यूटर द्वारा समझे जाने वाले नंबरों में परिवर्तित किया जाता है। अंत में, यह कॉन्टेक्स्ट विंडो और टोकन लिमिटेशंस के महत्व को समझाता है, खासकर लागत प्रबंधन के संदर्भ में, और इन अवधारणाओं को लागू करने के लिए Python कोड का एक उदाहरण भी प्रस्तुत करता है।
Save this permanently with flashcards, quizzes, and AI chat
Chapters
- LLM का मतलब लार्ज लैंग्वेज मॉडल है, जो विशाल टेक्स्ट डेटा पर प्रशिक्षित आर्टिफिशियल मशीनें हैं।
- GPT का मतलब जनरेटिव प्री-ट्रेंड ट्रांसफार्मर है, जहाँ 'जनरेटिव' का अर्थ नया कंटेंट बनाने की क्षमता है।
- LLMs को पुस्तकों, लेखों और वेबसाइटों जैसे विभिन्न स्रोतों से प्राप्त टेक्स्ट डेटा पर प्रशिक्षित किया जाता है।
- ट्रांसफार्मर एक विशेष न्यूरल नेटवर्क आर्किटेक्चर है जो टेक्स्ट इनपुट को गहराई से समझता है और नया टेक्स्ट जनरेट करता है।
- ट्रांसफार्मर आर्किटेक्चर, जिसे Google ने 2017 में पेश किया था, LLMs की मुख्य तकनीक है।
- अटेंशन मैकेनिज्म ट्रांसफार्मर को इनपुट में विभिन्न शब्दों के बीच संबंध स्थापित करने की क्षमता प्रदान करता है।
- यह मैकेनिज्म LLM को शब्दों के संदर्भ को समझने में मदद करता है, जैसे 'बैंक' शब्द का अर्थ वित्तीय संस्थान या नदी का किनारा हो सकता है।
- ट्रांसफार्मर इनपुट के आधार पर अगले संभावित शब्द की भविष्यवाणी करके टेक्स्ट जनरेट करते हैं, और इस प्रक्रिया को दोहराते हैं।
- कंप्यूटर सीधे टेक्स्ट को नहीं समझ सकते; वे बाइनरी सिस्टम पर काम करते हैं।
- टोकनाइजेशन एक प्रक्रिया है जिसमें इनपुट टेक्स्ट को छोटे टुकड़ों (टोकन) में तोड़ा जाता है, जो अक्सर शब्द या उप-शब्द होते हैं।
- प्रत्येक टोकन को एक यूनिक नंबर (टोकन आईडी) असाइन किया जाता है, जिसे LLM समझ सकता है।
- हर LLM मॉडल की अपनी एक डिक्शनरी होती है जो शब्दों को टोकन आईडी में मैप करती है।
- हगिंग फेस और ओपनएआई जैसे प्लेटफॉर्म टोकन और उनकी आईडी को विज़ुअलाइज़ करने की सुविधा प्रदान करते हैं।
- विभिन्न LLM मॉडल (जैसे GPT-3.5, GPT-4) के लिए टोकन आईडी भिन्न हो सकती हैं।
- Python की 'tiktoken' लाइब्रेरी का उपयोग करके कस्टम टोकनाइज़र बनाए जा सकते हैं।
- कोड के माध्यम से टेक्स्ट को टोकन आईडी में एन्कोड किया जा सकता है और टोकन आईडी को वापस टेक्स्ट में डीकोड किया जा सकता है।
- कॉन्टेक्स्ट विंडो LLM में एक बार में प्रोसेस किए जा सकने वाले टोकन की अधिकतम संख्या को संदर्भित करती है (इनपुट और आउटपुट दोनों)।
- पुरानी LLM में 'मेमोरी फुल' जैसी चेतावनियाँ कॉन्टेक्स्ट विंडो की सीमा के कारण आती थीं।
- LLM सेवाएँ अक्सर उपयोग किए गए टोकन की संख्या के आधार पर शुल्क लेती हैं (जैसे इनपुट और आउटपुट टोकन)।
- मैक्स टोकन को कस्टमाइज़ करना लागत को नियंत्रित करने और LLM के प्रदर्शन को अनुकूलित करने में मदद करता है।
Key takeaways
- LLMs विशाल टेक्स्ट डेटा पर प्रशिक्षित ट्रांसफार्मर-आधारित मॉडल हैं जो मानव भाषा को समझने और उत्पन्न करने में सक्षम हैं।
- ट्रांसफार्मर आर्किटेक्चर में अटेंशन मैकेनिज्म शब्दों के बीच संदर्भ और संबंधों को समझने के लिए महत्वपूर्ण है।
- टोकनाइजेशन टेक्स्ट को छोटे टुकड़ों (टोकन) में तोड़ने और उन्हें संख्यात्मक आईडी में बदलने की प्रक्रिया है, जिसे कंप्यूटर समझ सकते हैं।
- LLM की कॉन्टेक्स्ट विंडो यह निर्धारित करती है कि एक बार में कितने टोकन प्रोसेस किए जा सकते हैं, जो मॉडल की मेमोरी और क्षमता को सीमित करता है।
- LLM सेवाओं की लागत अक्सर इनपुट और आउटपुट टोकन की संख्या पर आधारित होती है, इसलिए टोकन लिमिटेशंस को समझना लागत-प्रभावी उपयोग के लिए आवश्यक है।
- Python जैसी प्रोग्रामिंग भाषाओं का उपयोग करके LLM के टोकनाइजेशन और डीटोकनाइजेशन को प्रोग्रामेटिक रूप से लागू किया जा सकता है।
Key terms
Test your understanding
- LLM कैसे विशाल टेक्स्ट डेटा का उपयोग करके भाषा को समझते और उत्पन्न करते हैं?
- ट्रांसफार्मर आर्किटेक्चर में अटेंशन मैकेनिज्म का क्या महत्व है और यह LLMs को कैसे बेहतर बनाता है?
- टोकनाइजेशन की प्रक्रिया क्या है और यह LLMs के लिए क्यों आवश्यक है?
- कॉन्टेक्स्ट विंडो क्या है और यह LLM के प्रदर्शन और लागत को कैसे प्रभावित करती है?
- Python में 'tiktoken' लाइब्रेरी का उपयोग करके टेक्स्ट को टोकन आईडी में कैसे बदला जा सकता है और फिर वापस टेक्स्ट में कैसे डीकोड किया जा सकता है?