NoteTube

#2 How LLM Works? | LLM Explained: GPT Architecture | Build Tokeniser in Python #genai #llm
22:09

#2 How LLM Works? | LLM Explained: GPT Architecture | Build Tokeniser in Python #genai #llm

TechSimPlus Learnings

5 chapters6 takeaways10 key terms5 questions

Overview

यह वीडियो लार्ज लैंग्वेज मॉडल्स (LLMs) की कार्यप्रणाली, विशेष रूप से GPT आर्किटेक्चर, और टोकनाइजेशन की प्रक्रिया को समझाता है। इसमें बताया गया है कि LLMs कैसे विशाल टेक्स्ट डेटा पर प्रशिक्षित होते हैं और 'जनरेटिव प्री-ट्रेंड ट्रांसफार्मर' (GPT) के रूप में कैसे काम करते हैं। वीडियो ट्रांसफार्मर आर्किटेक्चर और अटेंशन मैकेनिज्म पर भी प्रकाश डालता है, जो LLMs को इनपुट में शब्दों के बीच संबंध समझने में मदद करते हैं। इसके अतिरिक्त, यह टोकन और टोकन आईडी की अवधारणाओं को स्पष्ट करता है, और दिखाता है कि कैसे टेक्स्ट को टोकन में बदला जाता है और फिर कंप्यूटर द्वारा समझे जाने वाले नंबरों में परिवर्तित किया जाता है। अंत में, यह कॉन्टेक्स्ट विंडो और टोकन लिमिटेशंस के महत्व को समझाता है, खासकर लागत प्रबंधन के संदर्भ में, और इन अवधारणाओं को लागू करने के लिए Python कोड का एक उदाहरण भी प्रस्तुत करता है।

How was this?

Save this permanently with flashcards, quizzes, and AI chat

Chapters

  • LLM का मतलब लार्ज लैंग्वेज मॉडल है, जो विशाल टेक्स्ट डेटा पर प्रशिक्षित आर्टिफिशियल मशीनें हैं।
  • GPT का मतलब जनरेटिव प्री-ट्रेंड ट्रांसफार्मर है, जहाँ 'जनरेटिव' का अर्थ नया कंटेंट बनाने की क्षमता है।
  • LLMs को पुस्तकों, लेखों और वेबसाइटों जैसे विभिन्न स्रोतों से प्राप्त टेक्स्ट डेटा पर प्रशिक्षित किया जाता है।
  • ट्रांसफार्मर एक विशेष न्यूरल नेटवर्क आर्किटेक्चर है जो टेक्स्ट इनपुट को गहराई से समझता है और नया टेक्स्ट जनरेट करता है।
यह समझना महत्वपूर्ण है कि LLMs कैसे काम करते हैं, क्योंकि यह उनकी क्षमताओं और सीमाओं को जानने में मदद करता है, जो उन्हें प्रभावी ढंग से उपयोग करने के लिए आवश्यक है।
चैटजीपीटी का उपयोग करना, जो एक लोकप्रिय LLM है और GPT आर्किटेक्चर पर आधारित है।
  • ट्रांसफार्मर आर्किटेक्चर, जिसे Google ने 2017 में पेश किया था, LLMs की मुख्य तकनीक है।
  • अटेंशन मैकेनिज्म ट्रांसफार्मर को इनपुट में विभिन्न शब्दों के बीच संबंध स्थापित करने की क्षमता प्रदान करता है।
  • यह मैकेनिज्म LLM को शब्दों के संदर्भ को समझने में मदद करता है, जैसे 'बैंक' शब्द का अर्थ वित्तीय संस्थान या नदी का किनारा हो सकता है।
  • ट्रांसफार्मर इनपुट के आधार पर अगले संभावित शब्द की भविष्यवाणी करके टेक्स्ट जनरेट करते हैं, और इस प्रक्रिया को दोहराते हैं।
अटेंशन मैकेनिज्म LLMs को भाषा की बारीकियों को समझने में सक्षम बनाता है, जिससे वे अधिक सुसंगत और प्रासंगिक प्रतिक्रियाएँ उत्पन्न कर पाते हैं।
वाक्य 'The bank was too steep to climb' में, अटेंशन मैकेनिज्म 'bank' और 'climb' के बीच संबंध को समझकर यह निर्धारित करता है कि यहाँ 'बैंक' का मतलब नदी का किनारा है।
  • कंप्यूटर सीधे टेक्स्ट को नहीं समझ सकते; वे बाइनरी सिस्टम पर काम करते हैं।
  • टोकनाइजेशन एक प्रक्रिया है जिसमें इनपुट टेक्स्ट को छोटे टुकड़ों (टोकन) में तोड़ा जाता है, जो अक्सर शब्द या उप-शब्द होते हैं।
  • प्रत्येक टोकन को एक यूनिक नंबर (टोकन आईडी) असाइन किया जाता है, जिसे LLM समझ सकता है।
  • हर LLM मॉडल की अपनी एक डिक्शनरी होती है जो शब्दों को टोकन आईडी में मैप करती है।
टोकनाइजेशन LLMs के लिए टेक्स्ट डेटा को प्रोसेस करने योग्य प्रारूप में बदलने का एक अनिवार्य कदम है, जिससे वे भाषा को समझ और उत्पन्न कर सकें।
वाक्य 'Who is the PM of India?' को 'Who', ' is', ' the', ' PM', ' of', ' India', '?' जैसे टोकन में तोड़ना और फिर प्रत्येक को एक विशिष्ट संख्यात्मक आईडी देना।
  • हगिंग फेस और ओपनएआई जैसे प्लेटफॉर्म टोकन और उनकी आईडी को विज़ुअलाइज़ करने की सुविधा प्रदान करते हैं।
  • विभिन्न LLM मॉडल (जैसे GPT-3.5, GPT-4) के लिए टोकन आईडी भिन्न हो सकती हैं।
  • Python की 'tiktoken' लाइब्रेरी का उपयोग करके कस्टम टोकनाइज़र बनाए जा सकते हैं।
  • कोड के माध्यम से टेक्स्ट को टोकन आईडी में एन्कोड किया जा सकता है और टोकन आईडी को वापस टेक्स्ट में डीकोड किया जा सकता है।
यह व्यावहारिक कार्यान्वयन दिखाता है कि टोकनाइजेशन कैसे काम करता है और डेवलपर्स कैसे अपने अनुप्रयोगों में LLM के साथ इंटरैक्ट करने के लिए इसका उपयोग कर सकते हैं।
Google Colab में 'tiktoken' लाइब्रेरी का उपयोग करके 'Who is the PM of India?' टेक्स्ट के लिए टोकन आईडी जनरेट करना और फिर उन आईडी को वापस टेक्स्ट में डीकोड करना।
  • कॉन्टेक्स्ट विंडो LLM में एक बार में प्रोसेस किए जा सकने वाले टोकन की अधिकतम संख्या को संदर्भित करती है (इनपुट और आउटपुट दोनों)।
  • पुरानी LLM में 'मेमोरी फुल' जैसी चेतावनियाँ कॉन्टेक्स्ट विंडो की सीमा के कारण आती थीं।
  • LLM सेवाएँ अक्सर उपयोग किए गए टोकन की संख्या के आधार पर शुल्क लेती हैं (जैसे इनपुट और आउटपुट टोकन)।
  • मैक्स टोकन को कस्टमाइज़ करना लागत को नियंत्रित करने और LLM के प्रदर्शन को अनुकूलित करने में मदद करता है।
कॉन्टेक्स्ट विंडो और टोकन लिमिटेशंस को समझना LLM अनुप्रयोगों के विकास और लागत प्रबंधन के लिए महत्वपूर्ण है, क्योंकि यह सीधे तौर पर मॉडल की क्षमता और उपयोग की लागत को प्रभावित करता है।
OpenAI के मॉडल के लिए प्रति 1 मिलियन टोकन इनपुट और आउटपुट के लिए अलग-अलग मूल्य निर्धारण, जो दर्शाता है कि टोकन की मात्रा सीधे लागत को कैसे प्रभावित करती है।

Key takeaways

  1. 1LLMs विशाल टेक्स्ट डेटा पर प्रशिक्षित ट्रांसफार्मर-आधारित मॉडल हैं जो मानव भाषा को समझने और उत्पन्न करने में सक्षम हैं।
  2. 2ट्रांसफार्मर आर्किटेक्चर में अटेंशन मैकेनिज्म शब्दों के बीच संदर्भ और संबंधों को समझने के लिए महत्वपूर्ण है।
  3. 3टोकनाइजेशन टेक्स्ट को छोटे टुकड़ों (टोकन) में तोड़ने और उन्हें संख्यात्मक आईडी में बदलने की प्रक्रिया है, जिसे कंप्यूटर समझ सकते हैं।
  4. 4LLM की कॉन्टेक्स्ट विंडो यह निर्धारित करती है कि एक बार में कितने टोकन प्रोसेस किए जा सकते हैं, जो मॉडल की मेमोरी और क्षमता को सीमित करता है।
  5. 5LLM सेवाओं की लागत अक्सर इनपुट और आउटपुट टोकन की संख्या पर आधारित होती है, इसलिए टोकन लिमिटेशंस को समझना लागत-प्रभावी उपयोग के लिए आवश्यक है।
  6. 6Python जैसी प्रोग्रामिंग भाषाओं का उपयोग करके LLM के टोकनाइजेशन और डीटोकनाइजेशन को प्रोग्रामेटिक रूप से लागू किया जा सकता है।

Key terms

Large Language Model (LLM)Generative Pre-trained Transformer (GPT)Transformer ArchitectureAttention MechanismTokenTokenizationToken IDTokenizerContext WindowMax Tokens

Test your understanding

  1. 1LLM कैसे विशाल टेक्स्ट डेटा का उपयोग करके भाषा को समझते और उत्पन्न करते हैं?
  2. 2ट्रांसफार्मर आर्किटेक्चर में अटेंशन मैकेनिज्म का क्या महत्व है और यह LLMs को कैसे बेहतर बनाता है?
  3. 3टोकनाइजेशन की प्रक्रिया क्या है और यह LLMs के लिए क्यों आवश्यक है?
  4. 4कॉन्टेक्स्ट विंडो क्या है और यह LLM के प्रदर्शन और लागत को कैसे प्रभावित करती है?
  5. 5Python में 'tiktoken' लाइब्रेरी का उपयोग करके टेक्स्ट को टोकन आईडी में कैसे बदला जा सकता है और फिर वापस टेक्स्ट में कैसे डीकोड किया जा सकता है?

Turn any lecture into study material

Paste a YouTube URL, PDF, or article. Get flashcards, quizzes, summaries, and AI chat — in seconds.

No credit card required