VidBodh AcademyThe art and science of civil services preparation
English — अंग्रेज़ी में पढ़ें

लार्ज लैंग्वेज मॉडल कैसे काम करता है

प्रारंभिक और मुख्यइस पर समसामयिकी: AI और रोबोटिक्स: प्रौद्योगिकी और भारत की क्षमता

लार्ज लैंग्वेज मॉडल ऐसा प्रोग्राम है जो पाठ का अगला अंश पूर्वानुमानित करता है। पाठ को टोकन में काटा जाता है, हर टोकन को संख्याओं में बदला जाता है, और ट्रांसफॉर्मर प्रकार के तंत्रिका नेटवर्क को विशाल पाठ संग्रह पर एक ही कार्य अरबों बार दोहराकर प्रशिक्षित किया जाता है: अगला टोकन अनुमानित करो, और गलत होने पर मॉडल की आंतरिक संख्याएँ, यानी उसके पैरामीटर, समायोजित करो। उपयोग के समय यह किसी प्रॉम्प्ट का उत्तर एक बार में एक टोकन देकर देता है। चूँकि यह वह उत्पन्न करता है जो संभावित है, न कि जो सत्य है, इसलिए यह असत्य बातें भी धाराप्रवाह कह सकता है: हैलुसिनेशन। "लार्ज" से आशय पैरामीटर से है, जो अब सैकड़ों अरब में हैं, और इसीलिए डेटा सेंटर तथा ग्राफिक्स प्रोसेसर समाचारों में रहते हैं।

पाठ से उत्तर तक

  1. 1 टोकनीकरण

    पाठ को टोकन में काटा जाता है और हर टोकन संख्याओं में बदल जाता है।

  2. 2 पूर्वप्रशिक्षण

    ट्रांसफॉर्मर विशाल संग्रह पर अगला टोकन पूर्वानुमानित करना सीखता है; सीखी हुई संख्याएँ ही पैरामीटर हैं।

  3. 3 संरेखण

    मानव प्रतिपुष्टि उसे निर्देश मानना और अस्वीकार करना सिखाती है।

  4. 4 प्रॉम्प्ट

    उपयोगकर्ता का पाठ और कोई भी पुनःप्राप्त दस्तावेज़ भीतर जाते हैं।

  5. 5 उत्पादन

    एक बार में एक टोकन, हर टोकन संभावित अगले टोकनों में से चुना हुआ।

    Where it breaks: हैलुसिनेशन: संभावित का अर्थ सत्य नहीं।

LLM अगला टोकन पूर्वानुमानित करने वाला है; उसका ज्ञान वही है जो प्रशिक्षण पाठ ने संभावित बनाया।Source: Transformer architecture, Vaswani and others, 2017
  • टोकन अंदर, एक टोकन बाहर, और यही दोहराव: LLM (वृहद भाषा मॉडल) जो कुछ करता है वह प्रॉम्प्ट और अब तक के अपने ही आउटपुट पर अगला टोकन पूर्वानुमानित करना है।
  • पूर्वप्रशिक्षण पाठ से भाषा और तथ्य सीखता है; मानव प्रतिपुष्टि पर प्रशिक्षण का दूसरा दौर उसे निर्देश मानना और कुछ अनुरोध अस्वीकार करना सिखाता है; रिट्रीवल ऑगमेंटेड जनरेशन, जो खोज या दस्तावेज़ भंडार जोड़कर उसके परिणाम प्रॉम्प्ट में रखता है, उपयोग के समय वर्तमान तथ्य जोड़ता है और हैलुसिनेशन घटाता है।
  • पैरामीटर वे सीखी हुई संख्याएँ हैं; कॉन्टेक्स्ट विंडो यह है कि मॉडल एक साथ कितना पाठ विचार में ले सकता है; दोनों लागत तय करते हैं।
  • हैलुसिनेशन संरचनागत है: संभावित वाक्य जाँचा हुआ वाक्य नहीं होता, इसलिए आधार दिए बिना LLM तथ्यों के लिए अविश्वसनीय है।
  • भारत के मॉडल, IndiaAI मिशन के अंतर्गत BharatGen और Sarvam, इस अर्थ में "संप्रभु" हैं कि उन्हें भारत में भारतीय भाषाओं और आँकड़ों पर प्रशिक्षित किया गया है।
  • मुक्त भार मॉडल (open weight model) वह है जिसके प्रशिक्षित पैरामीटर डाउनलोड के लिए जारी किए जाते हैं, इसलिए कोई भी उसे स्थानीय रूप से चला या बदल सकता है; अधिकांश बंद अग्रणी मॉडल ऐसे नहीं हैं, और जिस मॉडल के भार प्रकाशित हो चुके हैं उन्हें वापस नहीं लिया जा सकता, जो मॉडलों पर निर्यात नियंत्रण की सीमा तय करता है।

मुख्य परीक्षा: LLM कंप्यूटिंग शक्ति और पाठ को धाराप्रवाह भाषा में बदलता है; भारत के लिए उसका मूल्य सेवाओं तक भारतीय भाषाओं में पहुँच में है और उसका जोखिम धाराप्रवाह त्रुटि में, इसलिए नीतिगत प्रश्न आँकड़े, कंप्यूट और जवाबदेही हैं, स्वयं मॉडल नहीं।

UPSC पूछ चुका है

  • Prelims 2026: लार्ज लैंग्वेज मॉडल कैसे काम करते हैं

यह भी देखें: IndiaAI मिशन · BHASHINI · भारत की डेटा सेंटर क्षमता · यूरोपीय संघ का AI अधिनियम · कृत्रिम बुद्धिमत्ता का वैश्विक अभिशासन

यह पृष्ठ अंग्रेज़ी पृष्ठ का मशीनी अनुवाद है। संदेह होने पर अंग्रेज़ी पाठ ही प्रामाणिक है। अनुवाद की त्रुटि बताएँ