लार्ज लैंग्वेज मॉडल कैसे काम करता है
प्रारंभिक और मुख्यइस पर समसामयिकी: AI और रोबोटिक्स: प्रौद्योगिकी और भारत की क्षमता
लार्ज लैंग्वेज मॉडल ऐसा प्रोग्राम है जो पाठ का अगला अंश पूर्वानुमानित करता है। पाठ को टोकन में काटा जाता है, हर टोकन को संख्याओं में बदला जाता है, और ट्रांसफॉर्मर प्रकार के तंत्रिका नेटवर्क को विशाल पाठ संग्रह पर एक ही कार्य अरबों बार दोहराकर प्रशिक्षित किया जाता है: अगला टोकन अनुमानित करो, और गलत होने पर मॉडल की आंतरिक संख्याएँ, यानी उसके पैरामीटर, समायोजित करो। उपयोग के समय यह किसी प्रॉम्प्ट का उत्तर एक बार में एक टोकन देकर देता है। चूँकि यह वह उत्पन्न करता है जो संभावित है, न कि जो सत्य है, इसलिए यह असत्य बातें भी धाराप्रवाह कह सकता है: हैलुसिनेशन। "लार्ज" से आशय पैरामीटर से है, जो अब सैकड़ों अरब में हैं, और इसीलिए डेटा सेंटर तथा ग्राफिक्स प्रोसेसर समाचारों में रहते हैं।
पाठ से उत्तर तक
1 टोकनीकरण
पाठ को टोकन में काटा जाता है और हर टोकन संख्याओं में बदल जाता है।
2 पूर्वप्रशिक्षण
ट्रांसफॉर्मर विशाल संग्रह पर अगला टोकन पूर्वानुमानित करना सीखता है; सीखी हुई संख्याएँ ही पैरामीटर हैं।
3 संरेखण
मानव प्रतिपुष्टि उसे निर्देश मानना और अस्वीकार करना सिखाती है।
4 प्रॉम्प्ट
उपयोगकर्ता का पाठ और कोई भी पुनःप्राप्त दस्तावेज़ भीतर जाते हैं।
5 उत्पादन
एक बार में एक टोकन, हर टोकन संभावित अगले टोकनों में से चुना हुआ।
Where it breaks: हैलुसिनेशन: संभावित का अर्थ सत्य नहीं।
- टोकन अंदर, एक टोकन बाहर, और यही दोहराव: LLM (वृहद भाषा मॉडल) जो कुछ करता है वह प्रॉम्प्ट और अब तक के अपने ही आउटपुट पर अगला टोकन पूर्वानुमानित करना है।
- पूर्वप्रशिक्षण पाठ से भाषा और तथ्य सीखता है; मानव प्रतिपुष्टि पर प्रशिक्षण का दूसरा दौर उसे निर्देश मानना और कुछ अनुरोध अस्वीकार करना सिखाता है; रिट्रीवल ऑगमेंटेड जनरेशन, जो खोज या दस्तावेज़ भंडार जोड़कर उसके परिणाम प्रॉम्प्ट में रखता है, उपयोग के समय वर्तमान तथ्य जोड़ता है और हैलुसिनेशन घटाता है।
- पैरामीटर वे सीखी हुई संख्याएँ हैं; कॉन्टेक्स्ट विंडो यह है कि मॉडल एक साथ कितना पाठ विचार में ले सकता है; दोनों लागत तय करते हैं।
- हैलुसिनेशन संरचनागत है: संभावित वाक्य जाँचा हुआ वाक्य नहीं होता, इसलिए आधार दिए बिना LLM तथ्यों के लिए अविश्वसनीय है।
- भारत के मॉडल, IndiaAI मिशन के अंतर्गत BharatGen और Sarvam, इस अर्थ में "संप्रभु" हैं कि उन्हें भारत में भारतीय भाषाओं और आँकड़ों पर प्रशिक्षित किया गया है।
- मुक्त भार मॉडल (open weight model) वह है जिसके प्रशिक्षित पैरामीटर डाउनलोड के लिए जारी किए जाते हैं, इसलिए कोई भी उसे स्थानीय रूप से चला या बदल सकता है; अधिकांश बंद अग्रणी मॉडल ऐसे नहीं हैं, और जिस मॉडल के भार प्रकाशित हो चुके हैं उन्हें वापस नहीं लिया जा सकता, जो मॉडलों पर निर्यात नियंत्रण की सीमा तय करता है।
मुख्य परीक्षा: LLM कंप्यूटिंग शक्ति और पाठ को धाराप्रवाह भाषा में बदलता है; भारत के लिए उसका मूल्य सेवाओं तक भारतीय भाषाओं में पहुँच में है और उसका जोखिम धाराप्रवाह त्रुटि में, इसलिए नीतिगत प्रश्न आँकड़े, कंप्यूट और जवाबदेही हैं, स्वयं मॉडल नहीं।
UPSC पूछ चुका है
- Prelims 2026: लार्ज लैंग्वेज मॉडल कैसे काम करते हैं
यह भी देखें: IndiaAI मिशन · BHASHINI · भारत की डेटा सेंटर क्षमता · यूरोपीय संघ का AI अधिनियम · कृत्रिम बुद्धिमत्ता का वैश्विक अभिशासन
यह पृष्ठ अंग्रेज़ी पृष्ठ का मशीनी अनुवाद है। संदेह होने पर अंग्रेज़ी पाठ ही प्रामाणिक है। अनुवाद की त्रुटि बताएँ