अंग्रेज़ी लेमेटाइज़र और पोर्टर स्टेमर
पोर्टर स्टेमर एल्गोरिदम या नियम-आधारित लेमेटाइज़र से अंग्रेज़ी शब्दों को उनके मूल रूप में बदलें। दोनों की साथ-साथ तुलना करें।
अपडेट किया गया
English Lemmatizer / Stemmer
Reduce English words to their base forms with the Porter stemmer or a rule-based lemmatizer. All processing stays in your browser.
Input text
Output
अक्सर पूछे जाने वाले प्रश्न
English Lemmatizer & Porter Stemmer क्या है?
English Lemmatizer & Porter Stemmer एक मुफ़्त ऑनलाइन टूल है जो Porter Stemmer एल्गोरिदम या नियम-आधारित lemmatizer का उपयोग करके अंग्रेज़ी शब्दों को उनके मूल रूप में बदल देता है। दोनों की तुलना साथ-साथ करें। यह पूरी तरह आपके ब्राउज़र में चलता है, बिना किसी इंस्टॉलेशन या साइन-अप के।
Stemming और lemmatization में क्या अंतर है?
Stemming शब्दों के अंत को अनुमान के आधार पर काट देता है (running->run, studies->studi) — इसके परिणाम हमेशा असली शब्द नहीं होते। Lemmatization शब्दकोश का मूल रूप लौटाता है (studies->study, went->go) — और lemmas हमेशा असली शब्द होते हैं।
कौन-सा stemmer एल्गोरिदम?
क्लासिक Porter Stemmer (Porter 1980), जो आपके ब्राउज़र में लागू किया गया है — इसके सभी 5 चरणों के साथ, जिसमें m>0/m>1 माप शर्तें और *v*, *o तथा *d परीक्षण शामिल हैं।
क्या मेरा टेक्स्ट किसी सर्वर पर भेजा जाता है?
नहीं। सारा stemming, lemmatization और एक्सपोर्ट पूरी तरह आपके ब्राउज़र में ही होता है। आपका टेक्स्ट कभी आपके डिवाइस से बाहर नहीं जाता।
क्या English Lemmatizer & Porter Stemmer उपयोग करने के लिए मुफ़्त है?
हाँ, English Lemmatizer & Porter Stemmer 100% मुफ़्त है, बिना किसी रजिस्ट्रेशन, छिपे शुल्क या उपयोग सीमा के। सारी प्रोसेसिंग आपके ब्राउज़र में स्थानीय रूप से होती है, जिससे पूरी निजता सुनिश्चित होती है।
क्या इस टूल के साथ मेरा डेटा सुरक्षित है?
बिल्कुल। English Lemmatizer & Porter Stemmer सब कुछ आपके ब्राउज़र में क्लाइंट-साइड पर प्रोसेस करता है। कोई डेटा किसी सर्वर पर अपलोड या संग्रहीत नहीं किया जाता। आपकी सामग्री हर समय आपके डिवाइस पर निजी रहती है।
क्या English Lemmatizer & Porter Stemmer मोबाइल डिवाइस पर काम करता है?
हाँ, English Lemmatizer & Porter Stemmer पूरी तरह रिस्पॉन्सिव है और स्मार्टफ़ोन तथा टैबलेट पर काम करता है। आप इसे किसी भी आधुनिक वेब ब्राउज़र वाले डिवाइस पर उपयोग कर सकते हैं — किसी ऐप डाउनलोड की ज़रूरत नहीं।
क्या इस टूल का उपयोग करने के लिए मुझे खाता बनाना होगा?
किसी खाते या रजिस्ट्रेशन की ज़रूरत नहीं है। बस अपने ब्राउज़र में English Lemmatizer & Porter Stemmer खोलें और तुरंत उपयोग शुरू करें। कोई साइन-अप बाधा या उपयोग प्रतिबंध नहीं है।
क्या मैं बड़ी मात्रा में टेक्स्ट प्रोसेस कर सकता हूँ?
हाँ, English Lemmatizer & Porter Stemmer किसी भी लंबाई के टेक्स्ट को तेज़, रियल-टाइम प्रोसेसिंग के साथ संभालता है। चूँकि सब कुछ आपके ब्राउज़र में चलता है, प्रदर्शन आपके डिवाइस पर निर्भर करता है, पर अधिकांश मामलों के लिए यह अच्छा काम करता है।
मैं English Lemmatizer & Porter Stemmer का उपयोग कैसे करूँ?
बस दिए गए फ़ील्ड में अपना इनपुट दर्ज करें, अपनी पसंद के अनुसार कोई भी सेटिंग समायोजित करें, और टूल इसे तुरंत प्रोसेस कर देगा। इसके बाद आप परिणाम को क्लिपबोर्ड पर कॉपी या डाउनलोड कर सकते हैं।
मुझे lemmatization के बजाय stemming का इस्तेमाल कब करना चाहिए?
जब असली शब्द बनाने से ज़्यादा गति और शब्दावली को आक्रामक तरीके से समेटना मायने रखे, तो stemming चुनें। Stemming सरल suffix-काटने वाले नियमों का इस्तेमाल करती है, इसलिए यह तेज़ और consistent है — search indexes, bag-of-words models, और information retrieval के लिए आदर्श, जहाँ "studies", "studied", और "studying" को सिर्फ एक साझा token में मैप होना है, भले ही वह token "studi" ही क्यों न हो। Lemmatization तब बेहतर विकल्प है जब आउटपुट इंसानों के पढ़ने लायक या व्याकरणिक रूप से सही होना ज़रूरी हो, जैसे normalized terms दिखाना, एक साफ keyword list बनाना, या किसी dictionary-based pipeline को डेटा देना, क्योंकि हर lemma एक असली शब्द होता है। कई NLP workflows matching के लिए stemming और presentation के लिए lemmatization इस्तेमाल करते हैं। यह टूल Compare टैब पर दोनों को एक साथ चलाता है और हर एक के लिए अलग reduction percentage दिखाता है, ताकि आप तय कर सकें कि आपके टेक्स्ट के लिए कौन-सी तकनीक सही है।
Porter stemmer 'studies' को 'study' की बजाय 'studi' में क्यों बदल देता है?
Porter stemmer एक rule-based algorithm है, dictionary lookup नहीं, इसलिए यह यह जाँचने के बजाय कि नतीजा असली शब्द है या नहीं, पैटर्न के आधार पर अंत बदल देता है। "studies" के लिए यह वह नियम लागू करता है जो अंतिम "-ies" को "-i" में बदल देता है, जिससे "studi" बनता है। यह stem जानबूझकर ऐसा है: उसी मूल को साझा करने वाला हर शब्द एक ही token में समेट जाता है, जो कि किसी search index या text-matching model के लिए बस इतना ही चाहिए होता है। असली शब्द बनने की कभी गारंटी नहीं होती — "argument" और "argue" तक अलग-अलग तरीके से stem हो सकते हैं। अगर आपको वैध dictionary रूप "study" चाहिए, तो इसके बजाय lemmatization इस्तेमाल करें, जो base-form नियमों का उपयोग करके "studies" को "study" में मैप करता है। पढ़ने लायक lemmas पाने के लिए यहाँ Lemmatizer टैब पर जाएं, या हर शब्द के लिए stem और lemma साथ-साथ देखने और उनमें अंतर पहचानने के लिए Compare का इस्तेमाल करें।
'Remove stop words' विकल्प क्या करता है, और मुझे इसे कब चालू करना चाहिए?
Remove stop words टॉगल बहुत आम function words — जैसे "the", "of", "and", "is", और "to" — को टूल द्वारा बाकी शब्दों को stems या lemmas में घटाने से पहले हटा देता है। ये शब्द लगभग हर वाक्य में आते हैं लेकिन इनका topical अर्थ बहुत कम होता है, इसलिए इन्हें फ़िल्टर करने से आपके पास वे content-bearing terms रह जाते हैं जो असल में एक पैसेज को दूसरे से अलग करते हैं। इसे तब चालू करें जब आप search index बना रहे हों, keywords निकाल रहे हों, अलग विचार गिन रहे हों, या bag-of-words model के लिए टेक्स्ट तैयार कर रहे हों, क्योंकि यह शब्दावली को छोटा करता है और शोर कम करता है। इसे बंद रखें जब आपको मूल टेक्स्ट का वफादार, शब्द-दर-शब्द reduction चाहिए हो, जैसे भाषाई विश्लेषण जहाँ हर token मायने रखता है। इसे Lowercase first और Keep numbers विकल्पों के साथ मिलाकर ठीक-ठीक तय करें कि कौन-से token बचते हैं, फिर देखें statistics पैनल में कि कितने शब्द बचे।
Reduction percentage मेरे टेक्स्ट के बारे में क्या बताता है?
Reduction percentage मापता है कि हर शब्द को उसके मूल रूप में घटाने के बाद आपकी शब्दावली कितनी छोटी हो जाती है। यह अद्वितीय मूल शब्दों की संख्या की तुलना अद्वितीय stems या lemmas की संख्या से करता है: अगर 200 अलग शब्द 150 अलग stems में समेट जाएं, तो यह 25% reduction है। ज़्यादा संख्या का मतलब है कि आपके टेक्स्ट में एक ही मूल के कई विभक्ति-युक्त रूप हैं — बहुवचन, क्रिया के काल, और तुलनात्मक रूप — इसलिए इसमें उतने अलग विचार नहीं हैं जितने कच्ची शब्द-गिनती से लगते हैं। यह टूल stemming और lemmatization के लिए अलग-अलग reduction आँकड़ा दिखाता है, क्योंकि ज़्यादा आक्रामक stemmer आमतौर पर ज़्यादा समेटता है। यह मीट्रिक lexical richness आँकने, search index का आकार तय करने, या यह जाँचने के लिए उपयोगी है कि लेखन दोहराए गए concepts पर कितना निर्भर है। कोई पैसेज पेस्ट करें और विकल्पों को समायोजित करते हुए statistics पैनल में reduction को लाइव अपडेट होते देखें।
क्या lemmatizer 'went', 'feet', या 'better' जैसे अनियमित शब्दों को संभाल सकता है?
हाँ। Lemmatizer नियमित अंत के लिए suffix नियमों को आम अनियमित रूपों की एक बिल्ट-इन डिक्शनरी के साथ जोड़ता है, इसलिए यह उन शब्दों को हल कर देता है जिन्हें सरल नियम छोड़ देते। अनियमित क्रियाएं अपने मूल रूप में मैप होती हैं — "went" बनता है "go" और "bought" बनता है "buy" — अनियमित बहुवचन भी संभाले जाते हैं, जहाँ "feet", "foot" बनता है और "mice", "mouse" बनता है, और अनियमित तुलनात्मक व सर्वोत्तम रूप भी घटते हैं, इसलिए "better" और "best" दोनों "good" बनते हैं। "-s", "-es", "-ies", "-ed", "-ing", "-er", और "-est" जैसे नियमित अंत नियम द्वारा हटा दिए जाते हैं। चूँकि यह एक पूरा part-of-speech tagger नहीं बल्कि एक हल्का, deterministic lemmatizer है, यह वाक्य के context के बिना काम करता है, जो इसे तेज़ और अनुमानित बनाए रखता है। अपना टेक्स्ट पेस्ट करने से पहले, बिल्ट-इन सैंपल वाक्य लोड करके देखें कि अनियमित क्रियाएं, बहुवचन, और तुलनात्मक रूप एक ही पास में कैसे सामान्य होते हैं।
Embed This Tool
Add a free, live version of this widget to your own website or blog post — it runs entirely in your visitors' browsers, with a credit link back to The Toolbox.
<iframe src="https://getthetoolbox.com/embed/lemmatizer" title="English Lemmatizer & Porter Stemmer — The Toolbox" width="100%" height="300" style="max-width:480px;border:1px solid #e2e8f0;border-radius:12px" loading="lazy"></iframe>
<p style="font-size:12px;margin:4px 0 0"><a href="https://getthetoolbox.com/text-tools/lemmatizer?utm_source=embed&utm_medium=widget" target="_blank" rel="noopener">Free English Lemmatizer & Porter Stemmer</a> by The Toolbox</p>संबंधित टूल
मुफ़्त ऑनलाइन वर्ड काउंटर
शब्द, अक्षर, वाक्य, अनुच्छेद और पढ़ने का समय तुरंत गिनें। मुफ़्त ऑनलाइन वर्ड काउंटर टूल। पूरी तरह आपके ब्राउज़र में काम करता है, बिना किसी साइन-अप के।
मुफ़्त ऑनलाइन टेक्स्ट केस कनवर्टर
टेक्स्ट को अपरकेस, लोअरकेस, टाइटल केस या वाक्य केस में बदलें। मुफ़्त ऑनलाइन केस कनवर्टर। पूरी तरह आपके ब्राउज़र में काम करता है, बिना किसी साइन-अप के।
मुफ़्त Lorem Ipsum जनरेटर
डिज़ाइन और डेवलपमेंट प्रोजेक्ट्स के लिए Lorem Ipsum प्लेसहोल्डर टेक्स्ट बनाएं। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में काम करता है, बिना किसी साइन-अप के।
मुफ़्त डुप्लिकेट लाइन रिमूवर
अपने टेक्स्ट से डुप्लिकेट लाइनें हटाएं, क्रम को बनाए रखते हुए। मुफ़्त ऑनलाइन टूल। पूरी तरह आपके ब्राउज़र में काम करता है, बिना किसी साइन-अप के।
English Lemmatizer & Porter Stemmer के बारे में
यह टूल अंग्रेज़ी शब्दों को दो अलग-अलग तरीकों से उनके मूल रूप तक घटाता है और दोनों को एक साथ दिखाता है। कोई भी अंग्रेज़ी टेक्स्ट पेस्ट करें, यह हर शब्द को क्लासिक Porter stemmer और एक rule-based lemmatizer दोनों से गुज़ारता है, फिर मूल शब्द, उसका stem और उसका lemma साथ-साथ दिखाता है। यह उन सभी के लिए बनाया गया है जो शब्द-स्तर पर टेक्स्ट के साथ काम करते हैं — natural language processing सीख रहे students, search index तैयार करने वाले या bag-of-words model बनाने वाले developers, भाषाविद (linguists), और वे लेखक जो यह गिनना चाहते हैं कि किसी पैराग्राफ में असल में कितने अलग विचार हैं, न कि उसमें कितने सतही शब्द इस्तेमाल हुए हैं।
सब कुछ आपके ब्राउज़र में ही लोकल रूप से चलता है। आपका टेक्स्ट कभी अपलोड नहीं होता, कोई साइन-अप नहीं चाहिए, और आपके अपने डिवाइस की क्षमता के अलावा कोई लंबाई सीमा नहीं है, इसलिए आप बेझिझक अप्रकाशित ड्राफ्ट, proprietary corpora, या निजी नोट्स प्रोसेस कर सकते हैं।
Stemming और Lemmatization, साथ-साथ
दोनों तकनीकें एक ही समस्या हल करती हैं — विभक्ति-युक्त (inflected) रूपों को एक साझा मूल पर समेटना — लेकिन दोनों इसे अलग-अलग तरीके से करती हैं, और दोनों को साथ देखने पर यह अंतर स्पष्ट हो जाता है।
- Stemming heuristics का इस्तेमाल करके शब्दों के अंत को काट देती है। इसका आउटपुट एक stem होता है, जिसका असली शब्द होना ज़रूरी नहीं है।
runningबनता हैrun, लेकिनstudiesबनता हैstudiऔरargument,argueसे अलग निकल सकता है। - Lemmatization डिक्शनरी का मूल रूप लौटाती है, जिसे lemma कहते हैं, जो हमेशा एक वैध शब्द होता है।
studiesबनता हैstudy,wentबनता हैgo,childrenबनता हैchild, औरbetterबनता हैgood।
अपने पैराग्राफ का stemmed वर्शन और lemmatized वर्शन साथ-साथ देखने के लिए Compare टैब का इस्तेमाल करें, जिसमें बदला हुआ हर शब्द हाइलाइट होता है। जब आपको सिर्फ एक ही रूपांतरण चाहिए हो, तो Porter Stemmer या Lemmatizer टैब पर जाएं।
इसके पीछे की तकनीक
Stemmer, Porter stemming algorithm (Porter, 1980) का शुरू से बनाया गया इम्प्लीमेंटेशन है — वही पाँच-चरणों वाली प्रक्रिया जिसे अनगिनत search और NLP सिस्टम में baseline के रूप में इस्तेमाल किया जाता है। यह पूरे कंडीशन सेट को लागू करता है, जिसमें m measure (vowel-consonant sequences की गिनती), contains-a-vowel टेस्ट, double-consonant और *o cvc जांच शामिल हैं, इसलिए यह मूल एल्गोरिथ्म का अनुमान भर नहीं लगाता बल्कि उससे पूरी तरह मेल खाता है।
Lemmatizer, आम अनियमित (irregular) रूपों की एक डिक्शनरी को — अनियमित क्रियाएं (was→be, bought→buy), अनियमित बहुवचन (feet→foot, mice→mouse, people→person), और तुलनात्मक व सर्वोत्तम रूप (comparatives और superlatives, जैसे worse→bad, best→good) — नियमित -s, -es, -ies, -ed, -ing, -er, और -est अंत के लिए suffix नियमों के साथ जोड़ता है। यह एक हल्का, deterministic lemmatizer है, न कि पूरा part-of-speech tagger, इसलिए यह किसी production NLP pipeline की तरह बिना context के काम करता है।
विकल्प, आँकड़े, और एक्सपोर्ट
तीन टॉगल इस प्रक्रिया को आकार देते हैं: Lowercase first घटाने से पहले case को सामान्य (normalize) करता है, Remove stop words the, of, और and जैसे आम function words हटा देता है, और Keep numbers तय करता है कि संख्यात्मक टोकन गिने जाएं या नहीं। जैसे-जैसे आप टाइप करते हैं, एक statistics पैनल कुल शब्द, अद्वितीय (unique) शब्द, अद्वितीय stems, अद्वितीय lemmas, stem reduction percentage (यानी आपकी शब्दावली कितनी छोटी हुई), और कितनी डुप्लीकेट पंक्तियाँ समेटी गईं, यह सब दिखाता है।
एक word table हर अद्वितीय टोकन को उसके stem, lemma, और एक change-type टैग (both, stem only, lemma only, या none) के साथ सूचीबद्ध करता है। आप नतीजों को क्लिपबोर्ड पर कॉपी कर सकते हैं या उन्हें spreadsheet में इस्तेमाल के लिए या search index तैयार करने के लिए CSV के रूप में डाउनलोड कर सकते हैं। अपना टेक्स्ट लाने से पहले, बिल्ट-इन सैंपल वाक्य लोड करके एक ही पास में अनियमित क्रियाएं, बहुवचन, और तुलनात्मक रूप संभाले जाते देखें।