Lemmatiseur anglais et stemmer de Porter
Réduisez les mots anglais à leur forme de base avec l'algorithme de Porter ou un lemmatiseur basé sur des règles. Comparez les deux côte à côte.
Mis à jour le
English Lemmatizer / Stemmer
Reduce English words to their base forms with the Porter stemmer or a rule-based lemmatizer. All processing stays in your browser.
Input text
Output
Questions Fréquentes
Qu'est-ce que le Lemmatiseur anglais et Porter Stemmer ?
Le Lemmatiseur anglais et Porter Stemmer est un outil en ligne gratuit qui ramène les mots anglais à leur forme de base grâce à l'algorithme Porter Stemmer ou à un lemmatiseur fondé sur des règles. Comparez les deux côte à côte. Il fonctionne entièrement dans votre navigateur, sans installation ni inscription.
Stemming ou lemmatisation ?
Le stemming supprime les terminaisons des mots de façon heuristique (running->run, studies->studi) : les radicaux obtenus ne sont pas toujours de vrais mots. La lemmatisation renvoie la forme de base du dictionnaire (studies->study, went->go), et les lemmes en sont toujours.
Quel algorithme de stemming ?
Le classique Porter Stemmer (Porter, 1980), implémenté dans votre navigateur, avec ses 5 étapes complètes, y compris les conditions de mesure m>0/m>1 et les tests *v*, *o et *d.
Mon texte est-il envoyé à un serveur ?
Non. Tout le stemming, la lemmatisation et l'export se déroulent entièrement dans votre navigateur. Votre texte ne quitte jamais votre appareil.
Le Lemmatiseur anglais et Porter Stemmer est-il gratuit ?
Oui, le Lemmatiseur anglais et Porter Stemmer est 100% gratuit, sans inscription, sans frais cachés et sans limite d'utilisation. Tout le traitement se fait localement dans votre navigateur, garantissant une confidentialité totale.
Mes données sont-elles en sécurité avec cet outil ?
Absolument. Le Lemmatiseur anglais et Porter Stemmer traite tout côté client, dans votre navigateur. Aucune donnée n'est téléversée ni stockée sur un serveur. Votre contenu reste à tout moment privé sur votre appareil.
Le Lemmatiseur anglais et Porter Stemmer fonctionne-t-il sur les appareils mobiles ?
Oui, le Lemmatiseur anglais et Porter Stemmer est entièrement responsive et fonctionne sur smartphones et tablettes. Vous pouvez l'utiliser sur tout appareil doté d'un navigateur web moderne, sans téléchargement d'application.
Dois-je créer un compte pour utiliser cet outil ?
Aucun compte ni inscription n'est nécessaire. Ouvrez simplement le Lemmatiseur anglais et Porter Stemmer dans votre navigateur et commencez à l'utiliser immédiatement. Il n'y a ni barrière d'inscription ni restriction d'usage.
Puis-je traiter de grandes quantités de texte ?
Oui, le Lemmatiseur anglais et Porter Stemmer gère des textes de toute longueur avec un traitement rapide et en temps réel. Comme tout s'exécute dans votre navigateur, les performances dépendent de votre appareil, mais l'outil convient à la plupart des usages.
Comment utiliser le Lemmatiseur anglais et Porter Stemmer ?
Saisissez simplement votre texte dans le champ prévu, ajustez les réglages selon vos préférences, et l'outil le traitera instantanément. Vous pouvez ensuite copier le résultat dans le presse-papiers ou le télécharger.
Quand faut-il utiliser le stemming plutôt que la lemmatisation ?
Optez pour le stemming lorsque la vitesse et une réduction agressive du vocabulaire comptent plus que la production de vrais mots. Le stemming repose sur de simples règles de troncature de suffixes : il est donc rapide et cohérent, ce qui en fait un choix idéal pour les index de recherche, les modèles bag-of-words et la recherche d'information, où "studies", "studied" et "studying" doivent simplement se regrouper sous un seul jeton commun, même si ce jeton est "studi". La lemmatisation est le meilleur choix lorsque le résultat doit être lisible par un humain ou grammaticalement valide, par exemple pour afficher des termes normalisés, construire une liste de mots-clés propre ou alimenter un pipeline basé sur un dictionnaire, car chaque lemme est un mot authentique. De nombreux flux de travail en TAL utilisent le stemming pour la correspondance et la lemmatisation pour la présentation. Cet outil exécute les deux à la fois dans l'onglet Comparer et affiche un pourcentage de réduction distinct pour chacun, afin que vous puissiez voir quelle technique convient à votre texte avant de trancher.
Pourquoi le stemmer de Porter transforme-t-il 'studies' en 'studi' plutôt qu'en 'study' ?
Le stemmer de Porter est un algorithme à base de règles, pas une recherche dans un dictionnaire : il transforme donc les terminaisons selon un motif, sans vérifier si le résultat est un vrai mot. Pour "studies", il applique la règle qui change un "-ies" final en "-i", ce qui produit "studi". Ce stem est volontaire : tous les mots qui partagent la même racine se regroupent sous le même jeton, ce qui est tout ce dont un index de recherche ou un modèle de correspondance textuelle a besoin. Un vrai mot n'est jamais garanti — "argument" et "argue" peuvent même donner des stems différents. Si vous avez besoin de la forme du dictionnaire valide "study", utilisez plutôt la lemmatisation, qui associe "studies" à "study" grâce à des règles de forme de base. Passez à l'onglet Lemmatiseur ici pour obtenir des lemmes lisibles, ou utilisez Comparer pour voir le stem et le lemme de chaque mot côte à côte et repérer précisément où ils divergent.
Que fait l'option 'Supprimer les mots vides', et quand faut-il l'activer ?
L'option Supprimer les mots vides retire les mots-outils très courants — comme "the", "of", "and", "is" et "to" — avant que l'outil ne réduise les mots restants en stems ou en lemmes. Ces mots apparaissent dans presque toutes les phrases mais portent peu de sens thématique : les filtrer permet de ne garder que les termes porteurs de contenu qui distinguent réellement un passage d'un autre. Activez-la lorsque vous construisez un index de recherche, extrayez des mots-clés, comptez des idées distinctes ou préparez du texte pour un modèle bag-of-words, car elle réduit le vocabulaire et le bruit. Laissez-la désactivée lorsque vous avez besoin d'une réduction fidèle, mot pour mot, du texte original, par exemple pour une analyse linguistique où chaque jeton compte. Combinez-la avec les options Minuscules d'abord et Conserver les nombres pour ajuster précisément quels jetons subsistent, puis consultez le panneau de statistiques pour voir combien de mots sont restés.
Que m'indique le pourcentage de réduction sur mon texte ?
Le pourcentage de réduction mesure à quel point votre vocabulaire se réduit une fois que chaque mot a été ramené à sa racine. Il compare le nombre de mots originaux uniques au nombre de stems ou de lemmes uniques : si 200 mots distincts se regroupent en 150 stems distincts, cela représente une réduction de 25 %. Un chiffre plus élevé signifie que votre texte contient de nombreuses variations fléchies des mêmes racines — pluriels, temps verbaux, comparatifs — et véhicule donc moins d'idées vraiment distinctes que ne le suggère le nombre brut de mots. Cet outil affiche un chiffre de réduction distinct pour le stemming et pour la lemmatisation, car le stemmer, plus agressif, regroupe généralement davantage. Cette métrique est utile pour évaluer la richesse lexicale, dimensionner un index de recherche ou vérifier si un texte s'appuie sur des concepts répétés. Collez un passage et observez le panneau de statistiques mettre à jour la réduction en direct au fur et à mesure que vous ajustez les options.
Le lemmatiseur peut-il gérer des mots irréguliers comme 'went', 'feet' ou 'better' ?
Oui. Le lemmatiseur associe des règles de suffixes pour les terminaisons régulières à un dictionnaire intégré de formes irrégulières courantes, ce qui lui permet de résoudre des mots que de simples règles manqueraient. Les verbes irréguliers sont ramenés à leur forme de base — "went" devient "go" et "bought" devient "buy" — les pluriels irréguliers sont gérés, "feet" devenant "foot" et "mice" devenant "mouse", et les comparatifs et superlatifs irréguliers se réduisent également, si bien que "better" et "best" deviennent tous les deux "good". Les terminaisons régulières comme "-s", "-es", "-ies", "-ed", "-ing", "-er" et "-est" sont supprimées par règle. Comme il s'agit d'un lemmatiseur léger et déterministe plutôt que d'un étiqueteur morphosyntaxique complet, il fonctionne sans contexte de phrase, ce qui le rend rapide et prévisible. Chargez la phrase d'exemple intégrée pour voir verbes irréguliers, pluriels et comparatifs tous normalisés en une seule fois, avant de coller votre propre texte.
Embed This Tool
Add a free, live version of this widget to your own website or blog post — it runs entirely in your visitors' browsers, with a credit link back to The Toolbox.
<iframe src="https://getthetoolbox.com/embed/lemmatizer" title="English Lemmatizer & Porter Stemmer — The Toolbox" width="100%" height="300" style="max-width:480px;border:1px solid #e2e8f0;border-radius:12px" loading="lazy"></iframe>
<p style="font-size:12px;margin:4px 0 0"><a href="https://getthetoolbox.com/text-tools/lemmatizer?utm_source=embed&utm_medium=widget" target="_blank" rel="noopener">Free English Lemmatizer & Porter Stemmer</a> by The Toolbox</p>Outils Associés
Compteur de Mots Gratuit en Ligne
Comptez instantanément les mots, caractères, phrases, paragraphes et le temps de lecture. Compteur de mots gratuit en ligne. Fonctionne entièrement dans votre navigateur, sans inscription.
Convertisseur de Casse Gratuit en Ligne
Convertissez le texte en majuscules, minuscules, casse de titre ou de phrase. Convertisseur de casse gratuit en ligne. Fonctionne entièrement dans votre navigateur, sans inscription.
Générateur de Lorem Ipsum Gratuit
Générez du texte de remplissage Lorem Ipsum pour vos projets de conception et de développement. Gratuit, rapide et fonctionne entièrement dans votre navigateur, sans inscription.
Suppresseur de Lignes en Double Gratuit
Supprimez les lignes en double de votre texte tout en conservant l'ordre. Outil gratuit en ligne. Fonctionne entièrement dans votre navigateur, sans inscription.
À propos du lemmatiseur anglais et du stemmer de Porter
Cet outil ramène les mots anglais à leur forme racine de deux façons différentes et vous permet de voir les deux résultats en même temps. Collez n'importe quel texte anglais : chaque mot passe à la fois par le célèbre stemmer de Porter et par un lemmatiseur à règles, puis l'outil affiche côte à côte le mot original, son stem et son lemme. Il s'adresse à toute personne qui travaille le texte au niveau du mot — étudiants en traitement automatique du langage, développeurs qui préparent un index de recherche ou construisent un modèle bag-of-words, linguistes, et rédacteurs qui veulent compter combien d'idées distinctes un passage contient réellement plutôt que combien de mots de surface il utilise.
Tout s'exécute localement dans votre navigateur. Votre texte n'est jamais envoyé sur un serveur, aucune inscription n'est nécessaire, et il n'y a aucune limite de longueur au-delà de ce que votre appareil peut supporter : vous pouvez donc traiter en toute sécurité des brouillons non publiés, des corpus propriétaires ou des notes privées.
Stemming et lemmatisation, côte à côte
Les deux techniques résolvent le même problème — regrouper les formes fléchies autour d'une racine commune — mais elles procèdent différemment, et les voir côte à côte rend la différence évidente.
- Le stemming tronque les terminaisons à l'aide d'heuristiques. Le résultat est un stem, qui n'est pas forcément un vrai mot.
runningdevientrun, maisstudiesdevientstudietargumentpeut donner un résultat différent d'argue. - La lemmatisation renvoie la forme canonique du dictionnaire, appelée lemme, qui est toujours un mot valide.
studiesdevientstudy,wentdevientgo,childrendevientchild, etbetterdevientgood.
Utilisez l'onglet Comparer pour visualiser une copie stemmée de votre paragraphe à côté d'une copie lemmatisée, avec chaque mot modifié mis en évidence. Passez à l'onglet Stemmer de Porter ou Lemmatiseur lorsque vous ne voulez qu'une seule transformation.
Ce qui se cache sous le capot
Le stemmer est une implémentation entièrement réécrite de l'algorithme de stemming de Porter (Porter, 1980) — la même procédure en cinq étapes utilisée comme référence dans d'innombrables systèmes de recherche et de TAL. Il applique l'ensemble complet des conditions, y compris la mesure m (comptage des séquences voyelle-consonne), le test de présence d'une voyelle, ainsi que les vérifications de double consonne et de motif *o cvc : il correspond donc à l'algorithme canonique plutôt que de l'approximer.
Le lemmatiseur associe un dictionnaire de formes irrégulières courantes — verbes irréguliers (was→be, bought→buy), pluriels irréguliers (feet→foot, mice→mouse, people→person) et comparatifs/superlatifs (worse→bad, best→good) — à des règles de suffixes pour les terminaisons régulières -s, -es, -ies, -ed, -ing, -er et -est. C'est un lemmatiseur léger et déterministe, pas un étiqueteur morphosyntaxique complet : il fonctionne donc sans contexte, comme le ferait un pipeline NLP de production.
Options, statistiques et export
Trois options façonnent le traitement : Minuscules d'abord normalise la casse avant la réduction, Supprimer les mots vides retire les mots-outils courants comme the, of et and, et Conserver les nombres détermine si les jetons numériques sont comptabilisés. Au fur et à mesure que vous tapez, un panneau de statistiques indique le nombre total de mots, le nombre de mots uniques, de stems uniques, de lemmes uniques, le pourcentage de réduction des stems (à quel point votre vocabulaire s'est réduit) et le nombre de lignes en double qui ont été fusionnées.
Un tableau des mots répertorie chaque jeton unique avec son stem, son lemme et une étiquette de type de changement (both, stem only, lemma only ou none). Vous pouvez copier les résultats dans le presse-papiers ou les télécharger au format CSV pour les utiliser dans un tableur ou pour alimenter un index de recherche. Chargez la phrase d'exemple intégrée pour voir en une seule fois des verbes irréguliers, des pluriels et des comparatifs traités correctement, avant d'apporter votre propre texte.