0

Vérificateur de similarité de texte

Comparez deux textes avec une réelle similarité n-gramme Jaccard et un score de chevauchement LCS au niveau des mots, avec les passages correspondants mis en évidence côte à côte.

Cet outil compare uniquement les deux textes que vous collez ici : il n'a pas de connexion Internet, d'index de recherche ou de base de données de contenu, il ne peut donc pas vérifier le plagiat par rapport à d'autres pages Web. La correspondance n'est pas sensible à la casse ; la ponctuation et les sauts de ligne sont ignorés lors de la notation mais conservés dans la vue en surbrillance ci-dessous.

Buy Me a Coffee at ko-fi.com
Traitement... 0%
Tokeniser les deux textes en mots
Calcul de la similarité n-gramme Jaccard
Aligner des textes avec un LCS au niveau des mots
Rendu des surlignages des mots correspondants

Résultat

Cet outil compare deux textes que vous collez à l'aide de deux algorithmes indépendants, réels et bien documentés — et non d'une vague heuristique « qui se ressemble ». La première est la similarité Jaccard n-gramme : chaque texte est tokenisé en mots, puis divisé en séries superposées de n mots consécutifs (un n-gramme ; la valeur par défaut est n = 3, un trigramme, et vous pouvez l'ajuster de 1 à 5). L'indice Jaccard des deux ensembles de n-grammes résultants - la taille de leur intersection divisée par la taille de leur union - est une mesure de similarité standard basée sur un ensemble utilisée pour la récupération d'informations et la détection de quasi-doublons. Un n plus élevé capture une formulation partagée plus longue et est plus strict sur la formulation exacte ; un n inférieur est plus indulgent et détecte les chevauchements de mots lâches, même entre des phrases structurées différemment.

Le deuxième algorithme est une véritable sous-séquence commune la plus longue (LCS) au niveau du mot, calculée avec une véritable table de programmation dynamique O(n·m) sur les deux séquences de mots – le même algorithme de manuel utilisé par les outils de comparaison, pas une approximation. Contrairement au score n-gram, le LCS n'exige pas que les mots correspondants soient contigus, il capture donc les chevauchements même lorsqu'une phrase a été réorganisée ou légèrement modifiée entre des phrases partagées. Le pourcentage de chevauchement est dérivé de la longueur du LCS par rapport à la longueur moyenne des deux textes. La table DP est ensuite revenue en arrière pour identifier précisément quels mots de chaque texte ont participé à cette séquence commune la plus longue, et c'est là la caractéristique la plus remarquable : ces mots sont mappés sur votre texte d'origine - avec son espacement, les sauts de ligne et la ponctuation d'origine intacts - et rendus sous forme d'étendues en surbrillance côte à côte, afin que vous puissiez voir exactement quels passages se chevauchent au lieu de vous fier à un simple nombre.

La portée et l'honnêteté comptent ici : il s'agit d'un outil de comparaison de deux textes, pas d'un détecteur de plagiat. Il n'a pas de connexion Internet, pas d'index de recherche et pas de base de données de contenu d'autres personnes à vérifier - il ne peut que vous dire à quel point les deux textes que vous collez sont similaires l'un à l'autre. Cela le rend bien adapté pour comparer les brouillons de révisions, vérifier dans quelle mesure une paraphrase ou une réécriture a réellement changé, ou repérer le contenu quasi-dupliqué sur vos propres pages. La correspondance des mots n'est pas sensible à la casse et le tableau LCS O(n·m) est limité à quelques millions de cellules de paires de mots — pour les textes très volumineux (environ quelques milliers de mots combinés), l'étape exacte du LCS et de surlignage est ignorée avec une note en langage clair, tandis que le score n-gram Jaccard, qui ne coûte qu'un temps linéaire, est toujours calculé sur le texte intégral. Tout s'exécute localement dans votre navigateur ; aucun texte ne quitte jamais votre appareil.