0

Verificador de similaridade de texto

Compare dois textos com similaridade real de n-gram Jaccard e uma pontuação de sobreposição LCS em nível de palavra, com as passagens correspondentes destacadas lado a lado.

Esta ferramenta compara apenas os dois textos que você cola aqui – ela não possui conexão com a Internet, índice de pesquisa ou banco de dados de conteúdo, portanto, não pode verificar se há plágio em outras páginas da web. A correspondência não diferencia maiúsculas de minúsculas; pontuação e quebras de linha são ignoradas durante a pontuação, mas preservadas na visualização destacada abaixo.

Buy Me a Coffee at ko-fi.com
Processando... 0%
Tokenizando ambos os textos em palavras
Calculando similaridade de n-grama Jaccard
Alinhando textos com um LCS de nível de palavra
Renderizando destaques de palavras correspondentes

Resultado

Esta ferramenta compara dois textos que você cola usando dois algoritmos independentes, reais e bem documentados - não uma heurística vaga de "parece semelhante". A primeira é a similaridade de n-gram Jaccard: cada texto é tokenizado em palavras e depois dividido em execuções sobrepostas de n palavras consecutivas (um n-grama; o padrão é n=3, um trigrama, e você pode ajustá-lo de 1 a 5). O índice de Jaccard dos dois conjuntos de n-gramas resultantes - o tamanho de sua interseção dividido pelo tamanho de sua união - é uma medida de similaridade baseada em conjunto padrão usada na recuperação de informações e na detecção de quase duplicatas. Um n mais alto captura frases compartilhadas mais longas e é mais rigoroso quanto ao texto exato; um n mais baixo é mais indulgente e detecta sobreposições soltas de palavras, mesmo entre frases estruturadas de forma diferente.

O segundo algoritmo é uma Subsequência Comum Mais Longa (LCS) genuína em nível de palavra, calculada com uma tabela de programação dinâmica O(n·m) real sobre as duas sequências de palavras - o mesmo algoritmo de livro usado pelas ferramentas diff, não uma aproximação. Ao contrário da pontuação n-gram, o LCS não exige que as palavras correspondentes sejam contíguas, por isso captura a sobreposição mesmo quando uma frase foi reordenada ou levemente editada entre frases compartilhadas. A percentagem de sobreposição é derivada do comprimento LCS relativo ao comprimento médio de ambos os textos. A tabela DP é então retrocedida para identificar com precisão quais palavras em cada texto participaram da sequência comum mais longa, e este é o recurso de destaque: essas palavras são mapeadas de volta ao texto original - com espaçamento original, quebras de linha e pontuação intactas - e renderizadas como trechos destacados lado a lado, para que você possa ver exatamente quais passagens se sobrepõem em vez de confiar em um número simples.

O escopo e a honestidade são importantes aqui: esta é uma ferramenta de comparação de dois textos, não um detector de plágio. Ele não tem conexão com a Internet, nenhum índice de pesquisa e nenhum banco de dados de conteúdo de outras pessoas para verificar - ele só pode dizer o quão semelhantes são os dois textos que você cola. Isso o torna adequado para comparar revisões de rascunhos, verificar o quanto uma paráfrase ou reescrita realmente mudou ou detectar conteúdo quase duplicado em suas próprias páginas. A correspondência de palavras não diferencia maiúsculas de minúsculas, e a tabela O(n·m) LCS é limitada a alguns milhões de células de pares de palavras — para textos muito grandes (aproximadamente alguns milhares de palavras combinadas), o LCS exato e a etapa de realce são ignorados com uma nota em linguagem simples, enquanto a pontuação Jaccard de n-gramas, que custa apenas tempo linear, é sempre calculada no texto completo. Tudo roda localmente no seu navegador; nenhum dos textos sai do seu dispositivo.