0

Verifica similarità testuale

Confronta due testi con la reale similarità di Jaccard su n-grammi e un punteggio di sovrapposizione LCS a livello di parola, visualizzando i passaggi corrispondenti affiancati ed evidenziati.

🔒 Elaborato interamente nel tuo browser: nulla di ciò che inserisci qui verrà mai caricato.

Questo strumento confronta solo i due testi che incolli qui — non ha connessione internet, indice di ricerca o database di contenuti, quindi non può verificare il plagio rispetto ad altre pagine web. Il confronto non distingue tra maiuscole e minuscole; la punteggiatura e le interruzioni di riga vengono ignorate nel calcolo del punteggio ma preservate nella vista evidenziata sottostante.

Elaborazione... 0%
Tokenizzazione dei due testi in parole
Calcolo della similarità di Jaccard sugli n-grammi
Allineamento dei testi con LCS a livello di parola
Visualizzazione delle parole corrispondenti evidenziate

Risultato

Questo strumento confronta due testi incollati dall'utente usando due algoritmi indipendenti, reali e ben documentati — non una vaga euristica «sembra simile». Il primo è la similarità di Jaccard su n-grammi: ogni testo viene tokenizzato in parole e poi suddiviso in sequenze sovrapposte di n parole consecutive (un n-gramma; il valore predefinito è n=3, un trigramma, regolabile da 1 a 5). L'indice di Jaccard dei due insiemi di n-grammi risultanti — la dimensione dell'intersezione divisa per la dimensione dell'unione — è una misura di similarità standard basata sugli insiemi, usata nel recupero delle informazioni e nel rilevamento di duplicati approssimati. Un valore più alto di n cattura frasi più lunghe ed è più rigoroso sulla precisione lessicale; un valore più basso è più tollerante e rileva sovrapposizioni generiche di parole anche tra frasi strutturate diversamente.

Il secondo algoritmo è un'autentica Sottosequenza Comune più Lunga (LCS) a livello di parola, calcolata con una vera tabella di programmazione dinamica O(n·m) sulle due sequenze di parole — lo stesso algoritmo da manuale usato dagli strumenti diff, non un'approssimazione. A differenza del punteggio basato sugli n-grammi, la LCS non richiede che le parole corrispondenti siano contigue, quindi cattura sovrapposizioni anche quando una frase è stata riordinata o modificata leggermente tra le parti in comune. La percentuale di sovrapposizione deriva dalla lunghezza della LCS rapportata alla lunghezza media dei due testi. La tabella DP viene poi ripercorsa all'indietro per identificare precisamente quali parole di ciascun testo hanno fatto parte di quella sottosequenza comune più lunga, e questo è l'aspetto distintivo: quelle parole vengono riportate sul testo originale — con la spaziatura, le interruzioni di riga e la punteggiatura originali intatte — e visualizzate come segmenti evidenziati uno accanto all'altro, così puoi vedere esattamente quali passaggi si sovrappongono invece di fidarti di un semplice numero.

Ambito e onestà sono importanti: questo è uno strumento di confronto tra due testi, non un rilevatore di plagio. Non ha una connessione internet, nessun indice di ricerca e nessun database di contenuti di terzi su cui eseguire verifiche — può solo dirti quanto sono simili tra loro i due testi che hai incollato. Questo lo rende adatto a confrontare revisioni di bozze, verificare quanto una parafrasi o una riscrittura abbia effettivamente modificato il testo, o individuare contenuti quasi duplicati tra le tue pagine. Il confronto tra le parole non distingue tra maiuscole e minuscole, e la tabella LCS O(n·m) è limitata a qualche milione di coppie di parole — per testi molto lunghi (indicativamente qualche migliaio di parole in totale) il calcolo esatto della LCS e l'evidenziazione vengono saltati con una nota in linguaggio semplice, mentre il punteggio di Jaccard sugli n-grammi, che ha un costo lineare, viene sempre calcolato sull'intero testo. Tutto il processo avviene localmente nel tuo browser; nessuno dei due testi lascia mai il tuo dispositivo.