텍스트 유사도 검사기
두 텍스트를 실제 n-gram Jaccard 유사도와 단어 수준 LCS 중첩 점수로 비교하고, 일치하는 구절을 나란히 강조 표시합니다.
🔒 전적으로 귀하의 브라우저에서 처리됩니다. 여기에 입력하는 어떤 것도 업로드되지 않습니다.
결과
이 도구는 붙여 넣은 두 텍스트를 모호한 "비슷해 보인다"는 휴리스틱이 아닌, 독립적이고 실제적이며 잘 문서화된 두 가지 알고리즘으로 비교합니다. 첫 번째는 n-gram Jaccard 유사도입니다. 각 텍스트를 단어로 토큰화한 다음, n개의 연속된 단어가 중첩되어 이어지는 n-gram으로 나눕니다. 기본값은 n=3, 즉 트라이그램이며 1에서 5까지 조절할 수 있습니다. 두 결과 n-gram 집합의 Jaccard 지수, 즉 교집합 크기를 합집합 크기로 나눈 값은 정보 검색과 유사 중복 탐지 전반에서 사용되는 표준 집합 기반 유사도 측정법입니다. n이 클수록 더 긴 공유 구문을 포착하고 정확한 표현에 더 엄격하며, n이 작을수록 더 관대하여 구조가 다른 문장 간의 느슨한 단어 중첩도 잡아냅니다.
두 번째 알고리즘은 진정한 단어 수준 최장 공통 부분 수열(LCS)로, 두 단어 시퀀스에 대한 실제 O(n·m) 동적 계획법 테이블로 계산됩니다. 이는 근사치가 아닌 diff 도구에서 사용하는 것과 동일한 교과서적인 알고리즘입니다. n-gram 점수와 달리 LCS는 일치하는 단어가 연속적일 필요가 없으므로, 문장이 재배열되거나 공유 구문 사이가 가볍게 편집된 경우에도 중첩을 포착합니다. 중첩 백분율은 두 텍스트 평균 길이 대비 LCS 길이로 도출됩니다. 그런 다음 DP 테이블을 역추적하여 각 텍스트에서 가장 긴 공통 시퀀스에 참여한 단어를 정확히 식별하며, 이것이 두드러진 기능입니다. 해당 단어들은 원래의 공백, 줄 바꿈, 문장 부호를 그대로 유지한 채 원본 텍스트에 다시 매핑되어 나란히 강조된 영역으로 렌더링되므로, 단순한 숫자에 의존하지 않고 정확히 어떤 구절이 겹치는지 눈으로 확인할 수 있습니다.
여기서 범위와 정직함이 중요합니다. 이것은 표절 탐지기가 아닌 두 텍스트 비교 도구입니다. 인터넷 연결, 검색 색인, 다른 사람의 콘텐츠를 확인할 데이터베이스가 전혀 없으며, 붙여 넣은 두 텍스트가 서로 얼마나 유사한지만 알려줄 수 있습니다. 따라서 초안 수정본을 비교하거나, 패러프레이즈나 재작성이 실제로 얼마나 바뀌었는지 확인하거나, 자신의 페이지 전반에서 유사 중복 콘텐츠를 발견하는 데 적합합니다. 단어 매칭은 대소문자를 구분하지 않으며, O(n·m) LCS 테이블은 최대 수백만 개의 단어 쌍 셀로 제한됩니다. 매우 큰 텍스트(대략 합쳐서 수천 단어)의 경우 정확한 LCS와 하이라이트 단계는 평이한 안내와 함께 건너뛰고, 선형 시간만 소요되는 n-gram Jaccard 점수는 항상 전체 텍스트에 대해 계산됩니다. 모든 처리는 브라우저 내에서 로컬로 실행되며, 어떤 텍스트도 기기를 떠나지 않습니다.