텍스트 유사도 검사기
똑같이 들리는 두 개의 지원 티켓, 경쟁사 글과 비슷하게 읽히는 블로그 게시물, 서로 베낀 듯 보이는 두 개의 제품 설명. 직감으로는 겹친다고 느끼지만 숫자가 필요합니다. 이 검사기는 두 텍스트를 비교해 두 가지 점수를 돌려줍니다. 단어 겹침은 두 텍스트가 공통으로 가진 고유 단어의 비율이고, 문자 유사도는 원시 문자가 얼마나 일치하는지입니다. 이 둘을 함께 보면 텍스트가 어휘, 표현, 또는 둘 다를 공유하는지 알 수 있습니다.
유사도를 측정하는 방법
-
1
두 텍스트 붙여넣기
문장 하나부터 글 전체까지 길이는 자유입니다.
-
2
단어 겹침
각 텍스트를 소문자로 바꾸고 고유 단어로 나눕니다. Jaccard 점수는 공통 단어를 서로 다른 단어의 총수로 나눈 값입니다.
-
3
문자 유사도
도구는 원시 문자열도 비교해 일치하는 문자의 백분율을 보고합니다.
-
4
두 점수 함께 읽기
단어 겹침이 높고 문자 유사도가 낮으면 같은 단어가 다른 순서로 있다는 뜻입니다. 문자 유사도가 높으면 두 텍스트가 글자 단위로 거의 동일하다는 뜻입니다.
각 점수가 말해 주는 것
| 점수 | 범위 | 측정 대상 | 사각지대 |
|---|---|---|---|
| 단어 겹침(Jaccard) | 0-100% | 두 텍스트에 공통된 고유 단어의 비율 | 단어 순서와 단어의 반복 빈도를 무시함 |
| 문자 유사도 | 0-100% | 원시 문자열이 얼마나 일치하는가 | 길이와 사소한 편집에 민감함 |
- 단어 겹침이 100%에 가까우면 두 텍스트가 거의 같은 단어 집합을 사용한다는 뜻입니다.
- 문자 유사도가 100%에 가까우면 두 텍스트가 글자 단위로 거의 동일하다는 뜻입니다.
- 큰 격차(단어 겹침이 높고 문자 유사도가 낮음)는 같은 어휘를 다르게 배열했음을 가리킵니다.
계산 예시
The quick brown fox 와 The quick red fox 를 비교합니다.
- 단어 겹침: 60.00% (서로 다른 다섯 단어 중 the, quick, fox 를 공유)
- 문자 유사도: 83.33% (다른 것은 brown 대 red 뿐)
두 숫자를 함께 보면 이야기가 드러납니다. 거의 같은 단어이며, 한 단어를 빼면 거의 같은 문자입니다.
이 도구가 하지 않는 것
이것은 표면적인 문자열 비교이며 표절이나 의미 검사기가 아닙니다.
- 단어와 문자를 비교하므로, 같은 내용을 다른 단어로 표현한 두 글은 낮은 점수를 받습니다.
- 발행된 저작물의 데이터베이스가 없으므로 텍스트가 다른 곳에서 복사되었는지 알려 줄 수 없습니다.
- 의미 기반(의미론적) 대조에는 임베딩 모델이 필요하며, 이 도구는 이를 사용하지 않습니다.
점수는 거의 중복 항목을 빠르게 알아채는 신호로 사용하고, 판정으로 쓰지 마세요.
전처리 팁
- 상용구를 제거하세요(서명, 머리글, 바닥글). 비교 전에 지우면 두 점수가 인위적으로 부풀지 않습니다.
- 공백과 흩어진 문장 부호를 정규화하세요. 서식 차이가 실제 내용 일치를 가리지 않도록 합니다.
- 길이 차이에 주의하세요. 길이가 크게 다르면 짧은 텍스트가 긴 텍스트 안에 들어 있어도 문자 유사도가 낮아지므로, 비교 가능한 구간끼리 비교하세요.
자주 묻는 질문
대략적인 신호로만 사용할 수 있습니다. 붙여넣은 두 텍스트 사이의 단어 겹침과 문자 유사도를 측정할 뿐, 기존 저작물의 데이터베이스가 없어 알 수 없는 출처에서의 복사는 감지하지 못합니다. 높은 점수는 더 자세히 살펴볼 만한 거의 중복 항목을 표시할 뿐입니다.
그리 잘하지는 못합니다. 다시 쓰기가 대부분의 단어를 유지하면 단어 겹침은 높게 유지됩니다. 하지만 동의어로 바꾸면 두 점수 모두 낮아집니다. 도구가 의미가 아니라 단어와 문자를 비교하기 때문입니다. 진짜 바꿔 쓰기를 잡아내려면 의미론적(임베딩) 모델이 필요합니다.
두 점수 모두 긴 텍스트를 다룰 수 있지만, 문자 유사도 비교는 텍스트가 커질수록 느려집니다. 빠른 결과를 위해 각 텍스트를 수천 자 이내로 유지하세요.
두 텍스트는 비교를 위해 저희 서버로 전송되며 저장되지 않습니다. 비교는 단순한 단어와 문자 대조이며, 제3자는 관여하지 않습니다.
관련 도구
교정 기호 참고표
영어권에서 전통적으로 쓰는 대표 교정 기호 14가지를 약호, 본문 표시, 실제 적용 예시와 함께 정리한 참고 자료입니다.
클리셰 탐지기
글을 붙여넣으면 탐지기가 흔한 영어 클리셰 목록과 대조해 각 표현이 몇 번 나오는지 알려 줍니다.
판타지 이름 생성기
엘프, 드워프, 오크, 페어리, 드래곤 등 5가지 스타일로 판타지 이름을 생성합니다. 개수와 형식(이름만, 성명, 칭호 포함)을 골라 D&D 캠페인, 소설, NPC 목록에 활용하세요.
읽기 속도 테스트
짧은 한국어 글을 재고 참고용 요지 질문 하나를 확인하세요.
영어를 피그 라틴어로 변환하기
영어를 피그 라틴어로 번역하고 다시 되돌립니다. 고전적인 자음 군집 이동과 -ay 접미사 규칙을 적용합니다.
헤드캐논 생성기
가상 캐릭터와 OC를 위한 선별된 헤드캐논 프롬프트를 만드세요. 초점, 분위기, 공식 설정과의 거리를 고르면 브라우저 탭 안에서 생성됩니다.
이 도구는 다른 언어로도 제공됩니다
- Trình kiểm tra độ tương đồng văn bản [VI]
- Kontroll av textlikhet [SV]
- Textähnlichkeit prüfen [DE]
- Comprobador de similitud de textos [ES]
- เครื่องมือตรวจความคล้ายของข้อความ [TH]
- مدقق تشابه النصوص [AR]
- Vérificateur de similarité de textes [FR]
- Pemeriksa kemiripan teks [ID]
- Tekstgelijkenis controleren [NL]
- Sprawdzanie podobieństwa tekstów [PL]
- テキスト類似度チェッカー [JA]
- Verificador de similaridade de textos [PT]
- Text Similarity Checker [EN]
- Verifica similarità testi [IT]
- Проверка схожести текстов [RU]
- Metin benzerliği denetleyici [TR]
- 文本相似度检查器 [ZH]