퍼지 목록 매처

CRM에서 내보낸 데이터를 인보이스 고객 정보가 저장된 스프레드시트와 일치시키거나 두 개의 다른 ERP 시스템에 등록된 공급업체 이름을 매칭할 때는 거의 항상 사소한 차이로 인해 문제가 발생합니다. 예를 들어 “Acme Corp.” 대 “ACME Corporation” 또는 “acme corp.”과 같은 형태의 이름일 수 있습니다. 두 목록을 복사하여 유사도 기준값을 설정하면, 도구는 목록 A의 각 항목에 대해 목록 B에서 가장 적합한 후보를 추천하며, 기준값 이하인 항목은 수동 검토를 위해 표시합니다.

지저분한 두 목록을 매칭하는 방법

  1. 1

    목록 A 붙여넣기

    한 줄에 항목 하나씩, 고객명, 제품 코드, 주소.

  2. 2

    목록 B 붙여넣기

    후보 목록입니다. 대소문자, 공백, 오타의 차이는 괜찮습니다.

  3. 3

    임계값 설정하기

    매칭으로 인정할 유사도 비율입니다(70%가 적절한 기본값입니다).

  4. 4

    보고서를 읽어보세요

    각 A 항목은 최적의 B 후보와 신뢰 점수와 함께 매칭됩니다. 임계값 이하인 항목들은 검토를 위해 표시됩니다.

유사도는 어떻게 측정되는가

이 도구는 PHP의 similar_text(최장 공통 서열 점수)를 사용하여 결과를 백분율로 보고합니다. 값이 높을수록 더 좋으며, 정확한 일치는 100%입니다.

임계값 동작
≥ 95% 거의 동일, 대소문자나 공백 차이만 존재
80–94% 오타, 구두점 누락, 잘린 접미사
60–79% 어순 변경, 약어 대 전체 형태
< 60% 실제 일치가 아닐 가능성이 높음, 수동으로 검토하세요

  • 먼저 정규화하세요. 흔한 잡음을 알고 있다면 소문자화, 구두점 제거, 공백 축소를 적용하면 더 정확한 점수를 얻을 수 있습니다.
  • 회사 접미사를 제거하세요(“Inc”, “Ltd”, “GmbH”). 한쪽 목록에만 일관되지 않게 붙어 있는 경우에 유용합니다.
  • 긴 주소는 분리하세요. “도로명 + 도시”를 따로 매칭하는 편이 하나로 이어붙인 줄을 매칭하는 것보다 효과적입니다.
  • 일대다 매칭에 주의하세요. 이 도구는 각 A 항목에 대해 최적의 B를 선택하지만, 동일한 B가 여러 A 행과 일치하는 것을 막지는 않습니다.

더 엄격한 알고리즘을 사용해야 할 때

대규모 중복 제거 작업에서는 레벤슈타인 거리나 자로-윈클러 방법이 similar_text보다 성능이 뛰어나며, 특히 문자 위치가 중요한 이름에서 그 차이가 두드러집니다. 퍼지 매칭이 청구나 데이터 병합에 영향을 준다면, 대규모로 신뢰하기 전에 무작위 20쌍을 표본 점검하세요.

자주 묻는 질문

70%는 대부분의 정상적인 일치 항목을 탐지하면서 실제 오류 항목도 명확히 표시합니다. 목록 B가 정확하고 거짓 양성 결과를 감수할 수 없다면 기준값을 85%로 높이고, 두 목록 모두 데이터 오류가 많으며 모든 항목을 수동으로 검토할 계획인 경우에는 55%로 완화할 수 있습니다.

네, 하지만 먼저 표준화하세요. 공백, 하이픈, 국가 코드 접두사를 제거하고 이메일 주소는 소문자로 변환하세요. 원시 값에 퍼지 매칭을 적용하면 구조적으로 동일한 항목에도 낮은 점수가 나옵니다.

이 도구는 비교 전에 양쪽 문자를 모두 소문자로 변환하므로 “Apple”와 “apple”은 모두 100%의 점수를 받습니다.

네, 매칭은 서버 측에서 실행되므로 두 목록이 비교를 위해 도구로 전송됩니다. 해당 단일 요청 동안에만 메모리에서 처리되며, 이후에는 저장되거나 로그로 남지 않습니다.

관련 도구

이 도구는 다른 언어로도 제공됩니다