텍스트에서 URL을 추출합니다

채팅 로그, 마크다운 문서, 이메일 스레드 또는 원시 HTML 데이터를 붙여넣어 포함된 모든 http://https:// 링크를 정리된 목록으로 받아보세요. 이 도구는 끝부분의 구두점을 제거하고 마크다운·HTML 링크 문법을 처리하며 완전히 동일한 중복을 제거하므로, 목록을 크롤러나 아카이브 도구에 바로 넣을 수 있습니다.

URL을 추출하는 방법

  1. 1

    원본을 붙여넣기

    텍스트 또는 HTML을 입력하세요. 따옴표, 각괄호, 마크다운 링크 문법, 끝부분의 구두점은 자동으로 처리됩니다.

  2. 2

    스캔을 실행하세요

    모든 `http://` 및 `https://` 링크를 찾고, 끝부분의 구두점을 제거하며, 완전히 동일한 중복을 삭제합니다.

  3. 3

    개수를 확인하세요

    고유한 URL이 몇 개 발견되었는지와 전체 목록을 확인할 수 있습니다.

  4. 4

    복사하거나 내보내세요

    한 줄에 하나의 URL로, `curl -I`, 아카이버, 스크린샷 서비스 또는 Screaming Frog 시드 목록에 바로 쓸 수 있습니다.

URL로 간주되는 것

URL 탐지는 보이는 것보다 훨씬 어렵습니다. 그래서 이 추출기는 안전한 규칙 하나만 따릅니다. 완전한 http://https:// 링크만 인식하고, 나머지는 텍스트에 그대로 남겨 둡니다.

인식하는 형태

형태 예시
절대 HTTPS https://example.com/path?q=1
절대 HTTP http://example.com
마크다운 링크 대상 [text](https://example.com)
HTML의 절대 href href="https://example.com"

잘라내기 규칙

끝부분의 구두점은 제거되므로 (https://example.com).https://example.com이 됩니다. 공백, 따옴표, 각괄호, 괄호, 대괄호, 쉼표, 세미콜론이 나오면 매칭이 끝납니다. 괄호를 포함한 URL은 첫 번째 여는 괄호에서 잘리므로, 위키백과 스타일 제목은 여는 괄호 앞까지만 수집됩니다.

건너뛰는 내용

  • http 또는 https가 아닌 모든 스키마(mailto:, tel:, ftp: 등).
  • //cdn.example.com/asset.js 같은 프로토콜 상대 링크.
  • example.com/docs/introwww.example.com/page처럼 스키마가 없는 순수 도메인 또는 www 주소.
  • #section 같은 앵커만 있는 조각과 JavaScript 유사 URL.

중복 처리 방식

완전히 동일한 중복은 제거됩니다. https://example.com은 몇 번이 나오든 한 번만 세고, Example.comexample.com은 별도 항목으로 남습니다. 목록은 각 URL이 처음 나타난 순서를 유지합니다.

후처리 팁

  • 정규화 중복 제거를 위해 소문자로 변환하세요. Example.comexample.com을 같은 호스트로 치려면 출력을 소문자로 바꾼 뒤 다시 중복을 제거하세요.
  • 추적 매개변수를 제거하세요. 보관 전에 UTM 클리너로 정리하지 않으면 거의 같은 중복이 수십 개 생깁니다.
  • 상태를 확인하세요. 목록을 확정하기 전에 깨진 링크 검사기에 통과시켜 404 오류를 걸러내세요.

자주 묻는 질문

단축 링크가 전체 스키마와 함께 쓰인 경우에만 인식합니다. bit.ly/xyz 단독으로는 수집되지 않지만 https://bit.ly/xyz는 일반 URL로 취급됩니다. 이 추출기는 리디렉션을 따라가지 않으므로 최종 목적지가 필요하면 별도로 확인하세요.

네, href가 완전한 http:// 또는 https:// URL일 때 가능합니다. 값을 주변 태그 없이 깔끔하게 추출하며, 상대 경로 href는 수집되지 않습니다.

원래 그대로 유지됩니다. utm_* 같은 추적 매개변수를 제거하려면 추출 후 URL 정리 도구를 사용하세요.

아니요. 텍스트는 요청 중에 처리되며 내용은 저장되거나 기록되지 않습니다.

관련 도구

이 도구는 다른 언어로도 제공됩니다