HTML에서 텍스트로 변환기

일반 텍스트 이메일, 텍스트 분석, 단어 수 집계 파이프라인은 모두 HTML을 사람이 실제로 보게 되는 읽기 쉬운 문자열로 변환하여 마크업 잔여물이 남지 않게 해야 합니다. HTML을 붙여넣으면 이 도구가 모든 태그를 제거하고 엔티티를 디코딩하며(&&), 들여쓰기로 인해 생긴 불필요한 공백을 하나로 합쳐, 분석용으로 바로 쓸 수 있고 멀티파트 이메일의 text/plain 부분으로도 적합한 깔끔하고 읽기 쉬운 텍스트 블록을 출력합니다.

HTML을 텍스트로 변환하는 방법

  1. 1

    HTML 붙여넣기

    크기는 상관없습니다. 짧은 코드 조각, 서식이 풍부한 이메일 본문, 전체 페이지 모두 가능합니다.

  2. 2

    변환

    한 번의 클릭: 모든 태그와 속성이 제거되고 엔티티가 디코딩됩니다.

  3. 3

    줄바꿈 확인

    단락, 목록 항목, 표 행이 각각 별도의 줄이 되어 텍스트 구조가 유지됩니다.

  4. 4

    텍스트 복사

    출력은 순수한 유니코드 텍스트이므로 단어 수 계산기, 이메일 템플릿, 감성 분석 모델에 그대로 입력해도 안전합니다.

전환 과정에서 복잡한 태그 처리 방법

HTML을 텍스트로 변환하는 작업은 단순한 string.replace(/<[^>]+>/, "") 이상의 일입니다. 단순한 정규식은 엔티티 코드와 들여쓰기 공백을 그대로 남겨 두고, </p>가 새 줄을 시작해야 한다는 사실을 모릅니다.

블록 수준 태그와 인라인 태그

블록 수준 태그(<br>, 그리고 닫는 태그 </p>, </div>, </h1>부터 </h6>, </li>, </tr>)는 각각 줄바꿈을 만듭니다. 인라인 태그(<a>, <span>, <strong>)는 공백을 남기지 않으므로 단어가 서로 붙지 않습니다.

태그별 처리 방식

태그 처리
<br> 줄바꿈 1회
</p>, </div>, </h1>부터 </h6> 닫는 태그 하나당 줄바꿈 1회
</li>, </tr> 줄바꿈 1회, 목록 글머리 기호나 표 셀 구분자는 추가되지 않음
<a href="url">text</a> text; href 속성은 제거됨
<img alt="text"> 아무것도 출력하지 않음, 태그에 보이는 텍스트가 없음
<script>, <style> 태그는 제거되고, 그 사이의 텍스트는 유지됨

엔티티 디코딩

  • 이름이 있는 엔티티(&amp;, &copy;, &eacute;)는 해당 유니코드 문자로 디코딩됩니다.
  • 숫자형 엔티티(&#169;, &#x00A9;)도 디코딩됩니다.
  • 알 수 없는 엔티티는 있는 그대로 보존되므로 분석 도구에서도 인식할 수 있습니다.

공백 정규화

  • 줄바꿈 앞의 공백과 탭은 제거됩니다.
  • 연속된 빈 줄이 세 줄 이상이면 한 줄의 빈 줄로 줄어듭니다.
  • 단어 사이의 공백은 그대로 유지되며, 변환기는 텍스트를 다시 정렬하지 않습니다.

활용 사례

  • 멀티파트 이메일의 text/plain 부분을 생성합니다.
  • 스크래핑한 기사를 언어 모델에 넘기기 전에 정리합니다.
  • 일반 텍스트 검색 인덱스에 입력합니다.
  • 마크업을 무시한 정확한 단어 수를 계산합니다.

자주 묻는 질문

시각적 서식(굵게, 색상, 글꼴)은 사라집니다, 바로 그것이 목적입니다. 구조는 줄바꿈으로 유지됩니다. 단락, 목록 항목, 표 행이 각각 별도의 줄이 되어 텍스트가 읽기 쉽게 남습니다.

링크의 보이는 텍스트는 남지만 URL은 태그 속성과 함께 제거됩니다. URL이 필요하다면 HTML을 Markdown으로 변환하는 전용 도구를 사용하세요.

변환기는 태그 자체만 제거하고 태그 사이의 텍스트는 유지하므로 <script><style> 블록의 내용이 결과에 남습니다. 원하지 않으면 먼저 원본 HTML에서 제거하세요.

네, 출력 결과는 UTF-8 형식이며 입력 데이터에 포함된 모든 비-ASCII 문자를 그대로 유지합니다. &copy;&eacute;와 같은 엔티티는 각각의 유니코드 등가 문자로 디코딩됩니다.

관련 도구

이 도구는 다른 언어로도 제공됩니다