PDF to HTML 변환기

HTML로 변환
다음

이 변환기는 PDF의 텍스트를 읽어 깔끔하고 최소한의 HTML 파일로 감쌉니다. 페이지마다 하나의 <section>, <h2> 페이지 제목, <p> 문단으로 구성됩니다. PDF.js를 사용해 전 과정이 브라우저에서 실행되므로 파일은 절대 업로드되지 않습니다. 결과물은 텍스트만 있는 단순한 HTML로, 열거나 편집하거나 CMS에 붙여 넣은 뒤 직접 만든 CSS로 스타일을 입힐 수 있습니다. 디자인된 페이지를 재현하기 위한 것이 아니라, PDF의 텍스트를 웹에 올리기 위해 만들어졌습니다.

PDF를 HTML로 변환하는 방법

  1. 1

    PDF 선택하기

    텍스트 기반 PDF를 상자에 끌어다 놓거나 클릭해서 찾아보세요. 모든 것이 브라우저 안에 머무릅니다.

  2. 2

    HTML로 변환하기

    PDF.js가 각 페이지를 읽어 텍스트를 추출하고 줄을 문단으로 묶습니다.

  3. 3

    HTML 확인하기

    생성된 마크업이 미리 보기 상자에 표시되어 결과를 확인할 수 있습니다.

  4. 4

    파일 다운로드하기

    페이지마다 하나의 섹션이 담긴 단일 `.html` 파일을 저장하세요. 편집하거나 다시 스타일을 입힐 준비가 되어 있습니다.

결과물은 어떤 모습인가

변환기는 최소한의 구조를 갖춘 유효한 HTML5 파일 하나를 만들어 냅니다.

요소 어디에서 오는가
<!DOCTYPE html> 골격 UTF-8 문자셋을 갖춘 표준 HTML5 래퍼
<title> PDF의 파일 이름
<section data-page> PDF 페이지마다 하나의 블록
<h2>N페이지</h2> 각 페이지의 시작을 표시하는 제목
<p> 세로 간격에 따라 문단으로 묶인 텍스트 줄

하지 않는 것

이것은 텍스트 추출 도구이지 레이아웃 엔진이 아닙니다. 의도적으로 결과물에는 다음이 포함되지 않습니다.

  • PDF의 이미지, 로고, 도판.
  • HTML <table>/<ul>/<ol> 형태의 표, 글머리 기호 목록, 번호 매기기 목록.
  • 원본 글꼴, 색상, 단, 배치.
  • 어떠한 CSS나 인라인 스타일.

읽는 순서대로 배열되어 의미 있는 문단으로 감싸인 단어를 얻을 뿐, 그 밖의 것은 없습니다. 나중에 직접 CSS를 추가하세요.

최상의 결과

  • 텍스트 기반 PDF(리더에서 텍스트를 선택할 수 있는 PDF)를 사용하세요. 스캔했거나 이미지만 있는 PDF에는 텍스트 층이 없고, 여기에는 OCR도 없으므로 그런 페이지의 결과물은 비어 있게 됩니다.
  • 커밋하기 전에 파일을 prettier --parser html이나 포매터에 통과시켜 공백을 정리하세요.
  • WordPress로 옮기시나요? HTML을 시각적 편집기가 아니라 코드/HTML 블록에 붙여 넣으세요. 시각적 편집기는 이를 다시 감싸 버립니다.

레이아웃 도구가 아님

HTML이 PDF처럼 보일 것이라고 기대하지 마세요. 웹은 유동적이고 PDF 페이지는 고정되어 있습니다. 콘텐츠를 웹에 올리고 싶을 때 이 도구를 사용한 다음, 자신의 사이트 CSS로 다시 스타일을 입히세요.

자주 묻는 질문

아니요. 이 도구는 텍스트를 추출해 단순한 문단에 넣습니다. 글꼴, 색상, 단, 배치는 재현되지 않습니다. 결과물에는 직접 만든 CSS로 스타일을 입히세요.

아니요. 텍스트만 추출됩니다. 이미지, 로고, 도판은 HTML로 넘어오지 않습니다.

PDF에 실제 텍스트 층이 있는 경우에만 작동합니다. 스캔했거나 촬영한 페이지는 선택 가능한 텍스트가 없는 이미지이고 여기에는 OCR도 없으므로, 그런 페이지는 텍스트를 만들어 내지 못합니다.

아니요. 변환 전체가 PDF.js를 사용해 브라우저에서 실행됩니다. PDF는 절대 기기를 벗어나지 않으므로 기밀 문서에도 안전합니다.

관련 도구

이 도구는 다른 언어로도 제공됩니다