문자 깨짐 확인 도구

인코딩 가설 비교
붙여넣은 글과 모든 후보는 이 브라우저 안에만 남습니다. 퍼널 모드는 검증된 기록 하나를 이 탭에 최대 30분 동안 보관하고 URL에는 내용을 드러내지 않는 작업 ID만 넣습니다. 당사 서버나 복원 API로 전송되는 내용은 없습니다.

깨져 보이는 글 붙여넣기

café 같은 글이나 인코딩 불일치로 알아볼 수 없게 된 일본어 문자열을 붙여넣으세요. 편집기의 원문은 변경되지 않습니다.

최대 50,000자입니다. 이 도구는 붙여넣은 유니코드 텍스트만 비교하며 파일, 바이트 스트림, 데이터베이스 또는 HTTP 헤더를 검사하거나 복구하지 않습니다.

모지바케는 바이트를 호환되지 않는 문자 집합으로 디코딩해 데이터가 엉뚱한 문자로 표시되는 현상입니다. 예를 들어 UTF-8로 인코딩한 café의 바이트를 Latin-1이나 Windows-1252로 해석하면 café로 보일 수 있습니다. 화면에 보이는 글을 붙여넣으면 엄격하게 되돌릴 수 있는 복원 가설을 비교합니다. 원문은 그대로 유지되고 모든 후보는 가설로 표시되며 비교는 브라우저 안에서만 이루어집니다.

모지바케 복원 가설을 비교하는 방법

  1. 1

    보이는 글을 붙여넣기

    받은 그대로 입력하세요. 원본 파일을 업로드하거나 검사하지 않습니다.

  2. 2

    비교에 동의하기

    Latin-1 및 Windows-1252 바이트 해석을 엄격한 UTF-8 디코더로 시험합니다.

  3. 3

    단정하지 않고 비교하기

    변경되지 않은 원문과 각 가역 후보를 읽고 문맥이 뒷받침할 때만 선택하세요.

  4. 4

    일반 텍스트로 사용하기

    원문을 덮어쓰지 않고 선택한 가설을 복사하거나 TXT로 저장하거나 인쇄하세요.

복원 가설로 알 수 있는 것과 알 수 없는 것

문자 인코딩은 문자와 바이트 사이의 대응을 정합니다. UTF-8은 é를 두 바이트 C3 A9로 표현합니다. 소프트웨어가 이 바이트를 Windows-1252나 ISO-8859-1로 디코딩하면 é로 보일 수 있습니다. 복원 가설은 화면에 보이는 레거시 문자를 바이트 값으로 되돌리고, 그 바이트를 UTF-8로 엄격하게 디코딩한 뒤, 후보를 다시 UTF-8로 인코딩했을 때 같은 바이트가 되는지 확인합니다.

왕복 확인은 불완전하거나 잘못된 UTF-8 시퀀스를 제외합니다. 대체 문자 가 들어간 후보도 이미 정보가 사라졌으므로 제외합니다. 하지만 정확히 왕복 변환된다는 사실은 가설을 뒷받침할 뿐, 원본 시스템의 실제 인코딩이나 작성자가 의도한 글을 증명하지는 않습니다.

화면에 보이는 글 시험하는 가설 가능한 후보 확인할 내용
café UTF-8 바이트를 Latin-1로 읽음 café 원본과 철자를 대조
It’s UTF-8 바이트를 Windows-1252로 읽음 It’s 문장부호와 문서 표기 확인
文字化け UTF-8 바이트를 Latin-1로 읽음 文字化け 신뢰할 수 있는 일본어 원문과 대조
café 두 번 연속 인코딩 오류 café 제한된 두 단계를 모두 확인

일본어에는 문맥이 필요한 이유

일본어 UTF-8 바이트를 잘못된 레거시 문자 집합으로 디코딩하면 긴 라틴 문자, 기호, 제어 문자처럼 보이는 문자가 섞일 수 있습니다. 가역성은 후보를 좁히는 단서가 되지만 짧은 이름이나 문자 하나는 여전히 모호할 수 있습니다. 후보를 원본 문서, 데이터베이스 내보내기 원본, 발신자 또는 믿을 수 있는 다른 사본과 대조하세요.

한계와 더 안전한 복구 방법

이 도구는 브라우저가 이미 유니코드로 디코딩한 텍스트를 받습니다. 이전 단계에서 버려진 바이트를 복구하거나, 바이너리 파일의 인코딩을 추론하거나, 데이터베이스 열을 고치거나, HTTP Content-Type 헤더를 바꿀 수 없습니다. 후보가 없다면 원문을 보관하세요. 가능하면 실제 원본 바이트를 확보해 백업하고, 선언된 인코딩과 실제 인코딩을 확인한 뒤 파일이나 바이트 스트림용 도구로 한 번만 정확히 디코딩하세요. 손상된 글을 유일한 원본에 반복 저장하지 마세요.

자주 묻는 질문

아닙니다. 특정 레거시 바이트 해석이 유효한 UTF-8로 디코딩되고 같은 바이트로 정확히 돌아갔다는 뜻뿐입니다. 여러 해석이 같거나 서로 다른 읽기 쉬운 글을 만들 수 있으므로 문맥과 신뢰할 수 있는 원본이 필요합니다.

화면의 문자가 ISO-8859-1 또는 Windows-1252로 잘못 읽힌 UTF-8 바이트가 아닐 수 있고, 시퀀스가 불완전하거나 대체 문자로 정보가 이미 사라졌을 수 있습니다. 원문을 보관하고 실제 바이트와 인코딩 정보를 확인하세요.

아닙니다. 붙여넣은 유니코드 텍스트만 비교합니다. 파일을 읽거나 인코딩을 감지하거나 데이터베이스에 연결하거나 저장값을 다시 쓰거나 서버 헤더를 고치지 않습니다. 바이트 단위 변환을 하기 전에 원본을 백업하세요.

아닙니다. 비교, 후보 선택, 복사, TXT 생성, 인쇄 준비는 브라우저에서 처리됩니다. 퍼널 모드는 검증된 기록을 이 탭에 최대 30분 보관할 수 있으며 URL에는 내용을 드러내지 않는 작업 ID만 넣습니다.

관련 도구