유니코드 조회

정체 모를 문자를 넣으세요, 사용자가 붙여 넣은 이상한 공백, 폰트 미리보기의 글리프, 정규식을 깨뜨리는 이모지, 그러면 조회가 유니코드 코드 포인트(U+XXXX)와 16진수로 된 원시 UTF-8 바이트를 문자마다 한 줄씩 반환합니다.

유니코드 문자를 식별하는 방법

  1. 1

    문자 붙여넣기

    글리프 하나나 문자열 전체를 붙여 넣을 수 있습니다: 각 문자가 순서대로 분석됩니다.

  2. 2

    코드 포인트 읽기

    표준 U+ 표기를 대문자로, 최소 4자리 16진수까지 0으로 채워 얻습니다.

  3. 3

    UTF-8 바이트 검사

    문자가 디스크나 전송 시 차지하는 1~4바이트 시퀀스를 봅니다.

  4. 4

    결과 복사

    출력은 CSV 형식 표(문자, 코드 포인트, UTF-8 바이트)로, 스프레드시트나 버그 리포트에 선택해서 붙여 넣을 수 있습니다.

조회로 할 수 있는 전형적인 탐정 작업

대부분의 유니코드 버그는 화면에서 똑같아 보입니다. 일반 공백을 줄바꿈 없는 공백과 구별하거나, 둥근 아포스트로피를 프라임과 구별하는 유일한 방법은 코드 포인트를 검사하는 것입니다.

조회가 해결하는 흔한 함정

보이는 것 실제로는 코드 포인트
공백 줄바꿈 없는 공백 U+00A0
공백 좁은 줄바꿈 없는 공백 U+202F
(없음) 너비 0 공백 U+200B
(없음) 너비 0 결합자 U+200D
아포스트로피 오른쪽 작은따옴표 U+2019
아포스트로피 프라임(피트/분) U+2032
하이픈 엔 대시 U+2013
하이픈 줄바꿈 없는 하이픈 U+2011

UTF-8 바이트 배치 한눈에 보기

  • 1바이트, ASCII, U+0000부터 U+007F (0xxxxxxx)
  • 2바이트, 라틴 보충, 아랍어, 히브리어 (110xxxxx 10xxxxxx)
  • 3바이트, CJK, 대부분의 기호 (1110xxxx 10xxxxxx 10xxxxxx)
  • 4바이트, 이모지, 드문 문자 (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

데이터베이스 열이 고정 바이트 길이라면, 4바이트 이모지는 글리프 하나로 렌더링되어도 네 슬롯을 먹습니다, 잘림 버그의 흔한 원인입니다.

자주 묻는 질문

보통 파일 시작의 BOM 표시(U+FEFF)나 워드 프로세서에서 온 떠도는 너비 0 결합자입니다. 하나를 조회에 붙여 넣으면 즉시 알려주며, 간단한 찾아 바꾸기로 제거할 수 있습니다.

예. 조회는 문자별로 반복하므로 단어 하나가 문자마다 코드 포인트와 UTF-8 바이트가 있는 행을 하나씩 만듭니다.

코드 포인트는 문자의 추상적 정체성입니다, U+00E9는 어디에 저장하든 항상 “é”입니다. UTF-8은 코드 포인트를 바이트로 바꾸는 여러 인코딩 중 하나입니다. 같은 “é”가 UTF-8에서는 두 바이트 C3 A9이지만 Latin-1에서는 단일 바이트 E9입니다.

예. 조회는 저희 서버에서 계산됩니다: 붙여 넣은 문자가 전송되어 분석되고, 코드 포인트와 UTF-8 바이트가 즉시 반환됩니다. 보내신 텍스트는 저장하지 않습니다.

관련 도구

이 도구는 다른 언어로도 제공됩니다