유니코드 문자 분석기
입력 문자열을 유니코드 코드 포인트 단위로 나누고 각 항목의 실제 UTF-8 바이트와 UTF-16 코드 단위를 출력합니다. 화면에서 한 글자로 보이는 결합 문자나 이모지 조합이 여러 행으로 나올 수 있습니다. 최대 2,000 UTF-16 코드 단위를 처리합니다.
주요 기능
- U+ 형식의 코드 포인트를 문자별로 표시합니다.
- TextEncoder로 계산한 UTF-8 바이트를 16진수로 표시합니다.
- UTF-16 surrogate 쌍을 포함한 코드 단위를 함께 비교합니다.
사용 방법
- 확인할 텍스트를 입력하거나 예제를 불러옵니다.
- 실행하면 코드 포인트마다 JSON 한 행이 출력됩니다.
- character, codePoint, utf8, utf16 값을 비교하거나 결과를 복사합니다.
활용 예시
- 같아 보이는 글자의 유니코드 값이 다른지 비교
- 이모지가 UTF-16에서 두 코드 단위인 이유를 확인
- 인코딩 테스트를 위한 UTF-8 바이트 확인
자주 묻는 질문
눈에 보이는 한 글자가 왜 여러 행인가요?
이 도구의 기준은 코드 포인트입니다. e와 결합 악센트, 여러 문자로 조합된 이모지는 하나처럼 보여도 여러 코드 포인트일 수 있습니다.
줄바꿈과 탭은 어떻게 표시되나요?
character 항목은 JSON 문자열이므로 줄바꿈은 \n, 탭은 \t처럼 이스케이프되어 표시됩니다. 각각의 코드 포인트와 바이트도 함께 나옵니다.
입력을 NFC나 NFD로 정규화하나요?
자동 정규화하지 않습니다. 입력에 들어온 코드 포인트 순서를 그대로 분석하므로 조합형과 완성형 차이를 볼 수 있습니다.
UTF-16 값과 UTF-8 값의 차이는 무엇인가요?
UTF-16 항목은 16비트 코드 단위를, UTF-8 항목은 실제 바이트를 16진수로 보여줍니다. 예를 들어 😀는 UTF-16 두 단위, UTF-8 네 바이트입니다.
개인정보 안내
입력과 결과는 브라우저 메모리에서 처리하며 이 도구는 서버로 전송하거나 저장하지 않습니다. 페이지를 떠나거나 초기화하면 사라집니다. 사이트 공통 광고·방문 분석은 별도로 작동할 수 있으나 개별 입력 내용은 도구 사용 집계에 포함하지 않습니다.
댓글과 질문