문자 빈도 분석 (글자별 출현 횟수 · 자모 분해)

글을 붙여넣으면 어떤 글자가 얼마나 자주 쓰였는지 바로 나옵니다. 치환 암호 풀이, 자판 배열·타자 연습 설계, 글꼴에 넣을 글자 고르기, 문체 분석 같은 곳에 씁니다.

1~200
문자 빈도 분석 (글자별 출현 횟수 · 자모 분해)모두의계산기

세는 방법

텍스트를 유니코드 코드 포인트 단위로 나눠 같은 문자끼리 묶습니다. 이모지처럼 두 코드 단위로 된 글자도 하나로 셉니다. 대소문자 통합을 켜면 A와 a를 같은 글자로, 끄면 다른 글자로 봅니다. 공백과 문장 부호는 기본적으로 제외하며 옵션으로 포함할 수 있습니다. 비율은 "집계 대상" 문자 수 기준이므로 옵션을 바꾸면 비율도 함께 달라집니다. 처리는 브라우저 안에서만 이루어지고 입력은 전송되지 않습니다.

한글 자모 분해

한글 음절은 초성 19개, 중성 21개, 종성 28개(없음 포함)의 조합으로 유니코드 AC00부터 순서대로 배치되어 있어 (코드 − AC00)을 588과 28로 나누면 자모가 나옵니다. 분해 옵션을 켜면 "한"은 ㅎ·ㅏ·ㄴ 세 개로 세어지며, 음절 단위로 볼 때보다 훨씬 뚜렷한 분포가 나타납니다. 일반적인 한국어 글에서는 ㅇ·ㄴ·ㄱ·ㅏ·ㅣ·ㅡ가 상위를 차지하는데, 이 순위는 자판 배열(세벌식의 손가락 배치, 두벌식의 좌우 분담)을 설계할 때의 기초 자료입니다. 종성의 겹받침(ㄳ, ㄺ 등)은 하나의 종성으로 세며 더 쪼개지 않습니다.

빈도 분석이 쓰이는 곳

고전적인 용도는 치환 암호 해독입니다. 영어 문장은 e·t·a·o·i·n 순으로 나오는 경향이 뚜렷해서 암호문의 최빈 글자를 e로 가정하는 것이 풀이의 출발점입니다. 그 밖에 폰트 서브셋(웹폰트에 실제 쓰인 글자만 담아 용량 줄이기), 타자 연습 문장 만들기, 특정 글자가 편중된 문체 확인, OCR 결과에서 오인식 글자 찾기(같은 글자가 이상한 기호로 반복되는 경우) 등에 씁니다.

한계

결합 문자(é를 e + 결합 악센트로 적은 경우)는 두 문자로 세어집니다. 한자·가나 등 다른 문자 체계는 "기타 문자"로 묶어 개수만 세지만 개별 빈도표에는 정상적으로 포함됩니다. 매우 긴 텍스트(수백만 자)는 브라우저가 잠시 멈출 수 있습니다.

자주 묻는 질문

단어 단위 빈도는 안 되나요?

단어 빈도 분석 도구가 따로 있습니다. 이 도구는 글자 하나 단위만 다룹니다.

자모 분해 시 ㅘ 같은 이중 모음은요?

중성 21개 체계 그대로 ㅘ를 하나의 중성으로 셉니다. ㅗ+ㅏ로 더 나누지 않습니다.

CSV 복사는 어떤 형식인가요?

문자,횟수,비율 순서의 쉼표 구분 텍스트입니다. 문자는 따옴표로 감싸므로 쉼표나 공백 자체도 안전하게 들어갑니다. 스프레드시트에 바로 붙여넣을 수 있습니다.

함께 보기