공식
편차 = 각 값 − 평균. 분산 = 편차를 제곱해서 평균 낸 것. 표준편차 = 분산의 제곱근.
- 모집단 분산 σ² = Σ(x − x̄)² ÷ n
- 표본 분산 s² = Σ(x − x̄)² ÷ (n − 1)
- 표준편차 = √분산
편차를 그냥 더하면 항상 0이 되기 때문에 제곱해서 더합니다. 제곱하면 단위도 제곱(점²)이 되어 보기 불편하니 다시 제곱근을 씌운 것이 표준편차입니다. 표준편차는 원래 자료와 단위가 같아서 "평균 80점, 표준편차 5점"처럼 바로 읽을 수 있습니다.
모집단 vs 표본, n과 n−1
자료가 관심 대상 전체(우리 반 30명 전원의 점수)면 모집단이고 n으로 나눕니다. 자료가 전체 중 일부(전국 학생 중 30명을 뽑은 것)이고 그걸로 전체를 추정하려면 표본이고 n−1로 나눕니다. 표본의 평균을 써서 편차를 구하면 실제보다 편차가 작게 잡히는 경향이 있어서 n−1로 나눠 보정합니다. 고등학교 교과서의 "분산"은 대부분 모집단(n)이고, 엑셀 STDEV·STDEV.S는 표본(n−1), STDEV.P는 모집단입니다.
변동계수와 z점수
변동계수 = 표준편차 ÷ 평균. 평균이 다른 두 자료의 흩어짐을 비교할 때 씁니다(키 cm와 몸무게 kg처럼 단위가 달라도 됨). z점수 = (값 − 평균) ÷ 표준편차. 그 값이 평균에서 표준편차 몇 개만큼 떨어져 있는지입니다. z가 +2면 상위 약 2.3%, −1이면 하위 약 16%입니다(정규분포 가정).
예제
72, 85, 90, 68, 95, 78, 88 → 평균 82.286, 편차제곱합 609.43. 모집단 분산 87.06, σ = 9.331. 표본 분산 101.57, s = 10.078. 95점의 z점수는 (95−82.29)÷9.33 = 1.36.
자주 묻는 질문
과제에서 어느 쪽을 써야 하나요?
문제에 "표본"이라는 말이 있거나 "추정"을 요구하면 n−1, 주어진 자료 자체의 흩어짐을 묻거나 고등학교 교과 범위면 n으로 나눈 값입니다.
표준편차가 0이면?
모든 값이 같다는 뜻입니다. 이때 z점수는 정의되지 않습니다.