평균·중앙값·표준편차는 각각 무엇을 말하나
평균은 모든 값을 더해 개수로 나눈 값입니다. 자료 전체를 한 숫자로 요약하지만 극단값 하나에 크게 흔들립니다. 중앙값은 값을 크기순으로 늘어놓았을 때 가운데 놓이는 값이고, 개수가 짝수면 가운데 두 값의 평균을 씁니다.
표준편차는 각 값이 평균에서 얼마나 떨어져 있는지를 평균적으로 나타냅니다. 편차를 제곱해 평균낸 것이 분산이고, 그 제곱근이 표준편차입니다. 제곱을 거치기 때문에 원래 단위로 되돌리려면 반드시 제곱근을 취해야 합니다.
표본과 모집단의 차이는 분모에 있습니다. 모집단 전체를 다 가지고 있으면 개수 n으로 나누고, 일부만 뽑은 표본이면 n에서 1을 뺀 값으로 나눕니다. 표본은 평균 자체를 자료에서 추정했기 때문에 흩어짐을 과소평가하게 되고, 그 보정이 n−1입니다.
숫자를 넣기 전에 확인할 것
평균 하나만 보고 판단하면 분포를 놓칩니다. 연봉 자료처럼 위쪽에 긴 꼬리가 있는 경우 평균은 실제 대다수보다 훨씬 높게 나옵니다. 이런 자료는 중앙값이 체감에 더 가깝고, 둘을 나란히 보면 분포가 한쪽으로 쏠렸는지 바로 드러납니다.
표본인데 모집단 기준으로 계산하면 표준편차가 실제보다 작게 나옵니다. 값이 10개 이하일 때는 이 차이가 눈에 띄게 커집니다. 설문 응답이나 측정치처럼 전체 중 일부를 뽑아 온 자료라면 표본 기준이 맞습니다.
값을 붙여 넣을 때 쉼표가 자릿수 구분자인지 값 구분자인지 헷갈리면 결과가 크게 틀어집니다. 1,200이 천이백인지 1과 200인지에 따라 평균이 달라지므로, 자릿수 쉼표는 지우고 공백이나 줄바꿈으로 값을 나누는 편이 안전합니다.
범위와 분산을 함께 보는 이유
범위는 최댓값에서 최솟값을 뺀 값이라 계산이 쉽지만 양 끝 두 개만 반영합니다. 가운데가 촘촘한지 고른지는 알려주지 못하므로, 표준편차와 함께 봐야 자료의 모양이 잡힙니다.
표준편차를 평균으로 나눈 값을 변동계수라고 하며, 단위가 다른 두 자료의 흩어짐을 비교할 때 씁니다. 키와 몸무게처럼 척도가 다른 자료를 같은 기준으로 놓고 볼 수 있습니다.