“평균”이라는 단어는 세 가지 서로 다른 통계적 의미를 가질 수 있으며, 잘못 선택하면 데이터 해석이 왜곡될 수 있습니다. 산술평균(mean), 중앙값(median), 최빈값(mode)은 데이터의 서로 다른 특징을 나타냅니다.
산술평균 (Mean)
평균은 모든 데이터 값을 더한 후 전체 개수로 나눈 값입니다. 일상에서 “평균”이라고 말할 때 통상적으로 의미하는 값입니다.
공식: 평균 = 합계 ÷ 개수
계산 예제: [4, 8, 6, 5, 3]의 평균은 (4+8+6+5+3) ÷ 5 = 26 ÷ 5 = 5.2입니다. average calculator에서 바로 확인해 볼 수 있습니다.
중앙값 (Median)
중앙값은 데이터를 크기순으로 나열했을 때 정중앙에 위치하는 값입니다. 데이터 개수가 홀수이면 중앙의 값이며, 짝수이면 중앙 두 값의 평균을 구합니다.
계산 예제: 정렬된 [3, 4, 5, 6, 8]의 중앙값은 5입니다. [3, 4, 5, 6, 7, 8]의 경우 중앙값은 (5+6) ÷ 2 = 5.5가 됩니다.
최빈값 (Mode)
최빈값은 데이터 세트에서 가장 자주 나타나는 값입니다. 하나의 최빈값만 존재할 수도 있고, 여러 개가 있거나 전혀 없을 수도 있습니다.
계산 예제: [1, 2, 2, 3, 4]에서 최빈값은 2입니다. [1, 1, 2, 2, 3]에서는 1과 2가 두 번씩 나타나므로 쌍봉(bimodal) 형태를 띱니다. [1, 2, 3, 4, 5]는 모든 값이 한 번씩만 나와 최빈값이 없습니다.
언제 어떤 값을 사용해야 할까?
| 지표 | 권장 상황 |
|---|---|
| 평균 | 데이터가 극단적 이상치 없이 대칭적인 경우 |
| 중앙값 | 데이터가 비대칭으로 치우쳐 있거나 이상치가 있는 경우 |
| 최빈값 | 범주형 데이터이거나 가장 흔한 사례를 찾을 때 |
예를 들어 연봉 £30,000를 받는 10명이 있는 방에서는 평균과 중앙값이 모두 £30,000입니다. 여기에 연봉 £1,000,000인 사람 한 명이 추가되면 평균은 약 £118,000로 급등하지만 중앙값은 여전히 £30,000입니다. 이 경우 중앙값이 일반적인 사람의 소득 수준을 훨씬 더 잘 대변합니다. 재정적 복리 수익률에 대해서는 compound interest guide를 확인해 보세요.
범위와 산포도
범위(Range)는 최댓값에서 최솟값을 뺀 값으로, 데이터의 전체 분산 폭을 나타냅니다. 신속하게 계산할 수 있지만 극단적 이상치에 민감합니다. 종합적인 분석에는 표준편차를 확인해야 하며, statistics calculator를 사용하면 쉽게 계산할 수 있습니다.
자주 묻는 질문
평균과 중앙값 중 어느 것을 사용해야 하나요? 극단적인 이상치가 없는 대칭적 데이터에는 평균을 쓰고, 소득 분포처럼 치우침이 심한 데이터에는 중앙값을 사용합니다.
최빈값이 없는 경우는 어떤 경우인가요? 모든 데이터가 한 번씩만 등장하면 최빈값이 존재하지 않습니다.
한 데이터 세트에 최빈값이 둘 이상일 수 있나요? 네. 둘 이상의 값이 최고 빈도로 동일하게 반복되면 다중 최빈값을 가집니다.
가중평균이란 무엇인가요? 각 항목의 중요도(가중치)를 곱한 합을 총 가중치 합으로 나눈 평균값입니다.