본문으로 이동

미디어위키 1.45 안정화가 거의 끝났습니다. 다만 Flow 확장 기능 관련 이슈가 있어서 대체하는 작업을 수행할 계획입니다.

  1. 큰숲백과:청사진에서 위키 발전의 대략적인 방향성을 제시했습니다. 의견이 있으신 분은 큰숲백과토론:청사진에서 의견을 남겨주시면 좋겠습니다.
  2. 기능상의 오류로 지원하지 않고 있는 기능에 대해서는 큰숲백과토론:이슈 트래커에 요약했습니다. 참고하시기 바랍니다.
  3. 데이터베이스 덤프 받고싶으신 분은 큰숲백과 가입 후에 사용자토론:Bigforest에 의견 남겨주시면 ftp 주소, 계정, 비밀번호를 특수:EmailUser를 통해서 공개할 예정입니다.

작은숲:Sudo위키/대푯값

큰숲백과, 나무를 보지 말고 큰 숲을 보라.

대푯값 (代表값) 은 어떤 자료가 주어졌을 때, 자료 전체의 중심적인 경향이나 특징을 하나의 수로 나타낸 값을 뜻합니다. 대푯값 중에서는 평균, 중앙값, 최빈값 등이 자주 사용됩니다.

평균

자료에 있는 변량을 다 더한 것을 변량의 개수로 나눈 것을 평균 (平均) 이라고 합니다. 평균은 가장 많이 사용되는 대푯값으로, 자료의 값 중에서 매우 크거나 매우 작은 값에 영향을 받습니다.

예를 들어

10,20,30

이라는 세 변량으로 이루어진 자료가 주어졌을 경우, 이 자료의 평균은

10+20+303=20

이 됩니다.

중앙값

자료에 있는 변량을 크기가 작은 것부터 차례대로 나열했을 때 중앙에 위치한 값을 중앙값 (中央값) 이라고 부릅니다. 중앙에 위치하는 값이기 때문에 변량을 크기가 큰 것부터 나열하더라도 똑같은 중앙값이 나오게 되며, 변량의 개수가 짝수인 경우에는 중앙에 위치하는 두 변량의 평균이 됩니다.

예를 들어

11,3,7,5,9,6

이라는 자료가 주어졌을 경우, 이 자료의 중앙값을 구하기 위해서 크기가 작은 것부터 나열해보면

3,5,6,7,9,11

이 됩니다. 이때 중앙에 위치하는 변량은 6,7의 두 개이며, 이 값의 평균을 구하면

6+72=6.5

이므로, 이 자료의 중앙값은 6.5입니다.

보다 일반적으로 설명하자면, N개의 변량으로 이루어진 자료를 작은 값부터 차례대로 나열했을 때의 중앙값은

  1. N이 홀수일 때, N+12 번째 변량
  2. N이 짝수일 때, N2 번째 수와 N2+1 번째 수의 평균

이 됩니다.

중앙값은 자료의 값 중에서 매우 크거나 매우 작은 값들의 영향을 덜 받는 편이며, 이러한 값들이 있는 자료에서는 평균보다 중앙값이 그 자료의 특징을 잘 나타낼 수 있습니다.

최빈값

자료에 있는 변량 중에서 가장 많이 나타나는 값을 최빈값 (最頻값) 이라고 부릅니다. 자료의 변량이 모두 다르거나 서로 다른 변량들의 개수가 모두 같은 경우에는 최빈값이 존재하지 않습니다. 또한, 자료의 변량 중 도수가 가장 큰 값이 한 개 이상 있을 경우에 그것을 최빈값이라고 할 수 있기에 자료의 최빈값은 1개 이상이 될 수도 있습니다.

예를 들어

3,6,7,3,7,10

이라는 자료가 주어졌을 경우, 다른 변량은 1번 나오지만 37은 2번 나오므로 최빈값은 3,7이 됩니다.

최빈값은 변량의 개수가 많거나 변량이 중복되어 나타나는 자료의 특징을 잘 나타낼 수 있지만, 변량의 개수가 작은 경우에는 자료의 중심 경향을 잘 반영하지 못할 수 있다는 단점이 있습니다.