スウシキLab スウシキLab

統計学の基本公式集|平均・分散・標準偏差

統計 分散 標準偏差 相関係数 数学
広告スペース (article-top)

統計学の基本公式は、データの「代表値(中心の位置)」と「散らばり具合」を数値で表すためのものです。ここでは平均・分散・標準偏差から、2つのデータの関係を表す相関係数までを整理します。

代表値

平均値

データ x1, x2, …, xn の平均値(x̄と書く)は

x̄ = (x1 + x2 + … + xn) / n

中央値(メジアン)

データを大きさの順に並べたとき、真ん中に来る値です。データの個数nが奇数のときは中央の1つの値、偶数のときは中央2つの値の平均をとります。極端に大きい(小さい)値(外れ値)の影響を受けにくいという特徴があります。

最頻値(モード)

データの中で最も多く現れる値です。

散らばりを表す指標

偏差

各データの値から平均値を引いたもの(xi - x̄)を偏差といいます。偏差の合計は必ず0になるため、偏差をそのまま足しても散らばりの大きさは測れません。

分散

偏差を2乗してから平均をとることで、散らばりの大きさを正の数値として表したものが分散です。

s^2 = {(x1-x̄)^2 + (x2-x̄)^2 + … + (xn-x̄)^2} / n

高校数学では、手元にあるデータそのものの散らばりを表すこの「nで割る分散」を扱います。値が大きいほどデータが平均から広く散らばっていることを意味します。

標準偏差

分散の単位はもとのデータを2乗した単位になってしまうため、平方根をとって元のデータと同じ単位に戻したものが標準偏差です。

s = √(分散) = √{Σ(xi-x̄)^2 / n}

標準偏差は「データが平均からどのくらい離れているのが典型的か」を表す、最もよく使われる散らばりの指標です。

分散の計算しやすい形

分散は次の式でも計算できます(2乗の平均から平均の2乗を引く形)。

s^2 = (x1^2 + x2^2 + … + xn^2)/n - x̄^2

偏差をいちいち計算するより、この形のほうが手計算では速いことが多くあります。

不偏分散(参考:大学レベルの統計学)

高校では手元のデータ全体(母集団)の散らばりをnで割る分散で表しますが、大学の統計学では、標本から母集団の分散を「推定」する目的で、分母をn-1にした不偏分散を使います。

不偏分散 = Σ(xi-x̄)^2 / (n-1)

nではなくn-1で割ることで、標本から計算した分散が母集団の分散を平均的に過小評価してしまう偏りを補正しています。

2つのデータの関係:共分散と相関係数

共分散

2種類のデータx、yの間に、一方が大きいときもう一方も大きくなる(または小さくなる)といった関係があるかを調べるとき、共分散を使います。

Cov(x,y) = {(x1-x̄)(y1-ȳ) + (x2-x̄)(y2-ȳ) + … + (xn-x̄)(yn-ȳ)} / n

相関係数

共分散はxとyの単位に依存してしまうため、それぞれの標準偏差で割って -1 から 1 の範囲に正規化したものが相関係数です。

r = Cov(x,y) / (sx × sy)

  • r が1に近いほど:強い正の相関(一方が増えるともう一方も増える傾向)
  • r が-1に近いほど:強い負の相関(一方が増えるともう一方は減る傾向)
  • r が0に近いほど:直線的な相関はほとんどない

相関係数はあくまで「直線的な関係の強さ」を表す指標であり、r=0でも曲線的な関係が存在する場合があるという点、また相関関係は因果関係を直接意味しないという点には注意が必要です。

まとめ

統計学の基本公式は、データを1つの数値で代表する「代表値」と、データの散らばりを表す「分散・標準偏差」が土台になります。2種類のデータの関係を調べたいときは、共分散を標準化した相関係数を使います。高校では分母をnとする分散を扱いますが、大学の統計学ではn-1で割る不偏分散を使うという違いも知っておくと、進学後の学習につながります。

広告スペース (article-bottom)

あわせて読みたい