回帰モデルの説明力を測る『決定係数 R²』の意味を直感で理解します。
切片を含む単回帰では、決定係数R² は相関係数 r の二乗。
回帰モデルがyのばらつきの何%を説明できているかを表すの。
たとえば r=0.9 なら R² = 0.81。
これは『yの分散の81%を回帰モデルで説明できている』という意味なのよ。
じゃあ r が半分の 0.5 だったら、説明できるのも半分くらいなんですかぁ?
それが落とし穴なの。
r=0.5 だと R²=0.25。
説明できるのは25%だけ。
r が下がると R² は二乗ぶん急に小さくなるのよ。
じゃあR²が1に近いほど良い回帰モデルってこと?
補足すると、その通り。
R²=1 なら完璧、R²=0 なら全く予測力がない。
うぅ〜ん…値の範囲は0〜1なんですねぇ?
切片を含む通常の最小二乗回帰を、式を作った同じデータで評価する範囲では 0 ≤ R² ≤ 1 と覚えましょう。
じゃあプラスマイナスの向きは分からなくなる代わりに、どれくらい説明できてるかが見えるってわけだね!
二つの方法でR²を計算する
単回帰では、相関係数から R²=r² と求める方法が最短です。相関係数が -0.8 なら、符号も含めて二乗して (-0.8)²=0.64。負の相関でも、説明できる割合は64%です。
回帰の当てはまりから直接求める式は R²=1-SSE/SST です。SSTは平均からのずれの二乗和で、目的変数全体のばらつき。SSEは実測値と予測値のずれ、つまり残差の二乗和です。
全体のばらつき SST = 100 残差のばらつき SSE = 36 R² = 1 - 36÷100 = 0.64
回帰を使わず平均だけで予測したときのずれを100とすると、回帰後には説明できないずれが36残ったので、100-36=64%を説明できた、と読めます。
R²が0.64なら、予測が64%の確率で当たるってことですかぁ?
違います。
正解確率ではなく、yのばらつきのうちモデルで説明できた割合です。
個々の予測誤差の大きさは残差も見て判断します。
R²が高ければ、xがyの原因だって言える?
相関や高いR²だけでは因果関係は証明できないわ。
交絡因子や外れ値、データ範囲も確認すること。
試験ではR²の計算と解釈を分けて考えるのがコツよ。
確認クイズ
相関係数 r=0.8 のとき、決定係数 R² の値はいくらか。
- 0.4
- 0.64
- 0.8
- 1.6
こたえを見る
正解: 2. 0.64
R² = r² = 0.8² = 0.64。yの分散の64%を回帰モデルで説明できることを意味します。