白河 恭子 先生 のセリフ集 (44 発言)

ふふっ、それぞれ公式を覚えて、電卓で機械的に解けるようにしましょうね。

あらあら、データの分布の形と尺度水準で使い分けるのが基本よ。

系統抽出は、リストの中から等間隔に選ぶ方法 (例: 100人ずつのリストから10番目、20番目…)。

たとえば『身長と数学得点』に正の相関があっても、年齢別に層別すると相関が消えることがあるの。

他にも、(1)逆因果(BがAを引き起こす)、(2)偶然の相関(サンプル数が少ない)、(3)選択バイアスなども注意が必要よ。

目安として、|r|=0.7以上で強い相関、0.4〜0.7で中程度、0.2〜0.4で弱い相関、0.2未満でほぼ無相関と解釈することが多いわ。

外れ値の影響を抑えたいなら中央値、名義尺度なら最頻値、対称分布なら平均値、と覚えるといいわ。

度数分布表の最頻値は、最も度数が多い階級の階級値で代用するわ。

ただし精度は √n のオーダーでしか上がらないから、10倍精度を上げるには100倍のサンプルが必要、というのが統計の現実ね。

たとえば靴のサイズ調査で『24.0cm が一番多い』なら最頻値は24.0よ。

サイコロを振った時の出目をXとすれば、Xは1〜6のいずれかの値を確率1/6ずつで取る確率変数ね。

たとえば『2020年・2025年・2030年の自動車のエンジン形式の構成比』のように、年ごとの構成比の変化を見比べたい時に便利よ。

ふふっ、選択肢で『棒グラフのY軸が0始まりじゃないのに、見た目で2倍と判断する』ような誤りには注意してね。

あらあら、本番は時間がない中で正規分布表を引くことになるから、表の引き方を10問くらいは事前に練習しておきましょうね。

母集団がどんな分布(歪んだ分布、一様分布など)でも、x̄の分布は正規分布N(μ, σ²/n)に近づくの。

そして指数は、ある基準時点を100として、それ以降の値を相対表示する手法よ。

試験では、選択肢に『相関が強いので因果関係があると言える』のような断定を1つ混ぜて、それが誤りと見抜けるかを問うのが鉄板なのよ。

切片を含む通常の最小二乗回帰を、式を作った同じデータで評価する範囲では 0 ≤ R² ≤ 1 と覚えましょう。

一方で、視聴率調査は全世帯を計測するのは現実的でないから、関東地区では約2700世帯のパネルでその地区の視聴率を測定するのよ。

今の3級はCBT方式(コンピュータで受験する形式)が中心だから、出題範囲や形式に合わせた対策には『CBT対応版』を併用する必要があるの。
茶谷 結 のセリフ集 (41 発言)

ヒストグラムの形には、対称か歪んでいるか、山がいくつあるかなど、色々なパターンがあるのよ。

グラフの誤読問題は、(1)Y軸省略、(2)対数軸の誤解、(3)割合と絶対量の混同、(4)3D歪み、の4パターンが中心ですね。

ステップ: (1)平均、(2)偏差、(3)偏差の二乗、(4)二乗の和、(5)分散(/n)、(6)√で標準偏差。

補足すると、たとえば身長150〜180cmのデータで作った回帰式で『身長220cmの人の体重』を予測すると、そんな極端な値で線形関係が続くとは限らないの。

相関係数 r = s_xy / (σx × σy) を電卓で計算するんですよね。

AとBが排反(同時に起こらない)なら、P(A∩B)=0 だから、P(A∪B) = P(A) + P(B) と単純に足し算できるのよ。

たとえば全国調査で都市部と地方の意見をバランスよく拾いたいとき、人口比に応じて各地域から取れば偏りが減らせるのよ。

標準偏差そのものは絶対的な値だから、平均が違うとばらつきの『大きさの感覚』も変わってきちゃうの。

補足すると、毎日5問でも電卓計算を続ければ、本番では1問1分以内で解けるようになるわ。

二項分布 B(n, p) の期待値と分散には便利な公式があるの。

補足すると、範囲は外れ値の影響をまともに受けやすいから、本格的なばらつき指標には分散を使うの。

グラフは便利ですが、軸の取り方や省略の仕方で印象が大きく変わってしまうんです。

補足すると、階級内のデータが中央付近に均等に散らばっていれば、近似はかなり正確になるわ。

前者は“どこへ”近づくか、後者は“どんな形で散らばるか”を言っている、と整理すると混ざらないわ。

正規分布表の引き方は、(1)Zを計算、(2)P(Z≤z)を表で引く、(3)対称性で変換、(4)区間なら引き算、の4ステップですね。

たとえば 23, 28, 35, 41, 47 のデータなら、幹2に葉3,8、幹3に葉5、幹4に葉1,7と並べるの。

そう、累積相対度数 0.25・0.5・0.75 の階級値が、第1四分位・中央値・第3四分位の含まれる階級にそれぞれ対応するの。

電子書籍版が加わったことで、過去問演習そのものの入手性が上がった点も見逃せません。

補足すると、目安として n ≥ 30 あれば十分よく近似できる、と言われているわ。

補足すると、負の値が含まれるデータや、平均が0に近いデータには使えないので注意が必要です。
橙川 こよみ のセリフ集 (122 発言)

変化率って、対前月比とか対前年比のやつですかぁ?

わぁ、じゃあ中央値はCDFが0.5になるxってことですねぇ♪

難しそう…!

ふぇぇ…身長(cm)と体重(kg)も比べられちゃうんですかぁ?

わぁ、便利ですぅ♪

あの…標本誤差と偏りって違うものなんですかぁ?

選挙の出口調査もそうなのぉ?

切片 a の解釈は、ちょっと注意が必要なんですよねぇ?

わたしは相関と因果の引っ掛けが苦手でしたぁ…『一緒に動く』だけで『原因』とは限らないんですよねぇ。

今までの度数を足していくんですねぇ♪

全パターン見えるから安心ですぅ♪

お店のかき氷も、暑いほど売れるけど、暑すぎる日はみんな外に出ないから逆に売れない…みたいな山なりの感じですかぁ?

あ、合計が100%になるときに使うんですねぇ♪

なるほどぉ、計算できないときは数えればいいんですねぇ。

えへへ、箱が長いとばらつきが大きくて、短いと集中してるってことですねぇ♪

ふぇぇ…じゃあ実際には出ない値が、平均としては意味を持つんですねぇ。

あれぇ? 表が1回だけのところが1/2で一番大きいのは、なんでですかぁ?

コインを2回投げた時の表の回数Xも、確率分布になるのぉ?

なんで分散だけ a の二乗になるんですかぁ?

基準を変えれば、見え方が変わるんですねぇ♪
墨谷 まる のセリフ集 (99 発言)

じゃあプラスマイナスの向きは分からなくなる代わりに、どれくらい説明できてるかが見えるってわけだね!

要は10回じゃ偏ることもあるけど、1万回投げれば0.5に近づくってこと?

中央値が箱の右端寄りなら左に裾が長い、左端寄りなら右に裾が長い分布だね!

あ、切片 b は分散には効いてこないんだね!

なるほど、円グラフを横に並べるよりずっと比べやすいじゃん!

じゃあ観察研究のほうは?

時系列データって、要は時間と一緒に変わる数値のことだよね?

要は、その歪み具合を数値化したのが歪度ってこと?

料理でたとえると、過去問集は『昔のレシピ本で腕試し』、CBT対応版は『今のお店のメニューに合わせた練習』って感じ?

あ、年齢が上がれば身長も伸びるし、難しい問題も解けるようになるからってこと?

へぇ、ヒストグラムっぽいけど、元データも残ってるんだね!

なるほど、階級が多すぎるとガタガタで、少なすぎると平らすぎちゃうんだね。

残差って何のために見るの?

えっ、どう違うの?

サイコロを2回振ったら、1回目と2回目は独立ってこと?

じゃあさ、点が一直線でも、ほぼ水平に並んでたら相関は強いの?

それは簡単だね!

R²が高ければ、xがyの原因だって言える?

じゃあR²が1に近いほど良い回帰モデルってこと?

なんで σ を μ で割るの?