データ「3, 5, 7, 9, 11」の平均値はいくつか?
- 6
- 7
- 8.75
- 35
合計は3+5+7+9+11=35で、これをデータの個数5で割ると平均は7です。35は合計を割り忘れた値、8.75は個数を4と数え間違えて35÷4とした値。平均は「合計÷個数」と覚えましょう。
大学
記述統計から推定・検定・相関と回帰まで
平均・中央値・標準偏差から正規分布、p値の正しい読み方、相関と因果の違いまで、大学教養レベルの統計学を4択40問で確かめます。データを読み違えないための考え方を、解説つきで。無料・登録不要。
データ「3, 5, 7, 9, 11」の平均値はいくつか?
合計は3+5+7+9+11=35で、これをデータの個数5で割ると平均は7です。35は合計を割り忘れた値、8.75は個数を4と数え間違えて35÷4とした値。平均は「合計÷個数」と覚えましょう。
データ「1, 2, 3, 4, 100」の中央値はいくつか?
小さい順に並べたときの真ん中(5個中3番目)の値なので中央値は3です。22は平均値(110÷5)で、外れ値100に強く引っ張られています。外れ値があるデータでは中央値の方が実態を表しやすいことがわかる例です。
最頻値(モード)の説明として正しいものはどれか?
最頻値は出現回数が最も多い値です。真ん中の値は中央値、合計÷個数は平均値、最大値−最小値は範囲。好きな色のようなカテゴリーデータでは平均も中央値も計算できないため、最頻値が代表値として活躍します。
一部の極端に大きい値(外れ値)の影響を受けにくい代表値はどれか?
中央値は順位の真ん中を見るだけなので、外れ値がどれほど大きくても値がほとんど変わりません。平均値・分散・範囲はいずれも外れ値の影響を強く受けます。年収や住宅価格の分析で中央値がよく使われるのはこのためです。
分散の定義として正しいものはどれか?
分散は「偏差の2乗の平均」で、データの散らばりの大きさを表します。2乗するのは、偏差をそのまま合計すると正負が打ち消し合って必ず0になってしまうためです。分散の正の平方根が標準偏差になります。
身長(cm)のデータについて標準偏差を計算したとき、その単位はどうなるか?
分散の単位はcm²ですが、その平方根である標準偏差はcmに戻り、元のデータと同じ単位で散らばりを解釈できます。「平均±標準偏差」という形で直感的に使えるのが、分散ではなく標準偏差を報告する利点です。
箱ひげ図で、箱の中に引かれた線が表すものはどれか?
箱の中の線は中央値(第2四分位数)です。箱の下端が第1四分位数、上端が第3四分位数を表します。平均値は箱ひげ図に必ず描かれるわけではなく、描く場合は「×」や「+」の印で別に示すのが一般的です。
四分位範囲(IQR)の求め方として正しいものはどれか?
IQR=Q3−Q1で、データの中央50%が収まる幅を表します。範囲(最大値−最小値)と違って外れ値の影響を受けにくいのが特徴です。「Q1−1.5×IQR」「Q3+1.5×IQR」の外側を外れ値の目安とする方法もよく使われます。
公正なサイコロを1回振って偶数の目が出る確率はいくつか?
偶数の目は2・4・6の3通りで、全体は6通り。よって3/6=1/2です。1/6は特定の目1つが出る確率です。確率の基本は「該当する場合の数÷起こりうる全体の場合の数」で、どの目も同様に確からしいことが前提です。
公正なサイコロを2個振って、目の和が7になる確率はいくつか?
和が7になるのは(1,6)(2,5)(3,4)(4,3)(5,2)(6,1)の6通りで、全体は6×6=36通り。よって6/36=1/6です。順序を区別せず3通りと数えると1/12という誤答になります。和が7は2個のサイコロで最も出やすい和です。
正規分布のグラフの形として正しい説明はどれか?
正規分布は平均を中心とした左右対称の釣り鐘型(ベルカーブ)です。身長や測定誤差など、多くのデータが近似的に正規分布に従うとされます。どの値も同じ高さになるのは一様分布で、右に長い裾を持つのは所得分布などの歪んだ分布です。
正規分布で、平均±1標準偏差の範囲に全体のおよそ何%のデータが含まれるか?
正規分布では平均±1σに約68%、±2σに約95%、±3σに約99.7%が含まれます(68-95-99.7ルール)。この規則を使うと、平均と標準偏差の2つの数字だけからデータのおおよその分布範囲を見積もることができます。
正規分布で全体の約95%のデータが含まれるのは、平均±何標準偏差の範囲か?
約95%は平均±2σ(より正確には±1.96σ)の範囲に含まれます。±1σは約68%、±3σは約99.7%です。「±2σで95%」は、95%信頼区間や有意水準5%の検定とも深く関わる、統計学で最も使われる数字のひとつです。
「コイン投げの回数を増やすほど、表の出る割合が1/2に近づいていく」ことを説明する法則はどれか?
試行回数を増やすと標本の割合や平均が理論上の値(期待値)に近づくのが大数の法則です。ただし「表が続いたから次は裏が出やすい」と考えるのは誤り(ギャンブラーの誤謬)で、1回ごとの確率は常に1/2のまま変わりません。
中心極限定理が述べている内容として正しいものはどれか?
中心極限定理は「標本平均の分布」が正規分布に近づくという定理で、元のデータがどんな形の分布でも成り立つ点が強力です。標本を増やしても元のデータ自体が正規分布になるわけではない、というのがよくある誤解です。
確率の解釈をめぐる立場のうち、ベイズ主義では確率をどのようなものと解釈するか?
ベイズ主義は確率を「信念の度合い」とみなし、データを得るたびにベイズの定理で更新します。一方、頻度主義は確率を「繰り返し試行での相対頻度」と解釈します。両者は解釈と手法の異なる立場であり、どちらが正しいと決着しているわけではなく、現代では目的に応じて使い分けられています。
「日本の大学生全体の意識を知るために1000人を選んで調査した」とき、この1000人を何と呼ぶか?
調べたい対象全体(日本の大学生全体)が母集団、そこから実際に選ばれて調査される一部が標本(サンプル)です。統計的推測とは、標本の情報から母集団の性質を推し量ることを指します。両者の取り違えは推測統計の理解を妨げる典型的なつまずきです。
日本で行われる代表的な「全数調査」はどれか?
国勢調査は日本に住むすべての人・世帯を対象とする全数調査です。視聴率調査・世論調査・出口調査は一部を選んで調べる標本調査です。全数調査は正確ですが莫大な費用と時間がかかるため、多くの調査は標本調査で行われます。
「支持率は45%と推定される」に対し、「支持率は42%〜48%の間と推定される」のように幅で示す推定を何と呼ぶか?
1つの値で示すのが点推定、幅をもたせて示すのが区間推定です。区間推定は推定の不確かさを幅として表現できる利点があります。世論調査の「誤差±3ポイント」といった表現は、区間推定の考え方に基づくものです。
標準誤差(SE)が表すものとして正しいのはどれか?
標準誤差は「標本を取り直したときに標本平均がどれくらいばらつくか」を表し、標準偏差を√nで割って求めます。個々のデータの散らばりを表す標準偏差との混同がよくある誤りです。標本サイズnを増やすと標準誤差は小さくなり、推定の精度が上がります。
標本から母分散を推定する際、偏差の2乗和をn(データ数)ではなくn−1で割る主な理由はどれか?
標本平均は標本自身に最も寄り添う中心なので、標本平均からの偏差2乗和は母平均からのものより小さくなりがちです。n−1で割ることでこの過小評価を補正し、期待値が母分散に一致する「不偏分散」が得られます。この補正は標本が小さいほど効いてきます。
「95%信頼区間」の頻度主義における標準的な解釈として正しいものはどれか?
頻度主義では真の値は固定されており、ランダムなのは区間の方です。「作られた区間の約95%が真の値を含む」が標準的な解釈です。なおベイズ統計の「95%信用区間」では「真の値がその区間にある確率は95%」という直感的な解釈が許され、これは立場の違いによるものです。
新薬の効果を検定するとき、帰無仮説として設定されるのは通常どれか?
帰無仮説は「差がない・効果がない」という、否定されることを想定して立てる仮説です。データがこの仮説のもとでは起こりにくいものであれば帰無仮説を棄却し、対立仮説(効果がある)を採択します。まず「ない」と仮定するのが検定の出発点です。
統計的仮説検定で、有意水準として慣習的に最もよく使われる値はどれか?
有意水準は帰無仮説を棄却する基準で、慣習的に5%(0.05)が最もよく使われ、より厳しい1%も用いられます。5%と0.05を混同して0.05%と書くのは典型的なミスです。なお5%は絶対の基準ではなく、分野や目的により適切な水準は異なるという議論もあります。
第一種の過誤(タイプIエラー)とはどのような誤りか?
第一種の過誤は「本当は効果がないのに、効果があると判断してしまう」誤りです。有意水準5%とは、この誤りを犯す確率を5%以下に抑えるという意味です。逆に、本当にある効果を見逃してしまうのが第二種の過誤です。
第二種の過誤(タイプIIエラー)の説明として正しいものはどれか?
第二種の過誤は「本当にある効果を検出できない」見逃しの誤りです。この誤りを犯さない確率は検出力(1−β)と呼ばれ、標本サイズを大きくすると検出力は上がります。第一種の過誤と第二種の過誤はトレードオフの関係にあります。
有意水準5%の検定でp値が0.03だったとき、標準的な手続きとして正しい結論はどれか?
p値(0.03)が有意水準(0.05)を下回ったので帰無仮説を棄却し、「統計的に有意な差がある」と結論します。逆にp値が0.05以上の場合は「棄却できない」だけであって、「帰無仮説が正しいと証明された」ことにはならない点に注意が必要です。
p値の正しい定義はどれか?
p値は「帰無仮説を正しいと仮定した上で、手元のデータほど極端な結果が偶然得られる確率」です。「帰無仮説が正しい確率」や「結果が偶然である確率」と読むのは最も有名な誤解で、米国統計学会(ASA)も2016年の声明でp値の誤用に注意を促しています。
標本サイズが非常に大きい調査で「統計的に有意な差」が出たとき、注意すべき点はどれか?
標本が大きいと、ごくわずかな差でも統計的に有意になります。「統計的有意」は偶然だけでは説明しにくいという意味であり、差の大きさ(効果量)が実用上重要かどうかは別問題です。p値だけでなく効果量や信頼区間もあわせて報告することが推奨されています。
相関係数(ピアソンの積率相関係数)が取りうる値の範囲はどれか?
相関係数は−1から1の値を取り、1に近いほど強い正の相関、−1に近いほど強い負の相関を表します。0から1と誤解されがちですが、一方が増えると他方が減る負の相関があるため、負の値も取ります。
「気温が高い日ほどアイスクリームの売上が多い」という関係は何と呼ばれるか?
一方が増えると他方も増える傾向が正の相関、一方が増えると他方が減る傾向が負の相関です。散布図に描くと、正の相関は右上がりの点の並びとして現れます。相関の「正負」は関係の向き、「絶対値の大きさ」は関係の強さを表します。
「アイスクリームの売上が多い日は水難事故も多い」という相関の最も妥当な説明はどれか?
夏の暑さ(気温)がアイスの売上と水辺に行く人の数の両方を増やしているだけで、アイスと水難事故に直接の因果はありません。「相関は因果の証拠にならない」こと、背後の第三の変数(交絡因子)を疑うことが統計リテラシーの基本です。
2つの変数の相関係数がほぼ0だったとき、正しい解釈はどれか?
ピアソンの相関係数は「直線的な関係」の強さしか測れません。たとえばU字型(2次関数的)の強い関係があっても相関係数はほぼ0になります。相関係数0=無関係と即断せず、まず散布図を描いて形を確認することが大切です。
2つの変数の両方に影響を与え、見かけ上の相関を生み出す第三の変数を何と呼ぶか?
交絡変数(交絡因子)は原因側と結果側の両方に影響し、見せかけの相関(疑似相関)を作り出します。ランダム化比較試験(RCT)が因果推論で重視されるのは、無作為割り付けによって交絡変数の影響を断ち切れるからです。
「テストで極端に高得点だった生徒たちは、次のテストでは平均寄りの点になりやすい」という現象を何と呼ぶか?
極端な結果には偶然(運)の要素が含まれるため、次回は平均方向に戻りやすくなります。これが平均への回帰で、ゴルトンが親子の身長の研究で見出しました。「叱ったから成績が戻った」のように、この現象を介入の効果と誤解するのが典型的な落とし穴です。
棒グラフの縦軸を0からではなく90から始めると、どのような印象操作が起こりやすいか?
縦軸を途中から始めると、棒の長さの比が実際の値の比と一致しなくなり、小さな差が誇張されます。グラフを読むときは、まず軸の始点と目盛りの間隔を確認する習慣が、データにだまされないための第一歩です。
駅前で平日昼に街頭アンケートを行い、その結果を「国民の意見」として発表した。この調査の最大の問題はどれか?
平日昼に駅前を通る人は、働き方や年齢層が偏っており、国民全体(母集団)の縮図にはなりません。これが選択バイアスです。標本の大きさより先に「標本をどう選んだか」を疑うことが、調査結果を読むときの基本です。
第二次大戦中、帰還した爆撃機の被弾箇所を調べて装甲を強化する計画に対し、統計学者ワルドは何を主張したとされるか?
帰還機は「被弾しても生き残れた」機体なので、帰還機に被弾が少ない箇所(エンジン付近など)への被弾は致命傷だった可能性が高い、という推論です。観察できたデータだけで判断する誤りを生存者バイアスと呼び、成功者の体験談などにも同じ構造が潜んでいます。
日本の世帯所得では、平均値が中央値をかなり上回る。この主な理由はどれか?
所得分布は右に長い裾を持つ(右に歪んだ)分布で、少数の高所得世帯が平均を引き上げます。そのため「平均以下」の世帯が過半数になります。左右対称の正規分布なら平均と中央値はほぼ一致するので、両者のずれは分布の歪みのサインです。
「グループ別に見ると治療Aの方が成績が良いのに、全体を合計すると治療Bの方が良く見える」ように、集計の仕方で結論が逆転する現象を何と呼ぶか?
シンプソンのパラドックスは、グループごとの傾向と全体の傾向が逆転しうる現象で、各グループの人数の偏りが原因で起こります。全体の集計と層別の集計のどちらを見るべきかは目的や因果構造によって変わるため、内訳の確認が欠かせません。
ランダム出題の演習ツールです(JavaScript が有効な場合に動きます)。上の問題と解説はそのままでもすべて読めます。
※ 解説は学習のための情報提供です。統計や制度は更新されることがあるため、レポートや試験で使う際は最新の公式情報もあわせてご確認ください。