問1
数字 を書いた札が 枚、 を書いた札が 枚、 を書いた札が 枚あります。この 枚の札を母集団とし、札の数字を変量とするとき、母平均 を求めなさい。
目次 / データの分析と統計 / 数学B
—— 一部を調べて全体を知る。標本平均のぶれを正規分布でとらえ、母平均・母比率に幅をもたせて見積もる ——
全員を調べられないとき、一部を選んで調べ、その結果から全体の様子を見積もるのが**標本調査**です。この章では、調べたい集団全体(母集団)から無作為に選んだ一部(標本)の平均値が、どれくらいぶれるのかを、第6章の期待値・標準偏差と第8章の正規分布を使って調べます。そのうえで、標本の結果から全体の平均や割合を「この範囲にあるだろう」と幅をもたせて見積もる**推定**の方法を学び、必要な標本の大きさの決め方や、$n - 1$ で割る分散にも触れます。
ある工場で作った電球が平均何時間もつかを知りたいとします。全部の電球を切れるまで点灯させれば正確に分かりますが、売る電球が 1 個も残りません。全国の高校生の睡眠時間を知りたいときも、全員に聞くのは時間も費用もかかりすぎます。
そこで、全体の中から一部を選んで調べ、その結果から全体の様子を見積もります。第1〜4章では「手元のデータそのもの」の平均値や標準偏差を求めましたが、この章では「手元のデータの向こうにある、もっと大きな集団」について考えます。その橋渡しに、第6章の確率変数と第8章の正規分布を使います。
調査の対象全体をもれなく調べる調査を全数調査、対象全体から一部を選び出して調べ、その結果から全体の性質を推測する調査を標本調査という。
無作為抽出では、くじ引き、乱数さいころ、コンピューターで作った乱数などを使います。例えば 1 番から 500 番までの名簿から選ぶなら、コンピューターに 1 以上 500 以下の整数を無作為に出させ、その番号の人を選びます。「駅前で声をかけやすい人に聞く」「番組のアンケートに応募した人の答えを集める」といった方法は、選ばれやすい人に偏りが出るので、無作為抽出ではありません。
母集団の大きさ が標本の大きさ にくらべて十分大きいときは、非復元抽出でも、取り出すたびに中身の割合はほとんど変わりません。そのため、この章では非復元抽出も復元抽出と同じように扱います(違いは厳密定義のページで調べます)。
健康診断の採血を思い浮かべてください。体の血の状態を調べるのに、全身の血を抜く人はいません。注射器 1 本分を採るだけで十分です。これができるのは、血液が体中をめぐって、よく混ざっているからです。無作為抽出は、母集団を「よく混ざった状態」にしてから一部を取り出すための工夫だといえます。偏った取り出し方をすると、少ない量で全体を知るという前提が崩れてしまいます。
標本調査では、調べたい全体(母集団)から一部(標本)を、どの個体も同じ確率で選ばれるように無作為抽出し、その結果から全体を見積もるということです。
次の (ア)〜(エ) の調査は、全数調査と標本調査のどちらが適しているか、それぞれ理由とともに答えなさい。
(ア) 学校で行う生徒の健康診断
(イ) 工場で作った缶詰の中身の品質検査
(ウ) 日本に住むすべての人と世帯を対象とする国勢調査
(エ) テレビ番組の視聴率調査
【解答】
(ア) 全数調査。一人ひとりの健康状態を知ることが目的なので、全員を調べる必要があります。
(イ) 標本調査。缶を開けると売り物にならないので、全部を調べることはできません。
(ウ) 全数調査。国の人口や世帯の正確な数を知ることが目的で、法律で全員が対象と決められています。
(エ) 標本調査。すべての世帯を調べるのは費用と手間がかかりすぎるので、無作為に選んだ一部の世帯で調べます。
母集団の性質を数で表すために、第6章の「名簿からくじで 1 人を選ぶ」考え方を使います。
大きさ の母集団で、調べる性質を数で表したもの(変量)が の値をとり、それぞれの度数が であるとする。この母集団から 1 個を無作為に取り出したときの変量の値 は確率変数で、その確率分布は
| 計 | |||||
|---|---|---|---|---|---|
となる。この確率分布を母集団分布という。母集団分布の期待値・分散・標準偏差を、それぞれ母平均・母分散・母標準偏差といい、,, で表す。
母集団分布の確率は、母集団の中の相対度数そのものです。そのため、母平均 は母集団全体のデータの平均値に、母標準偏差 は母集団全体のデータの標準偏差に一致します(第6章 公式2 の「名簿からくじで 1 人」と同じ理由です)。標本調査で知りたいのは、この や です。
福引のガラガラで考えると、母集団分布は「中に入っている玉の色の割合」です。1 回回して出てくる玉の色は偶然で決まりますが、その出やすさは中身の割合で決まっています。母集団分布を知ることは、ガラガラの中身の割合を知ることにあたります。
母集団から 1 個を無作為に取り出したときの値 の確率分布が母集団分布で、その期待値・標準偏差が、母集団全体の平均値・標準偏差である母平均 ・母標準偏差 になるということです。
袋の中に、数字 を書いた玉が 個、 を書いた玉が 個、 を書いた玉が 個入っています。この 個の玉を母集団とし、玉に書かれた数字を変量とします。母集団分布を表で表し、母平均 、母分散 、母標準偏差 をそれぞれ求めなさい。
【解答】
1 個を無作為に取り出したときの数字を とすると、母集団分布は次のようになります。
| 計 | ||||
|---|---|---|---|---|
母集団から大きさ の標本を無作為抽出し、変量の値を とします。復元抽出なら、 は互いに独立で、どれも母集団分布に従う確率変数です。その平均
を標本平均といいます。どの標本が選ばれるかで値が変わるので、 も確率変数です。
母平均 、母標準偏差 の母集団から、大きさ の無作為標本を抽出するとき、標本平均 の期待値と標準偏差は
である(母集団の大きさが にくらべて十分大きければ、非復元抽出でもこの式を使ってよい)。
これは第6章の実践 問18 と厳密定義 定理5 で確かめたことです。和の期待値は期待値の和なので 、独立な確率変数の和の分散は分散の和なので です。 で割ると
となります。標本平均は「平均すると母平均に一致」し、ぶれの大きさは母集団の 倍に縮みます。標本を 倍にするとぶれは半分、 倍にすると です。
お店の口コミの星を思い出してください。1 件だけのレビューは、たまたま機嫌が悪かった人の星 1 つかもしれず、あまりあてになりません。100 件のレビューの平均なら、極端な評価が互いに打ち消し合い、お店の実力に近い値になります。1 件ずつの評価のばらつき()は変わらなくても、平均した値のばらつきは件数が増えるほど小さくなるのです。
大きさ の標本平均 は、期待値が母平均 に等しく、標準偏差は母標準偏差の 倍の になるということです。
例題2 の母集団(数字 の玉)から、復元抽出で大きさ の標本を取り出し、標本平均を とします。
(1) の確率分布と、期待値 、分散
(2) 同じ母集団から大きさ の標本を取り出したときの、標本平均の標準偏差
上の (1)、(2) をそれぞれ求めなさい。
【解答】
(1) 1 回目と 2 回目の数字の組と、その確率から の値をまとめます。例えば になるのは , で、確率は です。
| 計 | |||||||
|---|---|---|---|---|---|---|---|
公式3 の , と一致しています。
(2) 公式3 より
公式3 は期待値と標準偏差だけの話でした。では、 の分布の形はどうなるでしょうか。第8章の厳密定義のページで紹介した中心極限定理から、次のことがいえます。
母平均 、母標準偏差 の母集団から大きさ の無作為標本を抽出するとき、 が大きければ、標本平均 は近似的に正規分布 に従う。したがって
は近似的に標準正規分布 に従う。母集団分布が正規分布のときは、 の大きさによらず は正規分布 に従う。
また、 を大きくすると、 は母平均 に近い値をとる確率が に近づく(大数の法則)。
この章で使う正規分布表の値は次のとおりである。
| 0.5 | 1.0 | 1.5 | 1.96 | 2.0 | 2.58 | |
|---|---|---|---|---|---|---|
| 0.1915 | 0.3413 | 0.4332 | 0.4750 | 0.4772 | 0.4951 |
大切なのは、母集団分布の形を問わないことです。さいころの目のように平らな分布でも、所得のように右に長く裾をひく分布でも、標本平均の分布は が大きくなると釣り鐘形に近づきます。
大数の法則は、第6章の厳密定義 定理7 で証明したものです。公式3 の が で に近づくので、 は のまわりにどんどん集中していきます。標本を大きくするほど標本平均が母平均のよい見積もりになる、という標本調査の土台です。
川原の石を思い浮かべてください。山から崩れ落ちた岩は、とがったもの、平たいもの、細長いものとさまざまです。けれども川に流されて何度も転がるうちに角が取れ、下流の石はどれも丸みを帯びた似た形になります。もとの岩の形(母集団分布)が何であっても、たくさん足して平均するという「転がし」を重ねると、同じ釣り鐘形に落ち着くのです。
が大きいとき、標本平均 は母集団分布の形によらず近似的に に従い、 を大きくするほど母平均 の近くに集まるということです。
母平均 、母標準偏差 の母集団から、大きさ の無作為標本を抽出します。標本平均 について、公式4 の正規分布表を使って、次の確率を求めなさい。
(1)
(2)
上の (1)、(2) の値をそれぞれ求めなさい。
【解答】
, です。 は大きいので、 は近似的に に従います。
(1) のとき なので
(2) のとき なので
1 個ずつの値は くらいの範囲にばらつくのに、100 個の平均は 割近くが に収まります。
ここからが本題です。これまでは と が分かっているとして の確率を求めましたが、実際の調査では が分からず、手元にあるのは標本平均の値 だけです。そこで向きを逆にして、 から を見積もります。これを母平均の推定といいます。
公式4 より、 が大きいとき は近似的に に従い、 だから
です。かっこの中の不等式を について解くと、次の形になります。
母標準偏差 の母集団から大きさ の無作為標本を抽出し、標本平均が であったとする。 が大きいとき、母平均 に対する信頼度 95% の信頼区間は
である。 は という区間を表す。信頼度 99% の信頼区間は、 を に置きかえたものである()。
「信頼度 95%」の意味には注意が必要です。母平均 は、分からないだけで決まった 1 つの値であり、確率的に動くものではありません。動くのは、標本ごとに変わる区間のほうです。標本の抽出をくり返して、そのたびに公式5 の区間を作ると、そのうちのおよそ % の区間が を含む、というのが正しい意味です。
輪投げにたとえると分かりやすくなります。杭()は地面に固定されていて動きません。投げるたびに輪(信頼区間)が違う場所に落ち、うまく杭にかかることもあれば外れることもあります。「信頼度 95%」とは、「この投げ方なら 100 回投げて 95 回ほど杭にかかる」という、投げ方の腕前の話です。すでに落ちた 1 つの輪について言えるのは、「かかっているかは確かめようがないが、95% の腕前で投げた輪だ」ということです。
信頼度を 99% に上げると、輪を大きくするので杭にかかりやすくなりますが、そのぶん「だいたいこのあたり」という情報はぼやけます。標本を大きくすれば、 が小さくなるので、信頼度を保ったまま輪を小さくできます。
母平均 の信頼度 95% の信頼区間は で、「同じ方法で区間を作ると、およそ 95% が を含む」という意味だということです。
ある工場で作った袋菓子から 袋を無作為に抽出して重さを量ったところ、平均値は g でした。重さの母標準偏差を g とするとき、この工場の袋菓子の重さの母平均 に対する、次の信頼区間を求めなさい。区間の端は小数第3位を四捨五入しなさい。
(1) 信頼度 95% の信頼区間
(2) 信頼度 99% の信頼区間
上の (1)、(2) をそれぞれ求めなさい。
【解答】
です。
(1) なので
(2) なので
信頼度 95% の区間は g を含みませんが、99% の区間は含みます。「平均が g を超えている」とどこまで強く言えるかは、信頼度の選び方で変わります(この判断の仕方は第10章の仮説検定で学びます)。
公式5 には母標準偏差 が入っていますが、 が分からないのに だけ分かっている、ということは実際にはあまりありません。そこで、 の代わりに標本から計算した値を使います。
大きさ の標本の値を 、標本平均を とする。
をそれぞれ標本分散、不偏分散という。 を標本標準偏差という。 の期待値は母分散 に等しい。
が大きいときは、公式5 の の代わりに、標本標準偏差 または を用いてよい。
標本分散 は、第3章で学んだ「データの分散」を標本について計算したものです。ところが は、平均すると母分散 より少し小さくなり、正確には となります(厳密定義のページで証明します)。そこで の代わりに で割った を使うと、期待値がちょうど になります。第3章の厳密定義で紹介した、表計算ソフトの VAR.P( で割る)と VAR.S( で割る)の違いは、この話です。
が小さめに出る理由は、第3章の厳密定義の結果「 は のとき最小」にあります。本当は母平均 からの離れ具合を測りたいのに、 が分からないので標本自身の真ん中 から測ると、いつも少し近めに出てしまうのです。
待ち合わせ場所で考えてみましょう。本当の集合場所()が分からないまま、集まった人たちの真ん中に旗を立て、そこから一人ひとりの距離を測るとします。旗は集まった人たちに合わせて立てたので、本当の集合場所から測るより、距離はどうしても短めに出ます。その「身内に合わせたぶん」を補うのが、割る数を 減らす工夫です。 が大きいと と の差はほとんどないので、どちらを使っても推定の結果はほぼ変わりません。
が分からないときは標本から散らばりを計算して代わりに使い、 で割る不偏分散 は平均すると母分散 に一致する( で割ると少し小さめになる)ということです。
(1) 大きさ の標本の値が であった。この標本の標本分散 と不偏分散
(2) ある市の中学生から 人を無作為に抽出して 1 日の運動時間を調べたところ、平均値が 分、標本標準偏差が 分であった。この市の中学生の運動時間の母平均 に対する信頼度 95% の信頼区間(区間の端は小数第3位を四捨五入)
上の (1)、(2) をそれぞれ求めなさい。
【解答】
(1) です。偏差は なので、偏差の 2 乗の和は
(2) は大きいので、 の代わりに を使います。, より
「テレビ番組を見た世帯の割合」「新しい商品を知っている人の割合」のように、母集団の中である性質をもつものの割合を母比率といい、 で表します。大きさ の標本の中でその性質をもつものの割合 を標本比率といいます。
標本の中でその性質をもつものの個数を とすると、 は二項分布 に従い(母集団が十分大きいとき)、 です。第7章 公式4 で調べたとおり
で、第8章 公式6 より が大きければ は近似的に正規分布 に従います。母平均のときと同じように不等式を について解き、分からない を の中だけ で置きかえると、次の公式が得られます。
大きさ の無作為標本の標本比率が のとき、 が大きければ、母比率 に対する信頼度 95% の信頼区間は
である。区間の幅の半分 を 以下にしたいときは
を満たす標本の大きさ を選べばよい( には予想される値を使う)。母平均の推定で幅の半分を 以下にしたいときも同様に、 から を決める。
区間の幅は に比例するので、幅を半分にするには標本を 倍、 にするには 倍にしなければなりません。精度を上げるほど、調査の費用は急に大きくなります。予想される が分からないときは、 の最大値 ( のとき)を使えば安全です(厳密定義のページ)。
台風の予報円を思い出してください。天気予報で示される白い円は、「台風の中心がこの円の中に入る確率が 70%」という範囲です。何日も先の予報ほど円は大きく、観測が増えて予報が確かになるほど円は小さくなります。信頼区間も同じで、「どれくらいの確率で入るか」と「円の大きさ」は組になっており、情報(標本)が多いほど、同じ確率のまま円を小さくできます。
母比率 の信頼度 95% の信頼区間は で、幅を狭くするには標本の大きさ を増やし、幅の半分を 以下にする は 以上だということです。
ある市で、市民から 人を無作為に抽出して調べたところ、 人が新しい図書館の開館を知っていました。
(1) 開館を知っている市民の母比率 に対する信頼度 95% の信頼区間(区間の端は小数第5位を四捨五入)
(2) 同じ調査を改めて行うとき、信頼度 95% の信頼区間の幅の半分を 以下にするために必要な標本の大きさの最小値(標本比率は今回と同じ と予想する)
上の (1)、(2) をそれぞれ求めなさい。
【解答】
(1) です。
より
(2) 公式7 より
は整数なので、最小値は 人です。幅を (1) の約半分にするために、標本を約 倍にする必要があります。
まずは公式をそのまま使う、ごく簡単な問題で確認しましょう。
問1
数字 を書いた札が 枚、 を書いた札が 枚、 を書いた札が 枚あります。この 枚の札を母集団とし、札の数字を変量とするとき、母平均 を求めなさい。
問2
母平均 、母標準偏差 の母集団から、大きさ の無作為標本を抽出します。標本平均 の期待値と標準偏差をそれぞれ求めなさい。
,
問3
母平均 、母標準偏差 の母集団から、大きさ の無作為標本を抽出します。標本平均 の分布を正規分布で近似し、正規分布表の値 を使って、 を求めなさい。
より 、
問4
母標準偏差 の母集団から大きさ の無作為標本を抽出したところ、標本平均は でした。母平均 に対する信頼度 95% の信頼区間を求めなさい。
より
問5
ある町の住民から 人を無作為に抽出したところ、 人が自転車で通勤していました。標本比率 と、()の値をそれぞれ求めなさい。
,
難易度マークは ★=基礎、★★=標準、★★★=入試レベルです。★から順に取り組みましょう。
問1 ★
数字 を書いた玉が 個、 を書いた玉が 個、 を書いた玉が 個あります。この 個の玉を母集団とし、玉の数字を変量とするとき、母平均 、母分散 、母標準偏差 をそれぞれ求めなさい。
,,
1 個を無作為に取り出したときの数字を とすると、母集団分布は次のようになります。
| 計 | ||||
|---|---|---|---|---|
です。
問2 ★
問1 の母集団(数字 の玉)から、復元抽出で大きさ の標本を取り出し、標本平均を とします。 の期待値と標準偏差をそれぞれ求めなさい。
期待値 ,標準偏差
母平均 ,母標準偏差 です(問1)。公式3 より
問3 ★
母平均 、母標準偏差 の母集団から、大きさ の無作為標本を抽出します。標本平均 の分布を正規分布で近似し、正規分布表の値 , を使って、 を求めなさい。
, です。 は大きいので、 は近似的に に従います。
のとき 、 のとき なので
問4 ★
ある農園でとれたジャガイモから 個を無作為に抽出して重さを量ったところ、平均値は g でした。重さの母標準偏差を g とするとき、この農園のジャガイモの重さの母平均 に対する信頼度 95% の信頼区間を求めなさい。
(単位 g)
, です。公式5 より
問5 ★
ある高校の 2 年生から 人を無作為に抽出して数学の試験を行ったところ、平均点は 点でした。得点の母標準偏差を 点とするとき、2 年生全体の平均点 に対する信頼度 99% の信頼区間を求めなさい。ここで、信頼度 99% の信頼区間は を に置きかえて作るものとし、区間の端は小数第3位を四捨五入した値で求めなさい。
(単位 点)
, です。
信頼度 95% なら で です。信頼度を上げると区間は広がります。
問6 ★
ある地域の世帯から 世帯を無作為に抽出したところ、 世帯がペットとして犬を飼っていました。この地域で犬を飼っている世帯の母比率 に対する信頼度 95% の信頼区間を求めなさい。
標本比率は です。
公式7 より
犬を飼っている世帯は、この地域でおよそ % から % と見積もられます。
問7 ★
全校生徒 人から 人を選んで、通学時間の調査をします。選び方として次の (ア)〜(オ) を考えました。
(ア) 名簿の 番から 番の番号について、コンピューターで 以上 以下の整数を重複なく無作為に 個出し、その番号の生徒を選ぶ。
(イ) ある朝、校門に早く来た順に 人を選ぶ。
(ウ) 学校のホームページでアンケートを募集し、回答した生徒から先着順に 人を選ぶ。
(エ) 人の名前を同じ形の紙に 1 枚ずつ書いて箱に入れ、よくかき混ぜてから 枚を引き、その生徒を選ぶ。
(オ) 調査をする人が「平均的な生徒」だと思う 人を選ぶ。
無作為抽出といえるものを、上の (ア)〜(オ) のうちからすべて求めなさい。
(ア)、(エ)
無作為抽出は「どの生徒も同じ確率で選ばれる」方法です。
答えは です。
問8 ★
大きさ の標本の値が でした。この標本の標本分散 と不偏分散 をそれぞれ求めなさい。
,
標本平均は です。偏差は なので、偏差の 2 乗の和は
公式6 より
問9 ★★
母標準偏差が であることが分かっている母集団の母平均 を、信頼度 95% で推定します。信頼区間の幅(区間の右端と左端の差)を 以下にするために必要な標本の大きさ の最小値を求めなさい。
信頼区間 の幅は です。
幅が 以下になる条件は
で、 について解くと
両辺は正なので 2 乗して
は整数なので、最小値は です。幅の「半分」が 以下、と言いかえても同じ式になります。
問10 ★★
ある政策に賛成する人の割合を調べる世論調査を計画しています。以前の調査では賛成の割合は でした。今回の標本比率も に近いと予想して、母比率に対する信頼度 95% の信頼区間の幅の半分を 以下にするために必要な標本の大きさ の最小値を求めなさい。
公式7 で , とすると
なので
は整数なので、最小値は です。
問11 ★★
母標準偏差 の母集団から大きさ の無作為標本を抽出し、標本平均 と母平均 の差の絶対値が 以下になる確率を 以上にしたいと考えます。 の分布を正規分布で近似し、正規分布表の値 を使って、 の最小値を求めなさい。
で、 は近似的に に従います。
これが 以上 ⇔ ⇔ です( は増加)。
より、最小値は です。 を大きくするほどこの確率は に近づき、これが大数の法則の中身です。
問12 ★★
ある駅の利用者から 人を無作為に抽出して、駅までの所要時間を調べたところ、平均値は 分、標本標準偏差は 分でした。利用者全体の所要時間の母平均 に対する信頼度 95% の信頼区間を求めなさい。
(単位 分)
母標準偏差は分かりませんが、 は大きいので、公式6 により標本標準偏差 で代用します。
問13 ★★
さいころを 回投げ、出た目の平均を とします。さいころの目( から が同じ確率)を母集団分布と考えて、次の値を求めます。
(1) の期待値と標準偏差
(2) の分布を正規分布で近似し、正規分布表の値 を使って求めた
上の (1)、(2) の値をそれぞれ求めなさい。
(1) 期待値 ,標準偏差 (2)
(1) 1 回の目を とすると
目の 2 乗の合計は なので
公式3 より で
(2) 母集団分布は正規分布ではありませんが、 は大きいので、公式4 により は近似的に に従います。 のとき なので
問14 ★★
母標準偏差 が分かっている母集団で、母平均の信頼区間を作ります。
(1) 信頼度 95% のまま、信頼区間の幅を今の にするには、標本の大きさを何倍にすればよいか
(2) 標本の大きさを変えずに、信頼度を 95% から 99% に上げると、信頼区間の幅は何倍になるか(信頼度 99% では の代わりに を使い、小数第3位を四捨五入する)
上の (1)、(2) の値をそれぞれ求めなさい。
(1) 倍 (2) 倍
(1) 信頼区間の幅は で、 に比例します。標本の大きさを 倍にすると幅は 倍になるので
(2) 幅は または に比例するので
信頼度を 4 ポイント上げるだけで、幅は 3 割以上広がります。
問15 ★★
母標準偏差 の母集団から大きさ の無作為標本を抽出し、母平均に対する信頼度 95% の信頼区間を作ったところ、 となりました。標本平均 の値と標本の大きさ をそれぞれ求めなさい。
,
信頼区間は を中心とする区間なので、中点が標本平均です。
幅の半分は で、これが に等しいので
より です。
問16 ★★
ある工場で作った部品から 個を無作為に抽出して検査したところ、不良品が 個ありました。この工場の部品全体の不良品の母比率 に対する信頼度 95% の信頼区間を、区間の端を小数第5位で四捨五入した値で求めなさい。
標本比率は です。
公式7 より、信頼区間の左端と右端は
小数第5位を四捨五入して です。不良品の割合はおよそ % から % と見積もられます。
問17 ★★★
数字 を書いた札が 枚ずつあり、この 枚を母集団とします。ここから大きさ の標本を取り出し、標本平均を とします。
(1) 非復元抽出(1 枚目を戻さずに 2 枚目を引く)のときの の分散
(2) 復元抽出(1 枚目を戻してから 2 枚目を引く)のときの の分散
上の (1)、(2) の値をそれぞれ求めなさい。
(1) (2)
母平均は 、母分散は
(1) 非復元抽出では、2 枚の組 の 通りが同じ確率 で起こり、 はそれぞれ です。 で、偏差の 2 乗は です。その合計は なので
(2) 復元抽出では公式3 が使えて
(1) は (2) の 倍で、これは に一致します(厳密定義 定理1)。同じ札を 2 回引くことがない分、非復元抽出のほうがぶれは小さくなります。 が にくらべて十分大きければ、この倍率は に近くなります。
問18 ★★★
母平均 、母分散 の母集団から、復元抽出で大きさ の標本 を取り出します。標本平均を 、標本分散を とします。
(1) が成り立つこと
(2) の期待値 を で表した式
上の (1) を示し、(2) を求めなさい。
(1) 解説を参照 (2)
(1) 、同様に です。
(2) とおくと、 です。 と は独立なので、第6章 公式6 より差でも分散は足し算になり
より なので
標本分散は平均すると母分散の半分にしかなりません。 で割った不偏分散 なら となり、公式6 の の場合が確かめられました(一般の は厳密定義 定理2)。
問19 ★★★
ある選挙で、投票を終えた人から 人を無作為に抽出して、候補者 A に投票したかどうかを調べます。A に投票した人が 人だったとき、A の得票率 に対する信頼度 95% の信頼区間の左端が より大きくなるような の最小値を求めなさい。
標本比率を とすると、左端が より大きい条件は
です。 が に近いとき はほぼ なので、 として見当をつけると
となり、 が候補です。, を実際に確かめます。
が大きいほど左端は大きくなる( の範囲では が増え、 は減る)ので、最小値は です。 人中 人(%)の支持があれば、「A の得票率は過半数」と信頼度 95% で見込めることになります。
問20 ★★★
母比率の見当がまったくつかないまま、信頼度 95% の信頼区間の幅の半分が必ず 以下になるように世論調査の人数を決めます。
(1) のとき が成り立つこと
(2) 標本比率 がどんな値になっても となるような標本の大きさ の最小値
上の (1) を示し、(2) を求めなさい。
(1) 解説を参照 (2)
(1) 平方完成すると
なので です。等号は のときに成り立ちます。
(2) (1) より、 がどんな値でも
で、 のとき等号が成り立ちます。したがって、条件は と同じです。
最小値は です。全国規模の世論調査で「約 2000〜3000 人」という数がよく使われるのは、この計算で誤差を ±2 ポイント程度に抑えられるからです。母集団が 1 億人でも 100 万人でも、必要な人数はほとんど変わりません(厳密定義のページ)。
1936 年のアメリカ大統領選挙は、現職のフランクリン・ルーズベルトと、共和党のアルフ・ランドンの争いでした。当時、選挙予想で名高かったのが雑誌『リテラリー・ダイジェスト』です。同誌はおよそ 1000 万枚の往復はがきを送り、約 240 万通の回答を集めて、「ランドンが約 57% の得票で勝つ」と予想しました。
ところが結果は、ルーズベルトが約 61% の得票で圧勝し、48 州のうち 46 州を制しました。一方、ジョージ・ギャラップらは、はるかに少ない数千〜5 万人ほどの調査で、ルーズベルトの勝利を当てていました(※調査人数や得票率の数値は資料によって多少異なります)。
240 万人という「標本の大きさ」は十分すぎるほどでした。問題は選び方です。はがきの送り先は、雑誌の購読者名簿や電話帳、自動車の登録名簿から作られていました。大恐慌の後の当時、電話や自動車を持っていたのは比較的裕福な人たちで、ルーズベルトの政策に反対する人が多かったのです。さらに、はがきを返送するのは関心の強い人に偏ります。
公式3 の は、無作為に選んだときのぶれの大きさです。選び方が偏っていると、 をいくら大きくしてもその偏りは消えず、「大きく間違った値に、自信たっぷりに近づく」だけになります。この出来事は、標本の大きさより抽出の仕方が大切だという教訓として語り継がれています。
豆知識
ギャラップたちも、1948 年の大統領選挙では失敗しました。性別・年齢などの割合が母集団と同じになるように、調査員が回答者を選ぶ「割当法」を使っていたため、調査員の選び方に偏りが入り込み、共和党のデューイの勝利を予想したのです。結果はトルーマンの勝利で、開票前に「DEWEY DEFEATS TRUMAN(デューイ、トルーマンを破る)」と刷ってしまった新聞を、当選したトルーマンが笑顔で掲げる写真が有名です。これをきっかけに、世論調査は無作為抽出を重視するようになりました。
公式5 の信頼区間の考え方を理論としてまとめたのは、ポーランド出身の統計学者イェジ・ネイマン(1894〜1981)です。
1934 年、ネイマンはロンドンの王立統計協会で、標本調査の方法についての論文を発表しました。当時は、専門家が「母集団をよく代表していそうな地域」を選んで調べる有意選出という方法も使われていました。ネイマンは、ある国勢調査のデータを使った有意選出の研究がうまくいかなかった例を分析し、無作為抽出(とくに、母集団をいくつかの層に分けてから各層で無作為に選ぶ層化抽出)のほうが優れていることを、数学的に示しました。
同じ論文でネイマンが示したのが、「標本から区間を作り、その作り方が一定の割合で真の値を含むようにする」という信頼区間の考え方です。本文で強調したように、信頼度 95% とは「真の値が 95% の確率で動いている」のではなく、「区間の作り方が 95% の割合で当たる」という意味です。ネイマンはこの区別にこだわり、1937 年の論文で理論を整えました。ネイマンはその後アメリカに渡り、カリフォルニア大学バークレー校に統計学の一大拠点を築きました。
豆知識
日本のテレビの視聴率も標本調査です。調査会社の関東地区の調査世帯は、2020 年からは約 2700 世帯とされています(※時期によって変わります)。視聴率 % の番組なら、標本比率の標準偏差は なので、信頼度 95% の誤差はおよそ ±1.1 ポイントです。「視聴率が 0.3 ポイント上がった」というニュースは、誤差の範囲かもしれません。
池にいる魚の数を知りたいとき、水を全部抜いて数えるのは大変です。そこで使われるのが捕獲再捕獲法です。
まず魚を何匹かつかまえ、印をつけて池に戻します。例えば 匹に印をつけたとします。しばらくして魚が池の中でよく混ざったころに、もう一度 匹をつかまえたところ、そのうち 匹に印がついていました。2 回目の標本で印のある魚の割合は です。これが池全体の印のある魚の割合(母比率) に近いと考えると
と、池の魚はおよそ 匹と見積もれます。1 回目の印は「母集団に目印を混ぜる」工夫で、2 回目の調査は母比率の推定そのものです。
この方法は、19 世紀の終わりにデンマークの生物学者ペーターセンがカレイの数の調査に使い、1930 年にはアメリカのリンカーンが渡り鳥の数の推定に使ったことで広まりました(※起源はさらにさかのぼるともいわれます)。今では野生動物の個体数調査に欠かせない方法です。本文の採血の例えと同じく、印のついた魚が池の中でよく混ざっていることが、この推定の前提になります。
豆知識
第二次世界大戦中、連合国の統計学者は、捕獲したドイツ軍の戦車の部品に刻まれた通し番号から、戦車の生産台数を推定しました。番号の最大値を 、調べた台数を とすると、 がよい推定になります。ある時期の月産台数について、スパイなどの情報からは約 1400 台とされていたのに、統計的な推定は約 250 台で、戦後に分かった実際の数はそれに近いものでした(※数値は資料によって異なります)。「ドイツ戦車問題」として、いまも推定の教材に使われています。
※ここは発展ページです。確率変数の独立・共分散・大数の法則は第6章、正規分布と中心極限定理は第8章の厳密定義で扱いました。ここでは、無作為標本を確率変数の列として定め、非復元抽出で標本平均のぶれが小さくなる割合、不偏分散の期待値が母分散に一致すること、推定量の「よさ」の基準、信頼区間の正確な意味を証明とともに整理します。最後に、必要な標本の大きさが母集団の大きさにほとんどよらないことを確かめます。
母集団分布に従う確率変数 が互いに独立であるとき、これを大きさ の無作為標本という(復元抽出で得られる標本がこれにあたる)。 の関数として決まる確率変数を統計量といい、標本平均
はその代表である。
非復元抽出では、 番目に取り出した個体の値 は、それだけを見るとやはり母集団分布に従います(くじ引きで何番目に引いても当たる確率が同じなのと同じ理由です。場合の数と確率の分野 第5章 定理3・第8章 定理6)。しかし、前に取り出した個体は二度と出ないので、 は独立ではありません。その影響を正確に測るのが次の定理です。
以下、共分散 (第6章 定義4・定理4)を使います。期待値の線形性から が成り立ち、第6章 定理4 の をくり返し使うと
となります。
母平均 、母分散 、大きさ の母集団から、非復元抽出で大きさ ()の標本を取り出すとき、標本平均 について
が成り立つ。
証明 各 は母集団分布に従うので、, であり、 は期待値の線形性から従う。
次に、 のとき、 の同時分布は「異なる 2 個体を順に無作為に選んだときの値の組」の分布で、 によらない。よって は一定の値 である。
を求めるため、いったん母集団の全員を取り出す場合()を考える。このとき は母集団の値の総和で、どの順に取り出しても同じ定数だから、分散は である。したがって
大きさ の標本では、ペア ()が 組あるので
両辺を で割れば結論を得る。
係数 を有限母集団修正といいます。実践 問17(,)の がこれです。 なら 、 なら (全員を調べればぶれはない)となり、 が にくらべて十分大きければほぼ なので、本文では復元抽出の式 をそのまま使いました。 は、「大きい値の個体を引くと、残りは小さい値の個体が多くなる」ことを表しています。
大きさ ()の標本 に対し
をそれぞれ標本分散、不偏分散という。
が母平均 、母分散 の母集団からの無作為標本(定義1)であるとき
が成り立つ。
証明 第3章の厳密定義で示した等式「」は、どんな実数の組でも成り立つので、 に 、 に を入れて 倍すると
両辺の期待値をとる。、(第6章 定理5)なので
よって となり、 で割ると 、 で割ると の式を得る。
証明の等式は、「 からの離れ具合の 2 乗和」が「 からの離れ具合の 2 乗和」より だけ大きいことを表しています。本文の「待ち合わせ場所」の例えで、旗()から測ると距離が短めに出る分が、ちょうど標本平均のぶれ の 倍、つまり ひとつ分です。 個の偏差 は和が という制約を 1 つ受けているので、自由に動けるのは 個分だ、という言い方もされます(自由度)。
母集団の未知の値 (母平均・母比率など)を見積もるための統計量 を、 の推定量という。
を満たすとき、 を の一致推定量という。
(1) 標本平均 は母平均 の不偏推定量であり、一致推定量である。
(2) 標本比率 は母比率 の不偏推定量であり、一致推定量である。
(3) 不偏分散 は母分散 の不偏推定量である。一方、 について が成り立ち、等号は がただ 1 つの値しかとらないときに限る。
証明 (1) 不偏性は (第6章 定理5)。一致性は、第6章 定理6(チェビシェフの不等式)より
となることから従う(第6章 定理7 の大数の法則そのもの)。
(2) 性質をもつとき 、もたないとき をとる確率変数を とすると、 の母平均は 、母分散は で、 である。(1) を当てはめればよい。
(3) 前半は定理2。後半は、 の分散が 以上であることから
よって 。等号は 、つまり がただ 1 つの値しかとらないとき(第6章 定理1)に限る。
(3) は、「2 乗して不偏」でも「平方根をとると不偏とは限らない」ことを示しています。 は を平均すると少し小さめに見積もりますが、 が大きいとその差は小さく、本文では気にせず の代わりに使いました。
不偏性と一致性は別の性質です。例えば「1 個目の値 だけ」を推定量にすると、 で不偏ですが、 を増やしても少しも に近づかないので一致推定量ではありません。逆に標本分散 は不偏ではありませんが、 で となり、一致推定量であることが知られています(証明には の 4 乗の期待値を使います)。
とする。2 つの統計量 が、未知の値 がどんな値であっても
を満たすとき、区間 を に対する信頼度 (%)の信頼区間という。等号が近似的にしか成り立たないときは、近似的な信頼区間という。実際に得られた標本から計算した区間 も信頼区間と呼ぶ。
定義の確率 で動くのは , のほうで、 は定数です。実際の標本から計算した は数の区間なので、「 が入っているか、いないか」のどちらかに決まっており、「 に が入る確率が 」という言い方は定義からは出てきません(小話 kb2)。
母集団分布が正規分布 で、 が分かっているとする。大きさ の無作為標本の標本平均を とすると、どんな に対しても
が成り立つ(正規分布表の値で )。母集団分布が正規分布でないときは、左辺は で に収束する。
証明 とおく。かっこの中の 2 つの不等式は、それぞれ
と同値なので、左辺は に等しい。母集団分布が正規分布なら、 は正規分布 に従い(第8章 定理7 の後に述べた再生性)、第8章 定理4 の後半より は に従う。よって左辺は に等しい。一般の母集団では、()なので、第8章 定理7(中心極限定理)より となる。
証明で使ったのは「 についての確率の話を、 についての不等式に書き直す」ことだけです。 のように、未知の を含むのに分布が によらない量を枢軸量(ピボット)といい、多くの信頼区間はこの形で作られます。
本文では、 が分からないとき が大きければ標本から計算した値で代用しました。 が小さいときは、 を に置きかえた
が、正規母集団では 分布(自由度 )という、正規分布より少し裾の厚い分布に従うことが知られています。 の代わりに、例えば なら約 、 なら約 を使います( が大きいほど に近づきます)。この分布の発見にまつわる話は、第10章で紹介します。
母比率の信頼区間(本文 公式7)は、 の を で置きかえた近似です。 が小さいときや、 が や に近いときは、実際の信頼度が % をかなり下回ることがあるため、置きかえをしない改良版の区間(ウィルソンの区間など)も使われています。
(1) のとき である。したがって、 ならば、標本比率 がどんな値でも、本文 公式7 の信頼区間の幅の半分は 以下になる。
(2) 大きさ の母集団から非復元抽出するとき、 である。 のもとで が保証される条件は
である。
証明 (1) は実践 問20 と同じく による。
(2) 前半は、定理3 (2) と同じく の確率変数に定理1 を当てはめたもの。 のとき最大になるので、条件は
で、 について解くと となる。
()で計算すると、次のようになります。
| 母集団の大きさ | 万 | 万 | 万 | 億 |
|---|---|---|---|---|
| 必要な の最小値 |
母集団が 万人から 億人に 万倍になっても、必要な標本の大きさは 倍にもなりません。標本調査の精度を決めるのは、母集団の何%を調べたかではなく、何人を調べたかです(小話 kb1 の 240 万人の調査が失敗したのは、人数ではなく選び方の問題でした)。なお、 なら より 人、 なら第8章 実践 問18 の 人です。
定理4 の同値変形は、逆向きに読むこともできます。「母平均が である」と仮定したとき、 が標本から作った信頼度 95% の信頼区間に入らないことは、()と同値です。これは、第5章の厳密定義で導入した両側検定で、有意水準 % の棄却域に が入ることにほかなりません。第10章では、この対応を手がかりに、正規分布を使った仮説検定を学びます。本文の例題5 で「 g は 95% の区間には入らないが、99% の区間には入る」と見たことが、有意水準 % と % で結論が分かれる例になります。
この章の学習が終わったら
学習完了テストを受ける