問1
5 個のデータ の平均値を求めなさい。
答えを見る答えを閉じる
(合計 を で割る)
目次 / データの分析と統計 / 数学I
—— たくさんの数を「表」と「1つの数」にまとめる ——
この章では、集めたデータを整理する方法と、データ全体の特徴を1つの数で表す「代表値」を学びます。度数分布表とヒストグラムでデータの集まり方を目で見てから、平均値・中央値・最頻値の3つの代表値を求めます。3つの代表値がそれぞれ何を得意とし、どんなときに食い違うかを知っておくと、ニュースに出てくる「平均」の数字も一歩引いて読めるようになります。
身長やテストの得点のように、調べる項目のことを変量といい、変量の値を集めたものをデータ、値の個数をデータの大きさといいます。
集めたばかりのデータは、数字がばらばらに並んでいるだけで、全体の様子がつかみにくいものです。そこで、値の範囲をいくつかの区間に区切り、それぞれの区間に入る値の個数を数えます。
階級は「 以上 未満」のように、左の端を含み、右の端を含まない形で区切るのが基本です。 点ちょうどの値は、次の「 以上 未満」の階級に入ります。
収穫したミカンは、選果場で1個ずつ重さを量られ、S・M・L…の箱に振り分けられます。お店に届くのは「M の箱がいくつ」という情報で、1個1個の重さは忘れられてしまいます。度数分布表もこれと同じです。個々の値を手放すかわりに、全体がどのあたりに集まっているかがひと目で分かるようになります。階級値は、箱の中のミカンをみな「その箱の標準の重さ」とみなすための目安です。
度数分布表は、データを階級という箱に振り分けて個数を数えた表で、ヒストグラムはそれを柱の高さで見せたグラフだということです。
次のデータは、10 人が受けた小テスト(20 点満点)の得点です(単位は点)。
(1) 点以上 点未満の階級から始めて、階級の幅を 点とする度数分布表をつくり、各階級の度数・相対度数・累積度数を求めなさい。
(2) 得点が 点未満の人数を求めなさい。
【解答】
(1) 値を1つずつ階級に振り分けます。 点の人は「 以上 未満」に入ることに注意します。
| 得点(点) | 度数(人) | 相対度数 | 累積度数(人) |
|---|---|---|---|
| 5 以上 10 未満 | 3 | 0.3 | 3 |
| 10 以上 15 未満 | 5 | 0.5 | 8 |
| 15 以上 20 未満 | 2 | 0.2 | 10 |
| 計 | 10 | 1 |
相対度数は度数を で割った値、累積度数は上から度数を足していった値です。
(2) 点未満の人数は、「 以上 未満」の階級までの累積度数なので 人です。
例題1の度数分布表をヒストグラムにすると、次の図になります。10 点台前半に山があることが、ひと目で分かります。
データ全体の特徴を1つの数で表したものを代表値といいます。よく使われる代表値は、平均値・中央値・最頻値の3つです。まずは、いちばんなじみのある平均値から見ていきましょう。
大きさ のデータの値を とするとき、平均値 は
( は「エックスバー」と読む。)
度数分布表しかないときは、各階級の値がすべて階級値に等しいとみなして計算する。階級値を 、それぞれの度数を とすると
この値は、もとのデータから求めた平均値の近似値になる。
全部を足して個数で割る、というのが平均値の計算です。度数分布表からの式は、「階級値 度数」で各階級の合計をまとめて見積もってから、全体の個数で割っています。
高さのばらばらな積み木の塔が何本か並んでいるところを想像してください。全部をいったん崩して、同じ本数の塔に、同じ高さずつ積み直します。そのときの塔の高さが平均値です。高い塔から低い塔へ積み木を移して、でこぼこを「ならす」わけです。
平均値は、全部を足して個数で割った値で、データのでこぼこをならした高さだということです。
例題1の 10 人の得点について、次の値を求めなさい。
(1) もとのデータから求めた平均値 (2) 例題1の度数分布表から求めた平均値
【解答】
(1) 合計は
なので、これを で割ります。
(2) 階級値は ,, です。
(1) とは 点ずれました。とくに「 以上 未満」の階級は、実際の値 , の平均が 点なのに 点とみなしたため、大きめに数えています。階級値でまとめた分だけ、誤差が出るのです。
データを値の小さい順に並べたとき、中央の位置にくる値を中央値(メジアン)という。データの大きさを とすると
最初に小さい順に並べ直すのを忘れないでください。与えられた順番のまま真ん中を取ってしまうのが、いちばん多いミスです。個数が偶数のときは真ん中が2つあるので、その2つの平均をとります。
マラソン大会で 101 人が完走したとします。ちょうど 51 番目にゴールした人のタイムが、このデータの中央値です。自分のタイムがそれより速ければ「上位半分に入った」と言えます。優勝した人がどれほど速くても、最後の人がどれほど遅れても、51 番目の人のタイムは変わりません。この「動きにくさ」は、あとで大切になります。
中央値は、小さい順に並べてちょうど真ん中にある値で、個数が偶数のときは真ん中の2つの平均をとるということです。
(1) 7 人の通学時間(分)のデータ の中央値を求めなさい。
(2) 例題1の 10 人の得点の中央値を求めなさい。
【解答】
(1) 小さい順に並べると です。 は奇数なので、 番目の値 分が中央値です。
(2) 小さい順に並べると
は偶数なので、5 番目の と 6 番目の の平均をとって
データの中で最も多く現れる値を最頻値(モード)という。
靴屋さんが新しいスニーカーを仕入れるとき、知りたいのはお客さんの足の平均サイズではなく、いちばんよく売れるサイズです。平均が 24.7 cm と分かっても、0.5 cm 刻みの靴にそんなサイズはありません。「いちばんよく出る値」が知りたい場面で頼りになるのが、最頻値です。
最頻値はデータの中でいちばん多く現れる値で、度数分布表では度数がいちばん大きい階級の階級値を使うということです。
例題1の 10 人の得点について、次の値を求めなさい。
(1) もとのデータから求めた最頻値 (2) 例題1の度数分布表から求めた最頻値
【解答】
(1) 点だけが 2 回現れ、ほかの値は 1 回ずつなので、最頻値は 点です。
(2) 度数が最も大きいのは「 以上 未満」( 人)なので、その階級値 点が最頻値です。
同じデータなのに、平均値 点、中央値 点、最頻値 点と、3つの代表値はそれぞれ違う値になりました。最頻値は、もとのデータから求めるか表から求めるかでも変わります。
3つの代表値は、どれか1つが正しいというものではありません。データの形によって、得意なもの・不得意なものがあります。
町の小さな喫茶店に、お客さんが 9 人いるとします。そこへ資産 1000 億円の大富豪がふらりと入ってきました。店にいる 10 人の平均資産は、その瞬間に 100 億円を超えます。けれども、ほかの 9 人の財布の中身は 1 円も増えていません。一方、中央値のほうは、並びの真ん中が1人分ずれるだけで、ほとんど動きません。
所得や貯蓄のように、多くの人は小さめの値に集まり、ごく少数の人がとても大きな値をもつデータでは、ヒストグラムの山が左に寄り、右に長い裾ができます。この形では、裾の先の大きな値に引っ張られて、平均値がいちばん右に来やすくなります。
平均値は外れ値や長い裾に引っ張られやすく、中央値は動きにくいので、データの形を見てから代表値を選ぶということです。
5 人が 1 か月に読んだ本の冊数は でした。
(1) 平均値と中央値を求めなさい。
(2) このデータの代表値として適切なのは平均値と中央値のどちらか、理由とともに示しなさい。
【解答】
(1) 平均値は 冊、中央値は 3 番目の値で 冊です。
(2) が適切です。5 人中 4 人は 4 冊以下しか読んでいないのに、平均値の 8 冊は、28 冊という外れ値に引っ張られて、ほとんどの人の実際の冊数からかけ離れているからです。
大きな数がたくさん並ぶデータの平均を手で計算するのは大変です。そこで、基準にする値を決めて、そこからの差だけで計算する方法があります。
変量 の各値を、定数 , を使って と変換すると、平均値も同じ式で変換される。
とくに、基準にする値 (仮平均)を決めて とおくと、 となる。さらに とおけば、 である。
理由は、 の値を全部足してみると分かります。
これを で割ると
料理で小麦粉を量るとき、ボウルをはかりにのせてから目盛りを に合わせますね。ボウルの重さを毎回引き算しなくても、増えた分だけを読めば済むからです。仮平均も同じで、切りのよい値を「 の位置」にして、そこからの差だけで平均を計算し、最後に基準の値を足し戻します。 で割るのは、cm を m に直すような「単位の付けかえ」にあたります。
各値を に変えると平均値も に変わるので、基準の値からの差で計算してから足し戻せば、大きな数の平均も楽に求められるということです。
(1) 5 人の身長(cm)のデータ の平均値を、仮平均を cm として求めなさい。
(2) ある 7 日間の最高気温の平均値は でした。摂氏温度 と華氏温度 の間には の関係があります。この 7 日間の最高気温の平均値を華氏で表した値を求めなさい。
【解答】
(1) とおくと、 の値は です。
よって cm です。
(2) は , の変換なので
7 日分の気温を1つずつ華氏に直してから平均しても、同じ値になります。もとの気温が1つも分からなくても、平均値だけで答えが出せるのが変換のよいところです。
まずは公式をそのまま使う、ごく簡単な問題で確認しましょう。
問1
5 個のデータ の平均値を求めなさい。
(合計 を で割る)
問2
5 個のデータ の中央値を求めなさい。
(小さい順に と並べた 3 番目)
問3
4 個のデータ の中央値を求めなさい。
( の 2 番目と 3 番目の平均 )
問4
7 個のデータ の最頻値を求めなさい。
( 回現れる)
問5
大きさ のデータで、ある階級の度数が のとき、その階級の相対度数を求めなさい。
難易度マークは ★=基礎、★★=標準、★★★=入試レベルです。★から順に取り組みましょう。
問1 ★
6 人の 1 週間の勉強時間(時間)は でした。このデータの平均値を求めなさい。
時間
合計を個数 で割ります。
問2 ★
8 人のハンドボール投げの記録(m)は でした。このデータの中央値を求めなさい。
m
小さい順に並べ直します。
は偶数なので、4 番目の と 5 番目の の平均をとります。
問3 ★
9 人の靴のサイズ(cm)は次のとおりでした。
このデータの最頻値と中央値を求めなさい。
最頻値 cm、中央値 cm
値ごとに個数を数えると、 が 1 個、 が 2 個、 が 2 個、 が 3 個、 が 1 個です。最も多いのは なので、最頻値は cm です。
小さい順に並べると
は奇数なので、 番目の cm が中央値です。
問4 ★
次の表は、10 人の通学時間をまとめた度数分布表です。
| 通学時間(分) | 度数(人) |
|---|---|
| 0 以上 10 未満 | 1 |
| 10 以上 20 未満 | 4 |
| 20 以上 30 未満 | 3 |
| 30 以上 40 未満 | 2 |
| 計 | 10 |
20 分以上 30 分未満の階級の階級値と相対度数を求めなさい。また、通学時間が 20 分未満の人数を求めなさい。
階級値 分、相対度数 、20 分未満は 人
階級値は階級の真ん中の値なので 分です。
相対度数は度数をデータの大きさで割って です。
20 分未満の人数は、「10 以上 20 未満」の階級までの累積度数なので 人です。
問5 ★
次の表は、10 人のある日の睡眠時間をまとめた度数分布表です。
| 睡眠時間(時間) | 度数(人) |
|---|---|
| 5 以上 6 未満 | 1 |
| 6 以上 7 未満 | 2 |
| 7 以上 8 未満 | 4 |
| 8 以上 9 未満 | 2 |
| 9 以上 10 未満 | 1 |
| 計 | 10 |
この表から求めた最頻値と、中央値が含まれる階級を求めなさい。
最頻値 時間、中央値は 7 時間以上 8 時間未満の階級に含まれる
度数が最も大きいのは「7 以上 8 未満」(4 人)なので、最頻値はその階級値 時間です。
なので、中央値は小さいほうから 5 番目と 6 番目の値の平均です。累積度数は上から なので、4 番目から 7 番目の人が「7 以上 8 未満」の階級にいます。5 番目も 6 番目もこの階級に入るので、その平均である中央値も の階級に含まれます。
問6 ★
次の表は、10 人の 1 週間の読書時間をまとめた度数分布表です。
| 読書時間(時間) | 度数(人) |
|---|---|
| 0 以上 2 未満 | 3 |
| 2 以上 4 未満 | 4 |
| 4 以上 6 未満 | 2 |
| 6 以上 8 未満 | 1 |
| 計 | 10 |
この表から平均値を求めなさい。
時間
各階級の値をすべて階級値 とみなして計算します。(階級値)×(度数)の合計は
なので
問7 ★
5 個のデータ の平均値が のとき、 の値を求めなさい。
平均値が で個数が なので、合計は です。
よって です。
問8 ★
ある店の 5 日間の来店者数(人)は でした。仮平均を 人として、このデータの平均値を求めなさい。
人
とおくと、 の値は です。
よって 人です。
問9 ★★
7 人の 1 か月のこづかい(千円)は次のとおりでした。
(1) 7 人全員のデータ (2) を除いた 6 人のデータ
上の (1)、(2) のそれぞれについて、平均値と中央値を求めなさい。
(1) 平均値 千円、中央値 千円 (2) 平均値 千円、中央値 千円
(1) 合計は なので、平均値は 千円です。すでに小さい順に並んでいて なので、中央値は 4 番目の 千円です。
(2) 合計は なので、平均値は 千円です。 の 3 番目と 4 番目の平均をとって、中央値は 千円です。
という外れ値を除くと、平均値は 千円も下がりましたが、中央値は 千円しか動いていません。
問10 ★★
5 個のデータ がある。 は自然数で、このデータの中央値が である。このとき、 の値をすべて求めなさい。
個数は なので、中央値は小さいほうから 3 番目の値です。 以外の値を小さい順に並べると です。
のとき 以下の値が ,, の 3 個あり、そのうち最大の が 3 番目になります(たとえば なら 、 なら )。中央値は で、条件を満たします。
のとき 3 番目は と の小さいほうで、どちらも より大きいので、中央値は になりません。
よって の自然数で、 です。
問11 ★★
A 組 4 人の数学のテストの平均点は 点、B 組 6 人の平均点は 点でした。A 組と B 組を合わせた 10 人の平均点を求めなさい。
点
平均点に人数をかけると合計点に戻せます。A 組の合計は 点、B 組の合計は 点です。
2 つの平均点をそのまま平均した 点は誤りです。人数の多い B 組のほうに、平均が引き寄せられます。
問12 ★★
変量 のデータの平均値が である。変量 , を , で定めるとき、 と の平均値をそれぞれ求めなさい。
,
のとき です。
と書き直すと , なので
問13 ★★
ある商品の 6 店舗での価格(円)は次のとおりでした。
価格を 円とし、変量 を利用して、価格の平均値を求めなさい。
円
の値は、順に です。
なので
問14 ★★
ある店で 10 日間に売れたケーキの個数は次のとおりでした。
(1) もとのデータから求めた平均値 (2) 5 個以上 10 個未満の階級から始めて階級の幅を 5 個とした度数分布表をつくり、その表から求めた平均値
上の (1)、(2) の値をそれぞれ求めなさい。
(1) 個 (2) 個
(1) 合計は なので、平均値は 個です。
(2) 値を振り分けると、次の度数分布表になります。
| 個数 | 度数(日) | 階級値 |
|---|---|---|
| 5 以上 10 未満 | 2(8, 9) | 7.5 |
| 10 以上 15 未満 | 3(11, 13, 14) | 12.5 |
| 15 以上 20 未満 | 4(16, 17, 19, 19) | 17.5 |
| 20 以上 25 未満 | 1(22) | 22.5 |
(階級値)×(度数)の合計は
なので
階級の中の値をすべて階級値とみなしたため、(1) より 個小さくなりました。
問15 ★★
6 個のデータ に値 を 1 つ加えた 7 個のデータの平均値が になった。 の値と、7 個のデータの最頻値と中央値を求めなさい。
、最頻値 、中央値
7 個の合計は です。もとの 6 個の合計は なので
7 個のデータを小さい順に並べると です。 が 3 回で最も多いので最頻値は 、4 番目の値から中央値も です。
問16 ★★
5 回のテストの平均点が 点でした。6 回目のテストで何点をとれば、6 回の平均点が 点になるかを求めなさい。
点
5 回の合計点は 点、6 回で平均 点にするための合計点は 点です。
平均を 3 点上げるには、6 回目で「今の平均 点」より 点多くとる必要がある、と考えることもできます。
問17 ★★★
を実数とする。5 個のデータ の平均値と中央値が等しくなるような の値をすべて求めなさい。
平均値は です。中央値は小さいほうから 3 番目の値で、 の位置によって変わるので場合分けします。
のとき 小さい順に となり、中央値は です。
これは を満たします。
のとき となり、中央値は です。
これは を満たします。
のとき となり、中央値は です。
これは を満たします。
以上より です。
問18 ★★★
5 個の整数からなるデータがある。最小値は 、最大値は 、中央値は 、平均値は で、最頻値はただ 1 つで である。このデータの 5 個の値を小さい順に求めなさい。
小さい順に とすると、,,中央値から です。平均値が なので合計は で
が 1 回しか現れないと、ほかの値も少なくとも 1 回ずつ現れているので、 だけが最も多いことになりません。よって は 2 回以上現れ、 か です。
データは で、 だけが 2 回現れるので最頻値もただ 1 つの です。答えは です。
問19 ★★★
次の表は、10 人の生徒が 1 か月に読んだ本のページ数をまとめた度数分布表です。
| ページ数 | 度数(人) |
|---|---|
| 0 以上 100 未満 | 1 |
| 100 以上 200 未満 | |
| 200 以上 300 未満 | |
| 300 以上 400 未満 | 2 |
| 計 | 10 |
この表から階級値を用いて求めた平均値が ページのとき、, の値と、この表から求めた最頻値を求めなさい。
,、最頻値 ページ
度数の合計から 、つまり です。
階級値は です。平均値が なので、(階級値)×(度数)の合計は です。
整理すると 、両辺を で割って です。
を代入すると より 、 です。よって です。
度数は で、最も大きいのは「200 以上 300 未満」なので、最頻値はその階級値 ページです。
問20 ★★★
9 個のデータがあり、平均値は 、中央値は である。このデータに と の 2 個の値を加えた 11 個のデータについて、平均値と中央値を求めなさい。
平均値 、中央値
平均値 もとの 9 個の合計は です。 と を加えると合計は なので
加えた 2 個の平均がちょうど なので、平均値は変わりません。
中央値 もとの 9 個を小さい順に並べると、5 番目が です。11 個のデータの中央値は、小さいほうから 6 番目の値です。
以下かつ 以上なので、中央値は です。もとの値が1つ1つ分からなくても、中央値は並び順だけで決まります。
1940 年代の終わり、アメリカ空軍では、ジェット機がうまく操縦できずに起こる事故が相次いでいました。機体にもパイロットの腕にも決め手となる原因が見つからないなか、疑われたのが操縦席です。当時の操縦席は、1926 年に数百人のパイロットの体を測り、その平均値に合わせて設計されたものでした。
1950 年ごろ、空軍の研究者ギルバート・ダニエルズは、4000 人を超えるパイロットの体を測り直しました。身長・胸まわり・腕の長さなど、操縦に関わる 10 項目の平均値を出し、各項目で「平均のまわり」(真ん中のおよそ 30%の範囲)に入る人がどれだけいるかを数えたのです。結果は、10 項目すべてで平均のまわりに入った人は 0 人でした。項目ごとに見れば平均的な人はたくさんいるのに、全部そろった「平均的なパイロット」は一人もいなかったのです。
この結果を受けて、空軍は操縦席を平均に合わせるのをやめ、座席やペダルの位置を一人ひとりに合わせて調節できるようにしていきました。車の運転席が前後に動くのも、同じ発想です。代表値は集団をひと言で表す便利な数ですが、その値ぴったりの人がいるとは限りません。
豆知識
「平均人」という考え方を広めたのは、19 世紀ベルギーの統計学者ケトレーです。人々の身長や体重の平均を求め、それを人間の標準の姿として描き出そうとしました。ケトレーは体重と身長の関係も調べていて、体重(kg)を身長(m)の 2 乗で割った値は、のちに「ケトレー指数」と呼ばれます。これが、健康診断でおなじみの BMI のもとになっています。
厚生労働省の「国民生活基礎調査」では、1 世帯あたりの 1 年間の所得が発表されています。近年の結果では、平均値がおよそ 500 万円台なのに対して、中央値は 400 万円台前半です。そして、所得が平均値より少ない世帯が、全体の 6 割あまりを占めています(細かい数字は年によって変わります)。
「平均より下の世帯がちょうど半分」にならないのは、所得の分布が右に長く裾をひく形だからです。世帯の数がいちばん多いのは 100 万〜300 万円あたりで、数は少ないものの、何千万円という所得の世帯が裾の先へ長く続きます。この大きな値が平均値を右へ引っ張るので、平均値は「ふつうの世帯」の感覚より高めに出ます。解説の図と同じ形です。
ニュースで「平均〇〇万円」と聞いて、自分の数字と比べて落ち込みそうになったら、中央値も確かめてみてください。受ける印象がずいぶん変わるはずです。
豆知識
貯蓄も同じように、右に長く裾をひく分布です。総務省の「家計調査」の貯蓄の集計では、平均値とあわせて中央値も公表されています。どちらを見出しに使うかで、同じ調査でも伝わり方が大きく変わります。
英語の average(平均)は、もとは海の商売の言葉だったと考えられています(※語源には諸説あり)。中世の地中海では、嵐で船が沈みそうになると、船を軽くするために積み荷の一部を海へ捨てることがありました。捨てられた荷の持ち主だけが大損をするのは不公平なので、その損害を、船主と荷主の全員で、荷の価値に応じて分担するきまりができました。この「航海中の損害」を表すイタリア語 avaria やフランス語 avarie が、英語の average のもとになったといわれます。
損害を一人に押しつけず、みんなでならして負担する。ここから「ならした値」という意味が育っていった、というわけです。このしくみは今も「共同海損」と呼ばれて海運で使われています。2021 年にスエズ運河で大型コンテナ船が座礁し、運河を 6 日間ふさいだ事故でも、船の所有者が共同海損を宣言し、積み荷の持ち主たちが費用を分担することになりました。
豆知識
日本語の「平均」は、「平らに均(なら)す」と書きます。「均」は訓読みで「ならす」と読む漢字です。解説で平均値を「積み木の塔をならした高さ」にたとえたのは、この言葉の字面そのままのイメージです。
※ここは発展ページです。高校の範囲では「足して個数で割るのが平均値、真ん中の値が中央値」という理解で十分ですが、「代表値にはどんな性質があるの?」「なぜ平均値は外れ値に弱いの?」が気になる人のために、少し厳密な見方を紹介します。
を正の整数とする。変量 の 個の値の組 を大きさ のデータという。同じ値が何度現れてもよい。
を の平均値という。また、 を の偏差という。
数列の分野で学ぶ記号 を使うと、平均値は と短く書けます。偏差は「平均値からどれだけ離れているか」を表す量で、第3章の分散で主役になります。
データ を小さい順に並べかえたものを
と書く。 を正の整数として、中央値 を
と定める( のときは とする)。
データに現れる値のうち、現れる回数が最大であるものを最頻値という。最頻値は1つとは限らない。
番号にかっこを付けた は、「小さいほうから 番目の値」という意味です。もとの ( 番目に記録した値)と区別するための書き方で、大学の統計学では順序統計量と呼ばれます。
証明 左辺の を 個まとめると
(証明終)
数直線を細い棒と考え、各値の位置に同じ重さのおもりを1個ずつのせたとします。平均値の位置を指で支えると、棒はちょうどつり合います。平均より右にある値の「はみ出し」と、左にある値の「へこみ」が、合計すると同じ大きさになるからです。定理1は、平均値がデータの重心であることを表しています。
, を定数とし、 とする。このとき
であり、 の中央値は、 の中央値 を用いて である。
証明 平均値について:
中央値について: のとき、 ならば なので、並び順は保たれ、 である。中央の値(または中央の2つの値の平均)も同じ式で移るので、 の中央値は である。
のとき、大小が逆転するので である。 なら、中央の番号 は で自分自身に移る。 なら、中央の2つの番号 , は互いに入れかわるだけである。どちらの場合も の中央値は である。(証明終)
最頻値も、 なら値どうしが1対1に対応するので、 の最頻値は の最頻値を で移した値になります。3つの代表値は、どれも変量の変換と「同じ動き」をするということです。
実数 に対して
とおく。
(1) は のとき最小となる。
(2) は (中央値)のとき最小となる。
証明 (1) と分けて2乗し、 について足すと
定理1より中かっこの中は なので、 である。等号は のときに限り成り立つ。
(2) まず、 である2数について
が成り立ち、等号は と がともに 以上、すなわち のときに成り立つ。
小さい順の値を、両端から と 、 と 、… と組にして、各組に上の不等式を使う。 が奇数のときに組にならず残る については を使う。すると は、 によらない値
以上であることが分かる。
すべての等号が成り立つのは、 が ,,… をすべて満たし、 が奇数なら でもあるときである。これらの範囲は内側の組ほど狭く、いちばん内側は、 なら 、 なら となる。どちらの場合も中央値 はこの条件を満たすので、 である。(証明終)
平均値は「2乗した距離」の合計を、中央値は「距離そのもの」の合計を、それぞれいちばん小さくする値だということです。2乗すると、遠くの値ほど大きく数えられます。距離 の値は、距離 の値の 倍の重みで に効くので、平均値は外れ値のほうへ強く引き寄せられます。解説の公式5で見た「平均値は外れ値に弱い」の正体は、この2乗にあります。
なお、 を で割った値が、第3章で学ぶ分散です。また、 が偶数のときは のどの でも は最小になります。中央値は、その範囲の真ん中を代表として選んだ値だと見ることもできます。
この章の学習が終わったら
学習完了テストを受ける