箱ひげ図の外れ値「1.5倍」の謎を解く!計算式と除外判断の鉄則

目次
箱ひげ図の外れ値「1.5倍」の謎を解く!計算式と除外判断の鉄則
箱ひげ図の外れ値「1.5倍」の謎を解く!計算式と除外判断の鉄則
@ creator • Click to Play Video Inline
🎵 箱ひげ図の外れ値「1.5倍」の謎を解く!計算式と除外判断の鉄則

データ分析の現場やビジネス報告、さらには教育課程の統計授業において、誰もが一度は目にするグラフが「箱ひげ図(ボックスプロット)」です。データの散らばり具合や中央値を一目で把握できる優れた可視化ツールですが、実務者が最も頭を悩ませるのが、箱の上下にぽつんとプロットされる「外れ値(アウトライヤー)」の扱いです。

「なぜ四分位範囲の1.5倍を超えると外れ値になるのか?」「ツールが自動で弾いた異常値は、そのまま削除して報告してよいのか?」――。現場のアナリストやビジネスパーソンから寄せられる疑問の根底には、基準の数学的背景を知らないままブラックボックスとして扱っている不安があります。データの信頼性を担保し、誤った意思決定を下さないための判定ルールと実践的な計算手順を紐解きます。

📌 【この記事の重要ポイントまとめ】
  • 要点1:「1.5倍」の基準は統計学者ジョン・テューキーが提唱した経験則であり、正規分布において約99.3%のデータを包含し、異常検出率約0.7%(約±2.7σ相当)に収まる実用的なバランスに基づいている。
  • 要点2:計算式は「第1四分位数(Q1)- 1.5×IQR」および「第3四分位数(Q3)+ 1.5×IQR」であり、ExcelやPythonでも即座に算出可能。
  • 要点3:外れ値の安易な除外はデータ改ざんやビジネス機会損失につながるため、入力ミス等の「異常値」と自然発生した「真正の外れ値」を厳密に区別して対処することが鉄則である。

【決定的な根拠】箱ひげ図の外れ値はなぜ四分位範囲の1.5倍なのか?

箱ひげ図における箱ひげ図外れ値の基準として世界標準になっているのが、「四分位範囲(IQR)の1.5倍」という境界線です。データ分析の初学者が抱く「なぜ2倍でも1倍でもなく、中途半端な1.5倍なのか?」という疑問には、探索的データ解析(EDA)の父と呼ばれる米国の統計学者ジョン・テューキー(John W. Tukey)が1977年に導き出した明確な工学的理由が存在します。

数学的な裏付けを辿ると、四分位範囲1.5倍の理由は標準正規分布における確率密度と密接に結びついています。正規分布に従うデータにおいて、第1四分位数(Q1)は平均値から約$-0.6745\sigma$、第3四分位数(Q3)は約$+0.6745\sigma$の位置にあります。したがって、四分位範囲($\text{IQR} = Q3 - Q1$)の幅は約$1.349\sigma$です。

ここで「$1.5 \times \text{IQR}$」を計算すると、$1.5 \times 1.349\sigma \approx 2.0235\sigma$となります。これをQ1およびQ3の外側に設定すると、境界線(フェンス)は平均値から約$\pm 2.698\sigma$(およそ$\pm 2.7\sigma$)の位置に引かれる計算になります。正規分布において$\pm 2.7\sigma$の内側にデータが収まる確率は約99.3%であり、外側に飛び出す確率はわずか約0.7%にすぎません。

テューキーは、正規分布における標準偏差を用いた外れ値検出(3シグマ法など)が「外れ値そのものによって平均や標準偏差が歪んでしまう」という矛盾を嫌いました。そこで、極端な値に影響を受けにくい中央値と四分位数をベースに、「日常的なデータの揺らぎでは滅多に出現せず、かつ異常な兆候を見逃さない絶妙なしきい値」として1.5倍を採用したのです。なお、テューキーは3.0倍を超える値を「極端な外れ値(Far Out)」と定義し、データの異常度合いを2段階で評価する体系を築いています。

当時のメディア報道・掲載写真
【検証資料 1】当時のメディア報道・掲載写真(出典:mathlandscape.com)

【計算手順を図解】第一四分位数Q1・第三四分位数Q3から外れ値を導く具体例

概念を理解したところで、実際のデータセットを用いて箱ひげ図外れ値の計算方法を順を追って確認します。現在の高校数学データの分析外れ値の単元でも扱われる基本的なアルゴリズムです。

ここでは、あるWebサイトの滞在時間(秒)を記録した11個のサンプルデータを例に取ります。

[12, 15, 18, 20, 22, 25, 28, 30, 32, 45, 95]

ステップ1:第一四分位数(Q1)と第三四分位数(Q3)の算出

データを昇順に並べ、中央値(Q2)を基点にデータを前半と後半に分割します。第一四分位数Q1計算および第三四分位数Q3計算の具体的な値は以下の通りです。

  • データの中央値(Q2):6番目の値 「25」
  • 前半グループ(12, 15, 18, 20, 22)の中央値 = Q1:18
  • 後半グループ(28, 30, 32, 45, 95)の中央値 = Q3:32

ステップ2:四分位範囲(IQR)の算出

中央50%の散らばりを表す四分位範囲(IQR)を求めます。

$\text{IQR} = Q3 - Q1 = 32 - 18 = 14$

ステップ3:許容境界線(内フェンス)の算出

IQRの1.5倍を算出し、Q1とQ3からそれぞれ外側に引き伸ばします。

  • 幅の計算:$14 \times 1.5 = 21$
  • 外れ値の下限値(Lower Inner Fence):$Q1 - 1.5 \times \text{IQR} = 18 - 21 = \mathbf{-3}$
  • 外れ値の上限値(Upper Inner Fence):$Q3 + 1.5 \times \text{IQR} = 32 + 21 = \mathbf{53}$

このデータセットにおいて、有効な観測値の許容範囲は「$-3$から$53$まで」となります。サンプル内の「95」は上限値53を明確に超えているため、箱ひげ図上ではひげの先端(通常は上限以内の最大値である45)から切り離され、単独の点として「外れ値」描画されます。

【実務の現場比較】Excel・Python・統計検定の使い分けと最新基準

データ分析の実務では、手計算ではなくソフトウェアや統計的仮説検定を併用するのが常です。現場で頻用される4つのアプローチの特徴と、最新の統計学外れ値判定の最新基準における位置づけを比較・整理しました。

判定手法・ツール詳細・数値データ一般的な基準・相場編集部の見解・評価
箱ひげ図(IQR法)Q1/Q3から$\pm1.5\times\text{IQR}$。正規分布換算で外側約0.7%を抽出探索的データ解析(EDA)の標準規格分布の前提条件が不要(ノンパラメトリック)。実務の第1スクリーニングに最適
3シグマ法(Zスコア)平均値から$\pm3\sigma$。正規分布で外側0.27%を異常と判定製造業の品質管理、センサーログ分析極端な外れ値が平均や分散自体を大きく歪ませるため、単一の異常値に弱い欠点あり
スミルノフ・グラブス検定統計量$T = \frac{|X - \bar{X}|}{s}$を有意水準(1%または5%)で検定薬事申請、理化学実験データ、公定分析「データが正規分布に従う」前提が必須。1個ずつしか検定できない厳格な手法
機械学習アプローチ
(Isolation Forest等)
多次元データの孤立度をスコア化。汚染度(contamination)を指定不正アクセス検知、金融取引モニタリング高次元・非線形データに強いが、判定根拠のブラックボックス化に注意が必要

Excelにおける外れ値の描画実務

実務で最も身近な箱ひげ図Excel外れ値の出し方は、Office 2016以降に標準搭載された統計グラフ機能を用います。対象データを選択し、[挿入]タブ >[統計グラフの挿入]>[箱ひげ図]を選択するだけで描画が完了します。

注意すべきは、データ系列の書式設定にある「外れ値ポイントを表示する」のチェックボックスです。このチェックを外すと、ひげがデータの最大値・最小値まで無理やり伸ばされてしまい、異常値の存在が視覚的に隠蔽されてしまいます。また、Excelの四分位数計算にはQUARTILE.INC(0%と100%を含む)とQUARTILE.EXC(含まない)があり、箱ひげ図機能はデフォルトでINC系のロジックを採用している点も知識として押さえておく必要があります。

Pythonによる再現性の高い外れ値検出

データサイエンス現場でのPython箱ひげ図外れ値検出では、可視化ライブラリのSeabornやMatplotlib、計算ライブラリのPandasやNumPyを組み合わせて自動検出パイプラインを構築します。

Seabornのsns.boxplot()はデフォルトで四分位範囲の1.5倍を外れ値(フライングポイント)としてプロットします。プログラム上で外れ値の行インデックスを抽出する場合は、Pandasを用いて「Q1 = df['val'].quantile(0.25)」「Q3 = df['val'].quantile(0.75)」からIQRを求め、条件抽出フィルタをかける実装が定石です。

スミルノフ・グラブス検定との違い

統計的な報告書を作成する際、よく議論に上がるのがスミルノフ・グラブス検定との違いです。箱ひげ図(IQR法)はあくまでデータの全体像を把握するための「記述統計・探索的アプローチ」であり、母集団の分布形状を問いません。一方、スミルノフ・グラブス検定は「母集団が正規分布である」という強い仮定のもとで、確率論的に特定の観測値を棄却するための「推測統計・仮説検定アプローチ」です。ビジネスデータの多くは正規分布から歪んでいるため、安易に検定を乱用するのではなく、まずは箱ひげ図で視覚的な歪みを確認することが推奨されます。

活動歴および当時の関連ビジュアル記録
【検証資料 2】活動歴および当時の関連ビジュアル記録(出典:gmo-research.ai)

【実態検証】「外れ値=即削除」が招くビジネスと研究の重大な誤謬

データ分析の現場では、箱ひげ図で外れ値が検出された瞬間に「邪魔なノイズが見つかったから消しておこう」と即座に除外してしまうケースが後を絶ちません。しかし、データサイエンティストや品質管理の専門家への取材から浮かび上がるのは、安易なデータクレンジングが招く致命的な事故です。

現場のリアルな証言として、ECサイトの購買分析を担当するアナリストは次のように語ります。

「月間購入金額の箱ひげ図を作成した際、突出した高額決済データが外れ値として検出されました。若手担当者が平均値を綺麗に見せるためにそれらを除外して施策を設計した結果、売上の3割を占めていた最重要VIPロイヤルカスタマーの購買行動を完全に無視したプロモーションを展開してしまい、大減収を招く失態となりました」

学術研究の場でも、1985年に南極上空のオゾンホールが発見された際、事前の衛星観測データ処理システムが「極端に低いオゾン濃度測定値」を測定器のエラーとして自動除外していたため、重大な環境危機の察知が数年間遅れたという事例は有名です。

ネット上のエンジニアコミュニティや知恵袋、技術ブログの議論を精査しても、「外れ値を消したらR2(決定係数)は上がったが、本番環境でモデルが全く機能しなくなった」「外れ値の中にこそ工場の歩留まり悪化の根本原因が眠っていた」という悲鳴に満ちています。外れ値とは「消すべきゴミ」ではなく、「ビジネスの宝やシステムの不具合を告げる警告灯」であるという認識が不可欠です。

一般に知られていない盲点とネットの誤解|「1.5倍は絶対の真理」という神話

インターネット上の解説記事では「外れ値の境界線は四分位範囲の1.5倍で決まりである」と断定的に書かれているケースが多く見られます。しかし、これは統計学における代表的な誤解の一つです。

盲点1:歪んだ分布(ロングテール)に対する脆弱性

テューキー自身が述べている通り、1.5倍という係数は「正規分布に近い左右対称なデータ」を前提に調整された経験則にすぎません。個人の年収データ、WebページのPV数、ソーシャルゲームの課金額など、右に長く裾を引く対数正規分布やパレート分布のようなデータに1.5倍ルールをそのまま適用すると、正常な高額層の大部分が機械的に「外れ値」の烙印を押されてしまうことになります。

このような歪度の高いデータに対しては、対数変換を行ってから箱ひげ図を描くか、近年データ科学で採用が進む「Adjusted Boxplot(歪度を考慮した修正箱ひげ図:メドカップル法)」を用いて上限のフェンスを非線形に拡大する手法が適切です。

盲点2:サンプルサイズによる外れ値出現率の変動

サンプルサイズが数十件程度の小規模データでは、1.5倍の外れ値境界の外側にデータが現れることは稀です。しかし、ビッグデータ時代を迎え、データ数が数十万〜数百万件に達すると、たとえ純粋な正規分布であっても確率的に0.7%(数十万件なら数千件規模)のデータが必然的に外れ値判定されます。サンプル規模が大きくなるほど「箱ひげ図で点が大量に出るから異常」という論理は破綻するため、しきい値を3.0倍(極端な外れ値)に引き上げるなどの柔軟な現場調整が求められます。

公の場での発言・インタビュー報道記録
【検証資料 3】公の場での発言・インタビュー報道記録(出典:salesanalytics.co.jp)

【プロの結論】データガバナンスと外れ値除外の判断基準

外れ値に直面した際、ビジネスパーソンや研究者はどのような基準で処理を進めるべきなのでしょうか。組織の意思決定を歪めないための外れ値除外の判断基準および外れ値の扱い詳細まとめを提示します。

【実践フロー】外れ値のタイプ別対処法

  1. 入力ミス・機器故障(異常値):即座に除外または修正
    アンケートの年齢欄に「150歳」と入力されていたり、通信エラーで数値がゼロ落ちしているケースです。原因が客観的に特定できる場合は、データをクレンジングするか欠損値として扱います。
  2. 抽出条件の不一致(異質な母集団):セグメントを分離
    BtoCサービスの利用動向に法人アカウントが混ざっていた場合などです。除外するのではなく、母集団を「個人」と「法人」に分割して別個に箱ひげ図を作成します。
  3. 正当に観測された極端な値(真正の外れ値):原則として除外不可
    天変地異による突発的な売上増減や、大口投資家の取引などです。これらを除外すると現実を歪めることになります。分析時は「外れ値を含めた分析」と「外れ値を除外した感応度分析」の両方を並列で報告し、意思決定者に透明性を提供することがプロフェッショナルの鉄則です。

【プロの結論】おすすめできる人・慎重になるべき人の判断基準

  • 1.5倍ルールを積極的に活用すべき人:
    データ収集初期段階で大まかな傾向を把握したい人、正規分布に近い実験データやテスト結果を分析する教育・研究者、データの異常入力を即座にスクリーニングしたい現場担当者。
  • 1.5倍ルールの機械的適用に慎重になるべき人:
    所得やアクセスログなどロングテールデータを扱うマーケター、金融リスク管理や医療診断など外れ値そのものが致命的意味を持つ領域の実務者、サンプル数が数十万件を超えるビッグデータを扱うエンジニア。

【箱ひげ図の外れ値】に関するよくある質問(FAQ)

Q1:Excelの箱ひげ図で外れ値が表示されない・消したい場合はどうすればいいですか?
A1:作成した箱ひげ図のデータ系列(箱の部分)を右クリックし、「データ系列の書式設定」を開きます。「系列のオプション」内にある「外れ値ポイントを表示する」のチェックをオンにすれば外れ値が表示され、オフにすれば外れ値を無視してひげが最大値・最小値まで伸ばされます。ただし、前述の通りチェックを外すと異常値が見落とされるリスクがあるため、視覚的理由だけでオフにすることは推奨されません。

Q2:箱ひげ図の「ひげ」の長さは何を表しているのですか?
A2:外れ値検出を行う一般的な箱ひげ図において、ひげの端点は「外れ値境界線(Q1 $- 1.5\text{IQR}$、Q3 $+ 1.5\text{IQR}$)の内側にあるデータの最大値および最小値」を表します。外れ値が存在しない場合は、データ全体の最大値・最小値がそのままひげの端点になります。

Q3:スミルノフ・グラブス検定と箱ひげ図の1.5倍ルールはどう使い分けますか?
A3:データ全体の分布の概観を把握したい場合や、分布が左右対称か不明な初期分析段階では「箱ひげ図(IQR法)」を用います。一方、薬学実験や製造ラインのように母集団が正規分布に従うことが前提とされており、統計的有意性(確率的根拠)をもって1つの異常値を論文等で除外・棄却したい場合は「スミルノフ・グラブス検定」を適用します。

Q4:高校数学の新課程「データの分析」では、外れ値の計算は必須ですか?
A4:高校数学Iの「データの分析」において、箱ひげ図や四分位数は必修単元です。新課程の教科書でも「四分位範囲の1.5倍」を用いた外れ値の定義がコラムや発展事項として掲載されており、大学入学共通テストや個別入試でも外れ値の判定基準を理解していることを前提とした出題が見られます。

まとめ:データの歪みに惑わされず本質を見抜く判断基準

箱ひげ図における「四分位範囲の1.5倍」というしきい値は、単なる暗記用の公式ではなく、探索的データ解析の歴史と正規分布の確率特性が融合した優れた実用的知恵です。極端な値に振り回されず、かつ異常の兆候を敏感に察知するための境界線として機能しています。

データに基づいた意思決定が重視される今日において、最も危険なのはアルゴリズムの機械的な処理に思考を委ねてしまうことです。グラフ上に外れ値が現れたときは、「なぜこのデータが生まれたのか」という背景の文脈を丁寧に読み解く姿勢こそが、分析の精度と価値を決定づけます。 (出典: 箱 ひげ 図 外れ 値(Yahoo!ニュース)

箱 ひげ 図 外れ 値
箱 ひげ 図 外れ 値
箱 ひげ 図 外れ 値