外れ値検出(アウトライヤー検出)とは?基本概念から主な手法まで解説
外れ値とは何か
外れ値(Outlier)とは、他のデータオブジェクトと比較して著しく異なり、あたかも別のメカニズムによって生成されたかのように見えるデータオブジェクトを指します。データ分析の文脈では、外れ値ではないデータを「正常」または「期待される」データとして定義し、外れ値を「異常」なデータとして定義するのが一般的です。
外れ値は、与えられたクラスやクラスタにうまく組み込むことができないデータ要素であり、他のデータオブジェクトの通常の振る舞いとは異なる挙動を示します。こうしたデータの分析は、隠れた知識を発掘する上で非常に重要です。
外れ値が注目される理由
外れ値が興味深いのは、残りのデータと同じ構造から生成されたものではないと疑われるためです。そのため、外れ値検出においては、識別された外れ値がなぜ別のメカニズムによって生じたのかを合理的に説明することが不可欠となります。
新規性検出(ノベルティ検出)との関係
ワンクラス分類は、外れ値検出や新規性検出とも呼ばれます。これは、学習アルゴリズムを用いることで、訓練データの分布に対して正常なデータと異常なデータを区別できるためです。
例えば、新しいコンテンツが次々と投稿されるソーシャルメディアサイトを観察する場合、新規性検出によって新しいトピックやトレンドを迅速に特定できます。新しい話題は、登場当初こそ外れ値として現れることが多いのです。
外れ値検出と新規性検出の違い
外れ値検出と新規性検出は、モデリングや検出のアプローチにおいて共通点が多くあります。しかし、両者には重要な違いがあります。新規性検出では、新しいトピックが確認されると、それらは一般的な振る舞いのモデルに組み込まれるため、以降のインスタンスは外れ値として扱われなくなります。
外れ値検出の主な手法
統計的手法
ワンクラス分類への汎用的な統計的アプローチとしては、訓練データの一定割合 p から距離 d 以上離れた位置にあるインスタンスを外れ値として認識する方法があります。
さらに、ガウス分布などの統計的分布を訓練データに当てはめることで、ターゲットクラスの確率密度を計算することも可能です。確率値が低いテストインスタンスは、外れ値であるとみなすことができます。
マルチクラス分類器の応用
マルチクラス分類器は、対象データの周囲に境界線を設け、その外部にあるサンプルを外れ値とみなすことで、ワンクラスの設定へと適応させることができます。この境界は、サポートベクターマシン(SVM)などの既存のマルチクラス分類器の内部動作を調整することで構築可能です。
パラメータ選択の課題
これらの手法は、どの程度の対象データを外れ値として定義するかを決めるパラメータに大きく依存します。パラメータが保守的に設定されすぎると、対象クラスの本来のデータが誤って除外されてしまいます。一方で、寛容に設定されすぎると、モデルが過学習を起こし、正当なレコードまで過剰に拒否してしまう恐れがあります。
さらに、拒否率は一般にテスト段階では変更できないため、適切なパラメータ値を訓練時点で選択しておく必要がある点にも注意が必要です。
-
外れ値検出における主な課題とは?基本概念と5つの難所を徹底解説
外れ値(アウトライヤー)とは、他のデータオブジェクトから本質的に乖離しており、まるで異なる構造から生成されたかのように見えるデータオブジェクトのことです。説明を簡単にするために、外れ値ではないデータオブジェクトを「正常」または期待されるデータと定義できます。同様に、外れ値は「異常」なデータとして定義されます。 外れ値は、特定のクラスやクラスタにうまく分類できないデータ要素です。これらは、他のデータオブジェクトに共通する一般的な振る舞いとは異なる挙動を持つデータオブジェクトであり、この種のデータの分析は、知識マイニングにおいて重要な意味を持ちます。 ここでは、外れ値検出を取り巻く主な課題について
-
外れ値(アウトライヤー)とは?定義とノイズとの違い、活用例をわかりやすく解説
外れ値(アウトライヤー/outlier)とは、他のデータオブジェクトから大きく乖離しており、あたかも別のメカニズムによって生成されたかのように見えるデータのことです。説明を簡潔にするため、外れ値ではないデータは「正常」あるいは「期待される」データとして定義され、外れ値は一般的に「異常」なデータとして扱われます。 外れ値の基本的な性質 外れ値は、与えられたクラスやクラスタにうまく分類できないデータ要素であり、他のデータオブジェクトの usual な振る舞いとは明らかに異なる挙動を示します。こうした異質なデータの分析は、隠れた知識を発見するデータマイニングにおいて重要な意味を持つことがあります。