データマイニングにおけるデータ変換とは?主要な4つの手法を解説
データマイニングとは
データマイニングとは、リポジトリ(データ保管庫)に保存された膨大なデータを対象に、統計的手法や数学的手法といったパターン認識技術を活用しながら、有用な新たな相関関係・パターン・トレンドを発見するプロセスです。具体的には、事実に基づくデータセットを分析し、これまで気づかれていなかった関係性を見出すとともに、データ所有者にとって論理的かつ実用的な形でレコードを要約することを目指します。
データマイニングにおける主な変換手法
1. 通常値・異常値・範囲外・不可能なファクトへのフラグ付け
測定されたファクト(事実)に特別なフラグを付けることは、非常に有効な手法です。一部の測定値は正しいものの、極めて例外的な場合があります。こうした値は、サンプル数が少ないことや特定の状況に起因している可能性があります。
一方で、データ上は存在するものの、実際にはあり得ない、あるいは説明不能とみなすべき値もあります。このようなケースでは、異常な値をテーブルから削除するのではなく、ステータスフラグを付与して、分析対象に含めるか除外するかを柔軟に制御できるようにするのが望ましいでしょう。
これらのケースに対処する効果的な方法は、ファクトレコード用に「データステータス」専用のディメンションを作成することです。このディメンションを制約条件として利用すれば、各ファクトの状態を明確に定義できます。
2. 文脈からのランダム値・ノイズ値の識別とマスク処理
前述の変換の特殊なケースとして、レガシーシステムが実際のファクトではなくランダムな数値を供給している状況を識別することが挙げられます。これは、本来なら値が送信されないはずの場面で、バッファに残っていた数値がそのままデータウェアハウスに渡されてしまうことで発生します。このようなケースを検出した場合は、そのランダムな数値をNULL値に置き換えることが推奨されます。
3. NULL値への一貫した処理の適用
データマイニングツールは、「存在し得ない」と「存在するが不明である」の区別に敏感です。後者の場合、一部のデータマイニング専門家は最も確からしい値や中央値を代入することで、ファクトテーブルの残りのレコードも分析に参加できるようにしています。
この処理は、元のデータのNULL値を推定値で上書きする方法でも、NULLデータをさまざまな分析オプションで処理できる高度なデータマイニングツールに任せる方法でも実現可能です。
4. ステータスが変化したファクトレコードへのフラグ付け
有用なデータ変換の一つとして、ファクトテーブルのレコードに特別なステータスインジケーターを追加し、そのアカウント(または顧客・製品・拠点)のステータスが直近で変化した、あるいは変化しようとしていることを示す方法があります。このステータスインジケーターは、スタースキーマ設計においてステータスディメンションとして実装されます。
-
データマイニングにおける外れ値の種類を徹底解説!3つのタイプと検出のポイント
はじめに:データマイニングにおける外れ値とはデータマイニングにおいて、外れ値(アウトライヤー)はデータセット内の他のオブジェクトから大きく逸脱した値やパターンを指します。一見すると「異常なノイズ」のように思えますが、不正検知や故障予測など、実務上きわめて重要な情報を含んでいることも少なくありません。外れ値には複数の種類があり、それぞれ特徴や検出手法が異なります。本記事では、代表的な3つのタイプ——グローバル外れ値・文脈外れ値・集合的外れ値について詳しく解説します。1. グローバル外れ値(大域外れ値)グローバル外れ値とは、与えられたデータセット全体に対して、あるデータオブジェクトが他の大部分のデ
-
プライバシー保護データマイニングとは?主な手法と仕組みを徹底解説
プライバシー保護データマイニングとは プライバシー保護データマイニング(Privacy-Preserving Data Mining)は、データマイニングにおけるプライバシーセキュリティの課題に対応するために生まれた研究分野です。「プライバシー強化データマイニング」や「プライバシー配慮型データマイニング」とも呼ばれています。 この手法の目的は、基礎となる機密性の高いデータ値を開示することなく、正確なデータマイニング結果を得ることにあります。 プライバシーとデータ有用性のトレードオフ 多くのプライバシー保護データマイニングのアプローチでは、データに対して何らかの変換を施すことでプライバシー保護