頻出パターンマイニングの分類基準とは?6つの視点から徹底解説
頻出パターンマイニング(Frequent Pattern Mining)は、大量のデータの中から頻繁に出現するパターンを発見するデータマイニングの重要な手法です。この手法は、その目的や適用範囲に応じて、いくつかの基準で分類することができます。本記事では、頻出パターンマイニングを分類する主要な6つの基準について、具体例を交えながら詳しく解説します。
1. マイニング対象パターンの完全性による分類
この基準では、最小サポート閾値を条件として、以下のようなパターンを抽出できます。
- 全頻出アイテムセット:条件を満たすすべての頻出アイテムセットを網羅的に抽出します。
- クローズド頻出アイテムセット:同じサポート値を持つスーパーセットを持たない頻出アイテムセットです。
- 最大頻出アイテムセット:他の頻出アイテムセットの部分集合にならないアイテムセットです。
さらに、用途に応じて以下のような特殊なパターンも抽出可能です。
- 制約付き頻出アイテムセット:ユーザーが定義した制約の集合を満たすもの。
- 近似頻出アイテムセット:マイニング結果のサポート数を近似的に調整できるもの。
- ニアマッチ頻出アイテムセット:類似するアイテムセットのサポート数を集計するもの。
- トップk頻出アイテムセット:ユーザー指定の値kに対して、最も頻度の高いk個のアイテムセット。
アプリケーションによっては、パターンの完全性に関して複数の要求が存在する場合があり、それに応じて異なる計算手法や最適化アプローチが求められます。
2. ルールセットに含まれる抽象化レベルによる分類
関連ルールマイニングには、複数の抽象化レベルでルールを発見できる手法があります。例えば、顧客を表す変数Xを用いて、次のような関連ルールがマイニングされたとします。
- buys(X, 「コンピュータ」) ⇒ buys(X, 「HPプリンタ」)
- buys(X, 「ノートパソコン」) ⇒ buys(X, 「HPプリンタ」)
前者は「コンピュータ」という上位概念、後者は「ノートパソコン」という下位概念に基づくルールであり、異なる抽象化レベルで知識を捉えています。
3. ルールに含まれるデータ次元数による分類
関連ルール内のアイテムや属性が単一の次元のみを参照する場合、そのルールは単一次元関連ルールと呼ばれます。逆に、複数の次元にまたがる場合は多次元関連ルールとなります。
4. ルールで扱う値の型による分類
ルールがアイテムの「存在」と「非存在」の間の関連を扱う場合はブール型関連ルール、数量項目や属性間の関連を扱う場合は定量的関連ルールと呼ばれます。定量的関連ルールでは、数量値は通常、分析しやすいように区間に分割されます。
5. マイニング対象ルールの種類による分類
頻出パターン分析は、さまざまな種類のルールや興味深い関係性を生成できます。中でも関連ルール(アソシエーションルール)は、頻出パターンから導かれるルールとして最も広く知られており、マーケットバスケット分析などで活用されています。
6. マイニング対象パターンの種類による分類
データセットの種類に応じて、複数の種類の頻出パターンをマイニングできます。中心的な対象となるのは頻出アイテムセットマイニングであり、これはトランザクションデータセットやリレーショナルデータセットから頻出アイテムセット(アイテムの集合)を抽出する手法です。
さらに、逐次パターンマイニングは、系列データセット内の高頻度のサブシーケンス(部分列)を探索する手法です。系列データとは、イベントを順序付けて並べたものを指します。例えば、逐次パターンマイニングを活用すれば、アイテムが一般的にどのような順序で購入されるかを把握できます。典型例として、顧客はまずPCを購入し、次にデジタルカメラ、そしてメモリカードを購入する傾向があるといった購買パターンの発見が挙げられます。
-
Webマイニングの主な応用分野とは?具体的な活用例を徹底解説
WebマイニングとはWebマイニングとは、データマイニング技術を活用し、サーバーログ、ハイパーリンク、Webベースの記録やサービスなどから有益なパターンや傾向、情報を抽出するプロセスのことです。Web上の膨大な情報をグループ化して分析することで、ビジネスや研究に役立つ重要なインサイト(洞察)を発見することを目指します。Webマイニングは、既存のデータマイニング手法をWeb向けに適応させたものと広く捉えられます。一方でデータマイニングは、主に構造化されたデータに対してアルゴリズムを適用し、知識発見プロセスの中でパターンを見つけ出す技術として定義されます。ここでは、Webマイニングの代表的な応用分
-
パターンマイニングの主な応用分野とは?活用例を徹底解説
パターンマイニングとはパターンマイニング(Pattern Mining)は、大量のデータの中から頻繁に現れるパターンや規則性を抽出するデータマイニング手法です。その応用範囲は非常に広く、データ分析の前処理から高度な知識発見まで、さまざまな場面で活用されています。本記事では、パターンマイニングの代表的な応用分野について詳しく解説します。1. ノイズ除去とデータクレンジング(前処理)パターンマイニングは、データ集約型のさまざまなアプリケーションにおいて、ノイズフィルタリングやデータクレンジングといった前処理に広く利用されています。例えば、遺伝子情報など数万次元もの属性を持つマイクロアレイデータの探