プログラミング
 Computer >> コンピューター >  >> プログラミング >> プログラミング

データマイニングにおけるメジャーの計算方法を解説!分布的・代数的・全体的の3分類

データマイニングやデータウェアハウスの分野では、メジャー(測定値)は使用される集計関数の種類に応じて、「分布的(distributive)」「代数的(algebraic)」「全体的(holistic)」という3つのカテゴリに分類されます。この分類を理解することは、大規模なデータキューブを効率的に計算するうえで非常に重要です。

分布的メジャー(Distributive Measure)

集計関数が「分布的」であるとは、データをn個の独立した部分集合(パーティション)に分割し、それぞれに対して関数を適用してn個の集計値を得た後、そのn個の集計値に関数を再度適用した結果が、データセット全体に一度だけ関数を適用した結果と一致する場合を指します。

例として、count() が挙げられます。データキューブを複数のサブキューブに分割し、各サブキューブごとに count() を計算してから、その結果を合計すれば、全体に対して count() を実行した場合と同じ結果が得られます。このように、count() は分布的な集計関数です。

分布的な集計関数によって得られるメジャーを「分布的メジャー」と呼びます。分布的メジャーは分散方式で計算できるため、非常に効率的に処理できるという大きな利点があります。

代数的メジャー(Algebraic Measure)

集計関数が「代数的」であるとは、M個の引数(Mは有界の正の整数)を持つ代数的関数によって計算でき、その各引数が分布的な集計関数によって得られる場合を指します。

代表的な例が avg()(平均値)です。avg() は sum() を count() で割ることで計算できますが、sum() も count() もどちらも分布的な集計関数です。同様に、与えられた集合の中からN個の最小値・最大値を求める min_N() や max_N()、さらに標準偏差も代数的な集計関数であることが示せます。

代数的な集計関数によって得られるメジャーを「代数的メジャー」と呼びます。

全体的メジャー(Holistic Measure)

集計関数が「全体的」であるとは、サブ集計値を表現するために必要な記憶容量に固定された上限が存在しない場合を指します。言い換えると、その計算を記述する、定数個(M個)の引数を持つ代数的関数が存在しないということです。

全体的な関数の例としては、median()(中央値)、mode()(最頻値)、rank()(順位)などが挙げられます。全体的な集計関数によって得られるメジャーを「全体的メジャー」と呼びます。

効率的な計算への課題とアプローチ

大規模なデータキューブアプリケーションの多くでは、分布的メジャーと代数的メジャーの効率的な計算が求められますが、これらには効率的な手法がすでに存在します。一方で、全体的メジャーを効率的に計算することは容易ではありません。

ただし、一部の全体的メジャーについては、計算を近似する効率的なアプローチが存在します。たとえば、巨大なデータセットに対して正確な median() を計算する代わりに、近似中央値を求める手法を利用することが可能です。このような近似手法は多くの場合で十分な精度を提供し、全体的メジャーの効率的な計算という課題を克服する有効な手段となります。

  1. 空間データマイニングのプリミティブとは?ルールと主題図を徹底解説

    空間データマイニングとは空間データマイニングとは、データマイニングの手法を空間モデルに適用する技術です。アナリストは地理データや空間データを活用し、ビジネスインテリジェンスやその他の有益な成果を生み出します。地理データを分析に適した有用な形式へと変換するには、専用の手法やリソースが必要となります。空間データマイニングには、研究プロジェクトの目的に関連するパターンの認識やオブジェクトの発見など、いくつかの課題が伴います。アナリストは、GIS/GPSツールや類似のシステムを活用しながら、大規模なデータベースや膨大なデータセットの中から、目的に関連するデータのみを効率的に抽出します。空間データマイニ

  2. メタルールとは?データマイニングでの活用方法と仕組みを徹底解説

    データマイニングとは何か データマイニングとは、リポジトリ(データ倉庫)に保存された膨大な量のデータを対象に、統計的手法や数学的手法といったパターン認識技術を用いて、有用な新しい相関関係・パターン・トレンドを発見するプロセスです。事実に基づくデータセットを分析することで、これまで気づかれていなかった関係性を明らかにし、レコードを論理的かつデータ保有者にとって有益な形で要約することを目指します。 データマイニングは、大量の情報を選択・探索・モデル化する一連の手続きであり、当初は未知であった規則性や関連性を発見して、データベースの所有者にとって明確で有益な結果を得ることを目的としています。 データ