データマイニングのOLAPツールとは?MOLAP・ROLAP・MQEの3種類を徹底解説
OLAPツールの3つの主要カテゴリ
データマイニングやデータ分析の分野で利用されるOLAP(Online Analytical Processing:オンライン分析処理)ツールは、そのアーキテクチャの違いによって、主に以下の3つのカテゴリに分類されます。
MOLAP(多次元OLAP)
MOLAPは「Multidimensional OLAP(多次元OLAP)」の略称です。タプルをデータ格納単位としてサポートしており、専用のn次元配列ストレージエンジンとOLAPミドルウェアを用いてデータを処理します。そのため、OLAPクエリは関連する多次元ビュー(データキューブ)への直接アドレッシングによって高速に実行されます。
このアーキテクチャの最大の特徴は、トランザクションデータを事前に集計(プリコンピュテーション)しておく点にあります。MOLAPはロード時に各階層レベルの集計値を事前計算して保存し、インデックス化することで、即座にデータを取得できるようになっています。この仕組みにより、非常に高速なクエリ実行パフォーマンスが実現します。
一方で、完全な事前計算には処理時間とストレージ容量の両面で大きなオーバーヘッドが伴います。また、スパース(疎)なデータを扱う場合には、ストレージ効率を高めるためにスパース行列圧縮アルゴリズムが必要となります。その結果、RDBMSに保存されたデータと比較して、ディスク上のデータサイズが小さくなる傾向があります。
MOLAPベースの製品は、一般的に集計形式でデータを配置・ナビゲート・分析します。ソフトウェアとの緊密な結合(タイトカップリング)が必要であり、多次元データベース(MDDB)システムを基盤としています。優れた実装では、改良されたストレージ手法を用いてストレージを最小限に抑えながら、データを使用される形式に近い形で保存します。
ROLAP(リレーショナルOLAP)
ROLAPは「Relational OLAP(リレーショナルOLAP)」の略称です。すでに広く普及しているリレーショナルDBMS技術をベースにデータを保存できる点が大きな特徴です。この場合、データおよび関連する集計値はRDBMSに保存され、OLAPミドルウェアがデータキューブの管理と探索を実行します。
このアーキテクチャは、RDBMSバックエンドの最適化を目標としており、データキューブのナビゲーションロジックをはじめとする追加ツールやサービスをサポートします。RDBMSバックエンドを利用しているため、ROLAPの最大のメリットは、大量のデータを扱う際のスケーラビリティ(拡張性)にあります。
ROLAPシステムは、リレーショナルデータベースに格納されたデータを扱うことが多く、基本データ(ファクトテーブル)とディメンションテーブルはリレーショナルテーブルとして保存されます。このモデルにより、レコードの多次元分析が可能になります。
ROLAPは、業界において最も新しく、最も急速に成長しているOLAP技術セグメントです。この手法では、2次元のリレーショナルテーブルから複数の多次元ビューを生成できるため、特定のビューに合わせてレコードを事前に構造化しておく必要がありません。
MQE(マネージドクエリ環境)
MQEは「Managed Query Environment(マネージドクエリ環境)」の略称です。一部の製品では、データキューブやスライス&ダイス分析といったアドホッククエリ機能を提供できるようになっています。
これは、DBMSからデータを選択するクエリを作成し、要求されたデータをシステムに送信してデータキューブに格納することで実現されます。このデータキューブはデスクトップ上にローカル保存でき、クエリ実行のたびに構造を作り直すオーバーヘッドを削減するために、その場で操作することも可能です。データをデータキューブに保存した後は、多次元分析や各種操作を自由に適用できます。
-
OLAPの主な活用例とは?分析レポートから予測分析まで徹底解説
OLAPとはOLAP(On-Line Analytical Processing:オンライン分析処理)は、アナリスト、マネージャー、経営幹部が、生のデータを企業の実際の次元性(ディメンション)を反映した形に変換した情報に対して、高速かつ一貫性のあるインタラクティブなアクセスを通じて、多様な視点からデータへの洞察(インサイト)を得ることを可能にするソフトウェア技術です。OLAPを利用することで、ユーザーはデータのオンラインによる記述的・比較的なサマリー作成や、その他の分析クエリの実行が行えます。つまりOLAPとは、多次元データの収集、保存、操作、再生を分析目的で実現するソフトウェアおよび技術の総
-
ウェブマイニングの3つの方法論とは?利用・構造・コンテンツマイニングを徹底解説
ウェブマイニングとは、機械学習(データマイニング)の手法をウェブ上のデータに適用し、知識を学習・導出することを目的とした技術です。ウェブマイニングの方法論は、大きく以下の3つの要素に分類できます。 1. Web利用マイニング(Web Usage Mining) Web利用マイニングは、Webページへのアクセスデータの集合を分析対象とするウェブマイニングの一種です。この利用データから、どのページがどのように閲覧されているかという傾向を読み取ることができます。 データは主にWebサーバーの接続ログ(アクセスログ)から自動的に収集されます。さらに、CGIスクリプトを通じて、リファラーログ、ユーザー