プログラミング
 Computer >> コンピューター >  >> プログラミング >> プログラミング

データウェアハウスのサーバープラットフォームに求められる要件とは?

サーバープラットフォームに求められる主な要件

データウェアハウスを構築・運用する際、サーバープラットフォームの選定には以下のような要件を考慮する必要があります。これらの要件を正しく評価することで、ビジネスニーズに合った最適なハードウェア環境を構築できます。

1. 変動性(ボラティリティ)

変動性とは、データベースの動的な特性を表す指標です。具体的には、データベースがどの程度の頻度で更新されるか、更新のたびにどれだけのデータが変更・置き換えられるか、ロードウィンドウ(データ投入可能な時間帯)がどれほどの長さかといった要素が含まれます。一般的に、日次データは週次や月次のデータよりも変動性が高くなります。

顧客の離反率(チャーンレート)を把握すれば、顧客ディメンションが時間とともにどれだけ変化するかを予測できます。こうした問いへの答えは、ハードウェアプラットフォームの規模と性能に直接影響を与えます。データウェアハウスはビジネスと技術の両方の変化を一身に受け止める存在であり、急速に変化する両者に柔軟に対応できなければなりません。

2. ビジネスプロセスの数

ウェアハウスがサポートする個別のビジネスプロセスの数が増えるほど、システムの複雑さは大幅に上昇します。ユーザー数が多い場合や、ビジネス上の投資対効果が高い場合には、ビジネスプロセスごとに独立したハードウェアプラットフォームを用意することが合理的な判断となります。

3. 利用形態

システムの利用形態やフロントエンドツールの選択も、プラットフォーム選定に密接に関わります。アドホックな分析を頻繁に行うアクティブなユーザーは、データウェアハウスに大きな負荷をかけることがあります。優秀なアナリストはあらゆる角度から機会を探すため、こうした利用形態に最適化するのは困難です。

一方、ボタン一つで定型レポートを生成することが中心のシステムであれば、それらのレポートに合わせた最適化が可能です。市販の多くのレポートツールは定型レポートのスケジュール実行機能を備えており、データロード完了後の早朝、出勤前の時間帯にレポートを実行するよう設定できます。これにより、定型レポートをオフピーク時間帯へ移すことで、システム全体の負荷分散が実現します。

また、大規模なデータマイニングも、データ量と入出力スケーラビリティの両面でハードウェアプラットフォームに大きな負荷をもたらします。データマイニングシステムは膨大なデータを取り込み、高性能なマイニングツールで分析し、その結果をさらなる分析や後続のビジネス活用のために出力する必要があります。アドホック利用、レポート作成、データマイニングではクエリの特性がそれぞれ異なるため、プラットフォームごとに性能が変わる可能性があります。そのため、どのような種類のクエリが発生するのかを事前に把握しておくことが極めて重要です。

4. 技術的準備状況

サーバー環境は概念的なレベルではCPU環境と同じですが、実装レベルでは大きく異なります。導入を検討している技術が自社の環境で実際に動作するかどうか、事前の検証が必要です。

5. ソフトウェアの可用性

要件定義の結果、特定の機能が必要と判明することがあります。例えば、ウェアハウスのデータを地図上に表示できる地理情報システム(GIS)などがその代表例です。ソフトウェア選定の過程で、その要件に最適な地理マッピングアプリケーションが、特定のハイエンドのグラフィックスベースのプラットフォームでしか動作しないことが判明する場合もあります。このように、必要なソフトウェアが動作するプラットフォームを事前に確認しておくことが、後工程での手戻りを防ぐ鍵となります。

  1. データマイニングの主な手法とは?押さえておきたい5つの技法を解説

    データマイニングとは、統計学や数学などの手法を含むパターン認識技術を活用し、データベースに蓄積された膨大なデータの中から、有用な新たな相関関係・パターン・トレンドを発見する一連のプロセスです。単にデータを収集するだけでなく、事実に基づくデータセットを分析して予期していなかった関係性を明らかにし、データの保有者にとって論理的かつ実用的な形で情報を要約することを目的としています。最大の課題は、問題解決や企業の発展につながる本質的な情報を、大量のデータからいかに効率よく抽出するかという点にあります。現在では、データマイニングとより良い意思決定を支援するための多彩なツールや技術が数多く提供されており、

  2. データキューブ計算を効率化する主要な最適化手法とは?

    データキューブの計算を効率的に行うためには、いくつかの一般的な最適化手法が知られています。本記事では、代表的な4つの手法について詳しく解説します。 1. ソート・ハッシュ・グループ化の活用 次元属性に対してソート、ハッシュ、グループ化の操作を適用することで、関連するタプルを並べ替えたりクラスタリングしたりできます。キューブ計算では、同じ次元値のセットを持つタプルに対して集計処理が行われるため、こうしたデータへアクセスしグループ化するために、ソート・ハッシュ・グループ化の機能を活用することが重要です。 例えば、支店別・日別・商品別の売上合計を計算する場合、タプルやセルをまず支店順に、次に日付順に