Windows
 Computer >> コンピューター >  >> システム >> Windows

ビッグデータの「V」とは?11の特性と課題を徹底解説

ビッグデータは、3つ、4つ、あるいは10個の「V」によって定義されることがよくあります。しかし、これらのVは本当にビッグデータという概念の定義なのでしょうか?それとも、何か別のメッセージを伝えようとしているのでしょうか?

Vに基づく特徴付けが用いられる最大の理由は、ビッグデータに必然的に伴う課題を明確にするためです。収集、クリーニング、キュレーション、統合、保存、処理など、数多くの課題が挙げられます。

つまり、これらのVは、ビッグデータを管理し始めたときに直面しうる課題に備えるための指針を示しているのです。ビッグデータとは、以下のような特徴を持つデータのことです。

ビッグデータの「V」とは?11の特性と課題を徹底解説

  1. 膨大なボリューム(Volume)で増大する
  2. 大きな速度(Velocity)で成長する
  3. 多種多様な形式(Variety)を生み出す
  4. 大きな変動性(Variability)を持って変化する
  5. 高い真実性(Veracity)を維持するプロセスが必要
  6. 変換によって優れた可視化(Visualization)をもたらす
  7. 大きな隠れた価値(Value)を秘めている

これらのVは、ビッグデータの重要な側面と、組織が無視できないビッグデータ戦略を説明しています。以下では、ビッグデータのさまざまな属性に寄与する各Vについて詳しく見ていきましょう。

1. Volume(量)

Facebookには毎日100テラバイトのデータがアップロードされ、Akamaiは1日7,500万件のイベントを分析してオンライン広告のターゲティングを行い、Walmartは毎時100万件の顧客取引を処理しています。さらに、過去に作成された全データの90%は、わずか直近2年間で生成されたものです。

これらの数字は、「大量のデータ」という言葉が意味するものを如実に物語っています。データを「ビッグデータ」たらしめる第一の特性こそがこの巨大なボリュームであり、同時に、その保存における大きな課題でもあります。

2. Velocity(速度)

現在では、1分ごとにYouTubeへ100時間分の動画がアップロードされ、2億通以上のメールが送信され、30万件のツイートが投稿されています。

このボリュームの数字の背後には、さらに大きなトレンドがあります。既存データの90%が直近2年間だけで作られたという事実です。これは、データが生成・保存・分析・可視化される速度、すなわちベロシティを示しています。

組織にとっての課題は、データがリアルタイムで生成され活用される莫大な速さに対応することです。

3. Variety(多様性)

かつて作られていたデータはすべて構造化データで、列と行にきれいに収まるものでした。しかしその時代は終わりを迎えました。今日生成されるデータの90%は非構造化データであり、地理空間データから、内容や感情を分析できるSNSの投稿、写真や動画といったビジュアルデータまで、あらゆる形態で生み出されています。

多様性は、ビッグデータ最大の課題の一つを表しています。データは非構造化である場合があり、XMLから動画、SMSまで実にさまざまな種類を含みます。特にデータ自体が急速に変化する場合、それらを意味のある形で整理することは決して簡単な作業ではありません。

4. Variability(変動性)

変動性はしばしば多様性と混同されます。両者を区別する簡単な例を挙げましょう。スターバックスのコールドコーヒーには非常に多くのフレーバーがあります。これが「多様性」です。一方、毎日カフェモカを買っているのに、味や香りが前の日と少し違う――これが「変動性」です。

ビッグデータの文脈における変動性は、いくつかの異なる意味を持ちます。一つはデータ内の不整合(矛盾)の数です。これらは、意味のある分析を行うために、異常検知や外れ値検出の手法によって見つけ出す必要があります。また、複数の異種データタイプやソースに起因する多次元性によっても、ビッグデータは変動します。さらに、データベースへのロード速度が一定でないことも変動性に含まれます。

5. Veracity(真実性)

ビッグデータを理解するうえで重要なのは、その乱雑でノイズの多い性質、そして分析を始める前に正確なデータセットを作り上げるまでに要する膨大な労力です。分析対象のデータが不正確だったり不完全だったりすれば、その分析は無意味になってしまいます。

こうした状況は、データストリームが多様なソースから発生し、信号対ノイズ比の異なるさまざまなフォーマットで提示されるときに起こります。データがビッグデータ分析に到達する頃には、蓄積されたエラーだらけになっている可能性もあります。

真実性とは、データの正確さを確保することです。そのためには、不良データがシステム内に蓄積するのを防ぐプロセスが必要になります。最も分かりやすい例は、マーケティングオートメーションシステムに、偽名や不正確な連絡先情報で登録されるコンタクトです。「ミッキーマウス」という架空の名前がデータベースに登録されているのを何度見たことでしょうか。まさに古典的な「ガベージイン、ガベージアウト」の課題なのです。

6. Visualization(可視化)

これはビッグデータの中でも難しい部分であり、ここで失敗すると、膨大なデータは無用の長物となってしまいます。ビッグデータ処理システムの中核的なタスクは、その巨大なスケールを、容易に理解でき、かつ行動につなげられる形に変換することです。人間が理解するためには、グラフィカルな形式への変換が最良の手法の一つとなります。

現在のビッグデータ可視化ツールは、インメモリ技術の限界や、拡張性・機能性・応答時間の不足といった技術的課題に直面しています。従来のグラフでは10億個のデータポイントを描画する需要を満たせないため、データクラスタリングや、ツリーマップ、サンバースト図、平行座標、円形ネットワーク図、コーンツリーなど、異なるデータ表現方法が必要になります。

7. Value(価値)

価値こそが最終目標です。ビッグデータが持つ潜在的な価値は計り知れません。ボリューム、ベロシティ、バラエティ、バリアビリティ、ベラシティ、ビジュアライゼーションの管理には多大な時間と労力を要しますが、その上で、組織がデータから価値を得られていることを確認することが重要です。

もちろん、データそのものには何の価値もありません。価値があるのは、そのデータに対して行われる分析であり、データを情報へと変換し、最終的に知識へと昇華させるプロセスなのです。

以上の7つのVは、ビッグデータの3つの重要な側面、すなわち定義、特性、そして課題を教えてくれます。しかし、これら7つのVの課題に対処する方法を研究する過程で、研究者たちはさらなるVを発見しました。それらはビッグデータにおいて決定的に重要な役割を果たすわけではありませんが、特性と課題のリストを完成させるものです。

8. Validity(妥当性)

真実性と似ていますが、妥当性とは、意図された用途に対してデータがどれだけ正確で正しいかを指します。ビッグデータの真実性とは妥当性の問題であり、データが意図した用途に対して正確で正しいことを意味します。明らかに、有効なデータこそが適切な意思決定の鍵となります。データ検証は、データが破損せずに伝送されたことを保証するものです。

9. Viability(実行可能性)

まず、次のような問いについて考えてみましょう。

  1. 時間帯や曜日は購買行動にどのような影響を与えるか?
  2. SNSでの言及の急増は、購入の増加または減少を予兆するか?
  3. 位置情報、商品の在庫状況、時間帯、購入履歴、年齢、家族構成、与信枠、車種などが組み合わさって、消費者の購買意向をどう予測できるか?

最初のタスクは、そのデータの実行可能性(バイアビリティ)を評価することです。効果的な予測モデルを構築する際には、あまりにも多くの種類のデータと変数を考慮する必要があるため、本格的なモデルの構築に投資する前に、特定の変数の関連性を迅速かつ費用対効果の高い方法でテストし確認したいところです。言い換えれば、さらなる行動を取る前に仮説を検証したいのです。そして、変数の実行可能性を判定する過程で、当初の仮説には含まれていなかった他の変数が、望ましい結果や観察された結果に意味のある影響を与えるかどうかも、視野を広げて判断できます。

10. Volatility(揮発性)

データがいつから無関係、歴史的なもの、あるいは役に立たないものとみなされるのでしょうか?データはどれくらいの期間保持されるべきなのでしょうか?

ビッグデータの揮発性について語るとき、私たちがビジネスで日常的に運用している構造化データの保持ポリシーを容易に思い出します。保持期間が満了すれば、簡単に破棄できます。

しかし、ビッグデータの場合は、その速度とボリュームゆえに、揮発性を慎重に検討する必要があります。データの鮮度と可用性に関するルールを確立するとともに、必要なときに情報を迅速に取得できるようにしなければなりません。

11. Vulnerability(脆弱性)

2015年のAshley Madisonハッキング事件を覚えていますか?あるいは2016年5月、CRNが報じた「Peace」と名乗るハッカーがダークウェブ上で販売目的でデータを投稿し、それには1億6,700万件のLinkedInアカウント情報と、MySpaceユーザーの3億6,000万件のメールアドレスおよびパスワードが含まれていたという報道は?

ビッグデータは新たなセキュリティ上の懸念をもたらします。特にこれらの特性を考慮すると、ビッグデータ向けのセキュリティ対策を構築すること自体が一つの課題となります。何しろ、データ漏洩は重大な侵害なのです。

では、これらすべてはビッグデータの本質について何を語っているのでしょうか?ビッグデータは巨大で急速に拡大している一方で、ノイズが多く、乱雑で、絶えず変化し、何百ものフォーマットを持ち、分析と可視化なしにはほとんど価値がないということです。

ボリューム、ベロシティ、バラエティは、単にビッグデータの主要パラメータであるだけでなく、ビッグデータという概念を生み出した理由であり、通常のデータとビッグデータを区別する重要な特徴でもあります。これらがビッグデータ自体に内在するものであるのに対し、その他のV――バリアビリティ、ベラシティ、ビジュアライゼーション、バリュー――は、ビッグデータを処理・分析し、そこから利益を得ようとする者に対して提示される巨大な複雑さを反映する重要な属性です。

間違いなく、ビッグデータは企業ITが適切なコンピューティングインフラで対応すべき重要なトレンドです。しかし、高性能な分析基盤と、全体を理解するデータサイエンティストがなければ、ビジネス上の優位性につながる価値を生み出すどころか、単に「ビッグコスト(巨額のコスト)」を生み出すリスクを負うことになるのです。

  1. ビッグデータの課題とは?克服すべき4つの主要問題を徹底解説

    ビッグデータとは? 機械の処理能力には限界があり、その制約の一つが処理できるデータのサイズです。現在のマシンは大規模なデータを扱えますが、データ量の指数関数的な増加は依然として深刻な問題となっています。 現代のデータは膨大であり、急速に増え続けています。この増加により、従来のデータ保存・処理手法では対応しきれなくなっているのです。 この問題を克服するには、膨大なデータ量に対応できるシステムやプロセスが必要です。ビッグデータとは、高度なリアルタイム処理ユニットと入手しやすいハードウェアを活用し、巨大なデータを効率的に処理する仕組みのことを指します。 データの形態は、かつてとは大きく変わりました

  2. 2022年版 ビッグデータ分析ツール ベスト10徹底解説

    ビッグデータ分析ツールは、さまざまなビッグデータクラスターから収集されたデータセットからインサイトを導き出すためのものです。企業はこれらのツールを活用することで、データトレンドの把握、パターンとその複雑さの理解、そして生のデータを分かりやすい可視化情報へと変換することが可能になります。 ビッグデータは雑多な性質を持つため、自社のビジネスパフォーマンスを正確に把握し、顧客インサイトを獲得するうえで分析ツールは欠かせません。オンラインには多数のデータ分析ツールが存在するため、本記事ではそれぞれの特徴を詳しく解説し、最適なビッグデータ分析ツールを選ぶ際の参考となる情報をまとめました。 2022年版