プログラミング

 Computer >> コンピューター >  >> プログラミング >> プログラミング
  1. グラフ・ネットワークマイニングとは?基本概念と主な応用分野を解説

    グラフは、集合、系列、格子、木構造といった従来のデータ構造よりも汎用的なクラスを定義するものです。インターネットやソーシャルネットワーク、データネットワーク、生物学的ウェブ、バイオインフォマティクス、ケミカルインフォマティクス、コンピュータビジョン、マルチメディアおよびコンテンツ検索など、幅広い分野でグラフが活用されています。ここでは、グラフ・ネットワークマイニングの代表的な応用について詳しく見ていきましょう。グラフパターンマイニンググラフパターンマイニングとは、単一のグラフまたは複数のグラフの集合から、頻出するサブグラフ(部分グラフ)を発見する手法です。マイニングのアプローチは大きく分けて、

  2. 名目データの概念階層を生成する方法とは?4つの手法を解説

    名目データの概念階層を生成する主な方法名目データ(カテゴリーデータ)に対する概念階層の生成には、いくつかの方法があります。本記事では、代表的な4つの手法をわかりやすく解説します。1. スキーマレベルで属性の半順序を明示的に指定する名目属性やディメンションの概念階層は、通常、複数の属性の集合から構成されます。ユーザーや専門家は、スキーマレベルでこれらの属性間の半順序(または全順序)を定義するだけで、概念階層を簡単に表現できます。例えば、リレーショナルデータベースに「番地(street)」「市(city)」「州・省(province/state)」「国(country)」という属性が含まれていると

  3. 組織はデータウェアハウスの情報をどのように活用しているのか?

    データウェアハウスとは何か データウェアハウジングとは、複数のソースからデータを収集・管理し、ビジネスにとって重要な洞察を提供するための手法です。データウェアハウスは、経営層の意思決定を支援することに特化して設計されています。 簡潔に言えば、データウェアハウスとは、組織の運用系(オペレーショナル)データベースから独立して維持されるデータベースのことです。データウェアハウスシステムは複数のアプリケーションシステムの統合を可能にし、統合された履歴データという堅牢なプラットフォームを提供することで、分析業務を支えます。 意味的に一貫したデータの保管基盤 データウェアハウスは、意思決定支援データモデル

  4. データマイニングは、情報処理やオンライン分析処理(OLAP)とどう違う?関係性を徹底解説

    データウェアハウスアプリケーションの3つの種類 データウェアハウスの応用には、大きく分けて「情報処理」「分析処理(OLAP)」「データマイニング」の3種類があります。それぞれの役割と特徴を理解することで、データ活用の全体像が見えてきます。 1. 情報処理(Information Processing) 情報処理では、クロス集計表・表・チャート・グラフなどを用いたクエリ処理、基本的な数値分析、レポート作成が可能です。近年のトレンドとしては、Webブラウザと統合された低コストのWebベースアクセスツールを構築する方向へ進んでおり、誰でも手軽にデータへアクセスできる環境が整いつつあります。 2.

  5. データキューブ計算を効率化する主要な最適化手法とは?

    データキューブの計算を効率的に行うためには、いくつかの一般的な最適化手法が知られています。本記事では、代表的な4つの手法について詳しく解説します。 1. ソート・ハッシュ・グループ化の活用 次元属性に対してソート、ハッシュ、グループ化の操作を適用することで、関連するタプルを並べ替えたりクラスタリングしたりできます。キューブ計算では、同じ次元値のセットを持つタプルに対して集計処理が行われるため、こうしたデータへアクセスしグループ化するために、ソート・ハッシュ・グループ化の機能を活用することが重要です。 例えば、支店別・日別・商品別の売上合計を計算する場合、タプルやセルをまず支店順に、次に日付順に

  6. パターンマイニングの主な応用分野とは?活用例を徹底解説

    パターンマイニングとはパターンマイニング(Pattern Mining)は、大量のデータの中から頻繁に現れるパターンや規則性を抽出するデータマイニング手法です。その応用範囲は非常に広く、データ分析の前処理から高度な知識発見まで、さまざまな場面で活用されています。本記事では、パターンマイニングの代表的な応用分野について詳しく解説します。1. ノイズ除去とデータクレンジング(前処理)パターンマイニングは、データ集約型のさまざまなアプリケーションにおいて、ノイズフィルタリングやデータクレンジングといった前処理に広く利用されています。例えば、遺伝子情報など数万次元もの属性を持つマイクロアレイデータの探

  7. インタラクティブな決定木構築を支援するデータ可視化手法――PBC(知覚ベース分類)の仕組み

    多次元可視化手法に基づくインタラクティブな手法「PBC(Perception-based Classification:知覚ベース分類)」は、決定木を構築する際に、ユーザーがデータに関する背景知識を組み込むことを可能にします。 PBCの特徴と利点 データと視覚的に対話することで、ユーザーはデータに対するより深い理解を得やすくなります。その結果として生成される決定木は、従来の決定木帰納法の手法で構築されたものよりも小規模になり、解釈が容易になる一方で、ほぼ同等の精度を実現できます。 円セグメント法によるピクセル指向の可視化 PBCでは、クラスラベル情報を持つ多次元データを扱うために、ピクセル

  8. ベイジアンベリーフネットワークとは?仕組み・構成要素・応用分野を徹底解説

    ベイジアンベリーフネットワークの概要 ナイーブベイズ分類器は「クラス条件付き独立性」を仮定します。つまり、データ(タプル)のクラスラベルが与えられれば、各属性値は互いに条件付き独立であるとみなし、計算を大幅に簡略化しています。 この仮定が実際に成り立つ場合、ナイーブベイズ分類器は他の多くの分類手法と比べて非常に高い効率を発揮します。しかし、現実のデータでは属性間に依存関係が存在することも少なくありません。そこで登場するのがベイジアンベリーフネットワーク(信念ネットワーク)です。これは変数間の結合条件付き確率分布を定義するモデルであり、変数の部分集合間におけるクラス条件付き独立性を柔軟に表現でき

  9. アクティブラーニング(能動学習)とは?機械学習における仕組みと主な手法を解説

    機械学習の分野においてアクティブラーニング(Active Learning:能動学習)は、「データそのものは豊富にあるものの、クラスラベルが少ない、あるいはラベルを取得するコストが高い」という状況に適した教師あり学習の一種です。通常の教師あり学習では大量のラベル付きデータが必要になりますが、アクティブラーニングでは、学習アルゴリズム自身が能動的にユーザー(人間のオラクル=アノテーターなど)へ問い合わせを行い、必要なラベルだけを効率的に収集します。このアプローチにより、同じ概念を学習するために必要なラベル付きデータの数を、従来の教師あり学習よりも大幅に抑えることができます。つまり、アクティブラー

  10. 高次元データから部分空間クラスターを発見する3つの主要手法とは?

    高次元データにおける部分空間クラスタリングの全体像高次元データからクラスタを発見する手法は、大きく部分空間探索技法、相関ベースのクラスタリング技法、バイクラスタリング技法の3つのグループに分類されます。本記事では、それぞれの特徴や代表的なアルゴリズム、適用場面について詳しく解説します。1. 部分空間探索技法部分空間探索法は、複数の部分空間を対象としてクラスタを探索します。ここでのクラスタとは、ある特定の部分空間内で互いに類似しているオブジェクトの部分集合を指します。類似性の評価には、距離や密度といった従来からの尺度が用いられます。代表例として挙げられるのがCLIQUEアルゴリズムです。CLIQ

  11. 2部グラフの用途とは?Web検索やSNS分析への活用例を解説

    2部グラフとは何か2部グラフ(二部グラフ)とは、頂点を互いに素な2つの集合に分割できるグラフです。このとき、すべての辺は必ず一方の集合の頂点と、もう一方の集合の頂点を結びます。AllElectronicsの顧客購買データを例にとると、一方の頂点集合は「ユーザー」を表し、各頂点が1人のユーザーに対応します。もう一方の集合は「製品」を表し、各頂点が1つの製品に対応します。そして、ユーザーと製品を結ぶ1本の辺は、「そのユーザーがその製品を購入した」という関係を示しています。このような構造を持つ2部グラフには、実務でも役立つさまざまな応用分野があります。以下、代表的な活用例を紹介します。2部グラフの主

  12. ハブページを活用して信頼できるWebページを見つける方法とは?

    ハブ(Hub)とは、信頼性の高いページ(オーサリティ/Authority)へのリンクをまとめて提供するWebページのことです。ハブページ自体は必ずしも有名なページである必要はなく、ほとんど被リンクがない場合もあります。しかし、特定のテーマに関する著名なサイトへのリンク集として機能する点が大きな特徴です。具体例としては、個人ホームページに掲載されたおすすめリンク集、大学の講義ページで紹介されている参考文献サイトの一覧、商用サイトで専門家によって体系的に整理されたリソース集などが挙げられます。ハブページは、特定のトピックに対して暗黙的に「権威」を与える重要な役割を担っています。ハブとオーサリティの

  13. Web利用マイニング(Web Usage Mining)とは?基本概念から活用方法まで解説

    Web利用マイニング(Web Usage Mining)とは、Webサーバーのログデータから有用なデータ・情報・知識を抽出し、Webページへのユーザーアクセスパターンを把握するための手法です。 Web利用マイニングの基本的な考え方 Webリソース管理におけるマイニングでは、Webサイト訪問者のリクエストデータ、すなわちWebサーバーログとして記録された情報が主な分析対象となります。Webページ一式のコンテンツや構成はページ作成者の意図を反映したものですが、個々のリクエストは、ユーザーがそれらのページを実際にどのように閲覧しているかを示しています。Web利用マイニングを活用することで、ページ設

  14. データマイニングの理論的基礎とは?代表的な6つの理論を徹底解説

    はじめにデータマイニングは、大量のデータから有用な知識やパターンを抽出する技術ですが、その背後には複数の理論的基盤が存在します。本記事では、データマイニングの基礎となる代表的な理論を6つの観点からわかりやすく解説します。1. データ削減(Data Reduction)この理論では、データマイニングの本質は「データ表現の削減」にあると考えます。巨大なデータベースへの問い合わせに対して高速におおよその回答を得る必要があるため、厳密な確実性をある程度犠牲にしてでも、応答速度を優先するという考え方です。具体的な手法としては、特異値分解(主成分分析の中核を担う技術)、ウェーブレット、回帰分析、対数線形モ

  15. ビジュアルデータマイニングとオーディオデータマイニングとは?基本概念と統合手法を徹底解説

    ビジュアルデータマイニングとはビジュアルデータマイニングとは、データおよび知識の可視化手法を活用して、大規模なデータセットの中に潜む暗黙的で有益な知識を発見する技術です。人間の視覚システムは目と脳によって制御されており、脳は膨大な知識ベースを備えた、動的かつ高度に並列的な処理・推論エンジンとみなすことができます。この人間の優れた視覚認識能力をデータ分析に取り入れたのが、ビジュアルデータマイニングなのです。ビジュアルデータマイニングは、データ可視化とデータマイニングという2つの分野を統合したものと捉えることができます。さらに、コンピュータグラフィックス、マルチメディアシステム、ヒューマンコンピュ

  16. 個人データを収集する企業から消費者を守るには?データマイニング時代のプライバシー保護の原則

    消費者に選択肢を与える「オプトアウト」の仕組み個人データを収集・活用する企業が消費者を保護するための一つの解決策として、複数のオプトアウト(拒否)選択肢を提供することが挙げられます。これにより、消費者は自身の個人情報の利用範囲に制限を設けられるようになります。具体的には、以下のような段階的な選択肢が考えられます。消費者の個人データをデータマイニングには一切利用しない。消費者のデータはデータマイニングに利用できるが、個人を特定できる情報や、識別につながるデータは削除してから利用する。データは自社内でのマイニングにのみ利用する。データは社内および社外の両方で利用することを許可する。ポジティブ・コン

  17. データマイニングにおける派生モデルの表現方法とは?

    データマイニングにおける分類(classification)とは、データのクラスや概念を定義し、分類するモデルを発見するプロセスです。このモデルは、クラスラベルが既知のデータオブジェクトの集合である訓練データに基づいて構築され、クラスラベルが未知のオブジェクトに対してそのラベルを予測するために用いられます。 派生モデルの主な表現形式 導出されたモデル(派生モデル)は、以下のような複数の形式で表現することができます。 分類ルール(IF-THENルール) 「もし〜ならば〜」という形式で条件と結論を明確に示すルール表現です。人間が解釈しやすいのが特徴です。 決定木 決定木はフローチャートに似

  18. ウェブ検索エンジンとは?仕組みと技術的課題をわかりやすく解説

    ウェブ検索エンジンの基本構造ウェブ検索エンジンとは、インターネット(Web)上のデータを検索するために特化したコンピュータサーバーです。ユーザーが検索クエリを入力すると、その結果がリスト形式(「ヒット」と呼ばれます)で返されます。ヒットの内容には、Webページだけでなく、画像やさまざまな種類のファイルも含まれます。検索エンジンとウェブディレクトリの違いWeb上の情報を検索するほかにも、公開データベースやオープンディレクトリに存在するデータを収集して結果として返す検索エンジンもあります。検索エンジンとウェブディレクトリの大きな違いは、その運用方法にあります。ウェブディレクトリは人間の編集者によっ

  19. データマイニング方法論の多様な側面とは?押さえておきたい6つの重要ポイント

    データマイニング方法論には、その有効性と発展を支えるさまざまな側面があります。本記事では、知識発見の幅を広げるための代表的な6つのアプローチについて、わかりやすく解説します。1. 多様で新種の知識のマイニングデータマイニングは、データの特性記述や判別分析から始まり、相関分析、分類、回帰、クラスタリング、外れ値(異常値)検出、系列パターン解析、トレンド分析に至るまで、極めて幅広いデータ分析・知識発見サービスをカバーしています。これらのサービスは同じデータベースを複数の視点から活用できるため、それぞれに応じたデータマイニング技術の開発が求められます。ソフトウェアの多様化に伴い、新たなマイニング手法

  20. データサイエンスにおける「属性」とは?意味と4つの種類をわかりやすく解説

    属性(Attribute)とは属性とは、データオブジェクトの特性や特徴を定義するためのデータフィールドのことです。データマイニングやデータベースの分野では、対象となるオブジェクト(例えば顧客)を記述する際に、この属性が基本的な構成要素となります。例えば、「ユーザー」というオブジェクトを定義する属性には、顧客ID、氏名、住所などが挙げられます。ある属性について実際に観測された値のことは、観測値(observation)と呼ばれます。類義語:次元・特徴量・変数文献の中では、「属性」に相当する概念として、以下のような用語がほぼ同じ意味で使われています。次元(dimension):主にデータウェアハウ

Total 1480 -コンピューター  FirstPage PreviousPage NextPage LastPage CurrentPage:36/74  20-コンピューター/Page Goto:1 30 31 32 33 34 35 36 37 38 39 40 41 42