プログラミング

 Computer >> コンピューター >  >> プログラミング >> プログラミング
  1. 時系列データベースとは?基本概念とトレンド分析の4つの変動要素を徹底解説

    時系列データベースとは時系列データベースは、時間を繰り返し測定しながら取得された値やイベントの連なり(時系列データ)を格納・管理するためのデータベースです。値は一般的に一定の時間間隔(例:1時間ごと、1日ごと、1週間ごと)で計測されます。時系列データベースは、株式市場の分析、経済や売上の予測、予算分析、公益事業調査、在庫調査、収量予測、作業負荷予測、プロセスや品質管理、大気・気温・風・地震といった自然現象の観測、数値・工学実験、医療分野など、実に幅広い用途で活用されています。時系列データベースと系列データベースの関係時系列データベースは、系列データベースの一種でもあります。系列データベースとは

  2. 不一致検定(ディスコーダンシー・テスト)はどのように機能するのか?

    不一致検定の基本的な考え方統計学における不一致検定(discordancy test)は、2つの仮説,作業仮説と対立仮説,を用いて分析を行います。作業仮説Hとは、「n個のオブジェクトからなるデータセット全体が、初期の分布モデルFに従う」という主張です。数式で表すと、H: oi ∈ F(i = 1, 2, ..., n)となります。この仮説は、棄却を裏付ける統計的に有意な証拠が存在しない限り保持されます。不一致検定は、あるオブジェクトoiが分布Fに対して著しく大きい(または小さい)かどうかを判定するものです。利用可能なデータに関する知識に基づいて、さまざまな検定統計量が不一致検定のため

  3. 階層型クラスタリング手法とは?仕組みと2つの種類を徹底解説

    階層型クラスタリング(Hierarchical Clustering)は、データオブジェクトをクラスタの木構造へと統合していく手法です。アルゴリズムは「トップダウン型」と「ボトムアップ型」のいずれかに分類されます。ただし、階層型クラスタリング手法には、マージ(併合)や分割の決定が一度完了すると後から調整できないという弱点があり、その結果、クラスタリングの品質が低下する可能性があります。クラスタの併合は、クラスタ間の距離に基づいて行われます。クラスタ間距離として広く使われている尺度は以下の通りです。ここで、mi はクラスタ Ci の平均値、ni は Ci に含まれる点の数、|p − p′| は2

  4. OLAPの特徴とは?FASMIテストで見る5つの重要要件

    OLAP(Online Analytical Processing:オンライン分析処理)の特性を評価する際に広く用いられているのが「FASMIテスト」です。FASMIは、Fast(高速性)、Analysis(分析力)、Shared(共有性)、Multidimensional(多次元性)、Information(情報量)の頭文字を取ったもので、OLAPアプリケーションが満たすべき特徴を具体的に示す基準となっています。このテストは特定の実装方法を強制するものではなく、システムが備えるべき能力を定義するものです。 FASMIテストの5つの要素 Fast(高速性) OLAPシステムは、ユーザーへの応答

  5. WebベースのOLAPツールとは?代表的な製品と3つの実装方式を徹底解説

    OLAP(多次元データ分析)をブラウザから直接利用できるようにしたWebベースのツールや実装方式は、大きく分けて複数存在します。本記事では、代表的な3つの製品と、Web上でOLAP機能を実現するための主なアプローチについて詳しく解説します。代表的なWebベースのOLAPツールArbor Essbase WebArbor Essbase Webは、ドリルアップ・ドリルダウン・ドリルアクロスといった多方向の分析操作や、スライス&ダイス、そして強力なレポーティング機能など、OLAPに必要な機能一式を提供するツールです。また、複数ユーザーによる同時書き込み(マルチユーザー同時更新)に対応したデータ入力

  6. データキューブ計算を効率化する4つの主要な最適化戦略

    データキューブ(多次元データモデル)の計算は、次元数やデータ量の増加に伴って膨大なコストが発生します。効率的なキューブ計算を実現するためには、計算量とディスクI/Oを抑える最適化手法の活用が不可欠です。本記事では、代表的な4つの最適化戦略について詳しく解説します。 1. ソート・ハッシュ・グループ化の活用 ソート、ハッシュ、グループ化といった操作を次元属性に適用することで、関連するタプルを並べ替えたりクラスタリングしたりできます。キューブ計算において集約処理は、同じ次元値のセットを持つタプル(セル)に対して実行されるため、該当するデータへのアクセスとグループ化にこれらの機能を活用することが重要

  7. Aprioriアルゴリズムのマイニング効率をさらに高める4つの改善手法とは?

    Aprioriアルゴリズムには、元のアルゴリズムの効率向上を目的としたさまざまな改良版が提案されています。本記事では、代表的な最適化手法である「ハッシュベース手法」「トランザクション削減」「分割法」「サンプリング」の4つについて詳しく解説します。 ハッシュベース手法(アイテムセットのバケットへのハッシュ) ハッシュベースの手法を用いることで、k > 1 における候補k-アイテムセット Ck のサイズを削減できます。例えば、データベース内の各トランザクションを走査し、候補1-アイテムセット C1 から頻出1-アイテムセット L1 を生成する過程で、各トランザクションから2-アイテムセット

  8. データマイニングにおけるクラスタリングの主要な要件とは?7つの重要ポイントを解説

    データマイニングにおいてクラスタリングを効果的に行うためには、いくつかの重要な要件を満たす必要があります。本記事では、クラスタリングアルゴリズムに求められる7つの主要な要件について詳しく解説します。1. スケーラビリティ(拡張性)一部のクラスタリングアルゴリズムは、数百件程度の小規模なデータセットであれば良好に動作します。しかし、大規模なデータベースには数百万件ものオブジェクトが含まれる可能性があり、巨大なデータセットのサンプルに対してのみクラスタリングを行うと、部分的な結果しか得られません。そのため、大規模データにも対応できる高いスケーラビリティを持つクラスタリングアルゴリズムが不可欠です。

  9. 大規模データセットにおけるk-medoidsアルゴリズムの効率性とは?PAM・CLARA・CLARANSの違いを徹底解説

    PAM(Partitioning Around Medoids)のような古典的なk-medoids分割アルゴリズムは、小規模なデータセットに対しては効率的に動作しますが、巨大なデータセットにはうまくスケールしないという課題があります。より大きなデータセットを扱うためには、CLARA(Clustering Large Applications)と呼ばれるサンプリングベースの手法を利用することができます。 CLARA:サンプリングによるスケーラビリティの改善 CLARAの背後にある考え方は次のとおりです。サンプルが十分にランダムな方法で選択されていれば、そのサンプルは元のデータセットを忠実に代表す

  10. カメレオン(Chameleon)とは?動的モデリングを用いた階層型クラスタリングアルゴリズムの解説

    カメレオン(Chameleon)は、動的モデリングを用いてクラスタ間の類似度を判定する階層型クラスタリングアルゴリズムです。ROCKやCUREといった既存の階層型クラスタリング手法が抱える弱点を克服するために開発されました。ROCKおよびその関連手法は、クラスタ内の相互連結性(インターコネクティビティ)を重視する一方で、クラスタ間の近接性に関する情報を軽視していました。逆に、CUREおよびその関連手法はクラスタ間の近接性を考慮するものの、相互連結性を無視しています。カメレオンでは、クラスタの類似度を「クラスタ内部のオブジェクト同士がどれだけ強く連結しているか」と「クラスタ同士の近さ」の両方に基

  11. グリッドベースクラスタリングとは?STINGなどの代表的な手法を解説

    グリッドベースクラスタリング手法の概要 グリッドベース(格子ベース)のクラスタリング手法は、マルチレゾリューション(多分解能)のグリッドデータ構造を利用するアプローチです。対象となる領域を有限個のセルに量子化し、これらのセルが形成するグリッド構造上で、クラスタリングに関するすべての操作を実行します。 この手法の最大のメリットは処理速度の速さです。その処理時間は一般的にデータオブジェクトの数には依存せず、量子化された空間における各次元ごとのセル数のみに依存します。そのため、大規模データセットに対しても安定した高いパフォーマンスを発揮します。 代表的なグリッドベース手法の例 STING:グリッ

  12. データマイニングの歴史とは?定義からKDDプロセスまで徹底解説

    データマイニングとは何かデータマイニングとは、統計や数学の手法を含むパターン認識技術を活用し、リポジトリに保存された大量のデータを精査することで、有用な新しい相関関係・パターン・トレンドを見つけ出すプロセスです。具体的には、事実に基づくデータセットを分析し、予期していなかった関係性を発見すると同時に、データの保有者にとって論理的かつ有益な形でレコードを新たな方法で要約することを目的としています。また、データベースの所有者が明確で有益な結果を得られるよう、当初は未知だった規則性や関連性を見出すために、膨大な情報を選択・探索・モデル化する一連の手順でもあります。データサイエンスとの共通点と多様な手

  13. KDD(データベースからの知識発見)とは?プロセスとデータマイニングの関係を解説

    KDD(Knowledge Discovery in Databases)は、日本語で「データベースからの知識発見」と訳され、データの中から知識を発見するまでの一連の幅広いプロセスを指す概念です。単に特定のデータマイニング技術を実行するだけでなく、その技術をどのように高度に活用するかという視点が重視されています。 この分野は、人工知能、機械学習、パターン認識、データベース、統計学、エキスパートシステム向けの知識獲得、そしてデータ可視化など、多岐にわたる研究領域の研究者たちにとって重要な関心事となっています。 KDDプロセスの目的 KDDプロセスの主な目的は、大規模なデータベースに蓄積された情報

  14. KDDプロセスとは?データベースからの知識発見の流れと主要ステップを解説

    KDD(Knowledge Discovery in Databases)とはKDDは「Knowledge Discovery in Databases(データベースからの知識発見)」の略称で、データの中から知識を発見する一連の広範なプロセスを定義する概念です。特定のデータマイニング手法を高度に応用することを重視しており、人工知能、機械学習、パターン認識、データベース、統計学、エキスパートシステム向けの知識獲得、データ可視化など、多くの分野の研究者が注目している領域です。知識発見プロセスの特徴知識発見プロセスは反復的かつ対話的に進められる点が大きな特徴で、複数のステップで構成されています。各段

  15. データマイニング手法におけるユーザーインタラクションの主な課題とは?

    データマイニング手法には、ユーザーインタラクションの観点から解決すべき重要な課題が数多く存在します。本記事では、代表的な8つの課題について詳しく解説します。1. データベースにおける多様な知識のマイニングユーザーによって関心を持つ知識の種類は異なります。そのため、データマイニングシステムは、データの特徴付け、判別分析、相関関係の発見、分類、クラスタリング、傾向や偏差の分析、類似性分析など、幅広いデータ分析および知識発見タスクを網羅的にカバーできる必要があります。2. 複数の抽象化レベルにおける対話型マイニングデータベース内に何が存在するのかを事前に正確に把握することは困難であるため、データマイ

  16. データマイニングの評価指標(メトリクス)とは?主要な指標をわかりやすく解説

    データマイニングの評価指標(メトリクス)とはデータマイニングは、知覚モデルや分析モデル、そして複数のアルゴリズムを活用して人間の脳の思考プロセスをシミュレートする、人工知能(AI)の一形態です。これにより、機械が人間のように意思決定を行ったり、選択肢を導き出したりすることが可能になります。ただし、データマイニングツールを効果的に活用するには、ユーザー側が機械に対してルールや設定、さらには経験則に基づく情報を適切に与える必要があります。ここでは、意思決定支援に役立つ代表的なデータマイニングの評価指標を紹介します。1. 有用性有用性とは、モデルが実際に役立つデータを提供しているかどうかを判断するた

  17. データマイニングが社会に与える影響とは?プライバシー・プロファイリング・不正利用の観点から解説

    データマイニングとは、統計的手法や数学的手法といったパターン認識技術を活用し、データベースに蓄積された膨大なデータの中から、有用な相関関係・パターン・トレンドを発見するプロセスです。事実に基づくデータセットを分析することで、これまで気づかれていなかった関係性を明らかにし、データの所有者にとって論理的かつ有益な形で情報を要約することを目指します。データマイニングシステムは、個人をさまざまなグループやセグメントに識別・分類することを促進するよう設計されています。企業の視点、ひいては業界全体の視点から見れば、データマイニングは利益を合理的に追求するための選別技術として機能しているとも解釈できるのです

  18. データマイニングの課題とは?押さえるべき5つの主要ポイントを解説

    データマイニングにおける主な課題データマイニングは、大量のデータから価値ある知識を発見する強力な手法ですが、実現・運用の過程には数多くの課題が存在します。ここでは、特に重要とされる5つの課題について詳しく解説します。1. アルゴリズムの効率性とスケーラビリティ膨大なデータベースから効果的にデータを抽出し、知識を発見するためには、知識発見アルゴリズムが大規模データベースに対して効率的かつスケーラブルである必要があります。具体的には、データマイニングアルゴリズムの実行時間は、巨大なデータベースを対象とした場合でも予測可能で、許容範囲内に収まるものでなければなりません。指数関数的、あるいは高次の多項

  19. クラスタリングとは?基本概念からビジネス活用事例までわかりやすく解説

    クラスタリングとは何かクラスタリング(クラスタ分析)とは、物理的あるいは抽象的な一連のオブジェクトを、性質の似たもの同士でクラス(グループ)に分類するプロセスを指します。クラスターとは、同じクラスタ内では互いに類似しており、他のクラスタに属するオブジェクトとは明確に異なるデータオブジェクトの集合のことです。多くのアプリケーションにおいて、クラスタに含まれるデータオブジェクトは、ひとまとまりのグループとして扱うことができます。クラスタ分析は、人間が本来行っている本質的な活動の一つでもあります。クラスタリングの基本的な考え方クラスタ分析は、対象となるレコードに対して測定されたさまざまな指標をもとに

  20. クラスタリング分析に求められる8つの重要な要件とは?

    クラスタリングに求められる主な要件クラスタリングは、大量のデータから類似したグループを見つけ出す強力なデータマイニング手法です。しかし、実際のデータ分析で高品質な結果を得るためには、いくつかの重要な要件を満たす必要があります。ここでは、実用的なクラスタリングアルゴリズムに求められる8つのポイントを解説します。1. 拡張性(スケーラビリティ)一部のクラスタリングアルゴリズムは、200件未満といった小規模なデータセットでは良好に動作しますが、大規模なデータベースには数百万件のオブジェクトが含まれることもあります。巨大なデータセットのサンプルだけを対象にクラスタリングを行うと、偏った結果につながる恐

Total 1480 -コンピューター  FirstPage PreviousPage NextPage LastPage CurrentPage:51/74  20-コンピューター/Page Goto:1 45 46 47 48 49 50 51 52 53 54 55 56 57