プログラミング

 Computer >> コンピューター >  >> プログラミング >> プログラミング
  1. STREAMアルゴリズムとは?データストリームk-mediansクラスタリングの仕組みと課題を解説

    STREAMアルゴリズムの概要 STREAMは、k-medians問題(k-中央値クラスタリング)のために開発された、シングルパス(1回の走査)による定数倍近似アルゴリズムです。k-medians問題とは、N個のデータポイントをk個のクラスタ(グループ)に分割し、各ポイントとそれが割り当てられたクラスタ中心との間の二乗誤差の合計(SSQ:Sum of Squared Error)を最小化する問題を指します。その狙いは、互いに類似したデータポイントを同じクラスタにまとめ、他のクラスタに属するポイントとは区別することにあります。 ストリームデータモデルにおける制約 ストリームデータモデルでは、デ

  2. CBR(ケースベース推論)とは?仕組みと応用分野をわかりやすく解説

    CBR(Case-Based Reasoning)の基本概念CBRは「ケースベース推論(Case-Based Reasoning)」の略称で、過去に解決した問題の事例(ケース)を蓄積したデータベースを活用し、新しい問題を解決する手法です。CBR分類器が正しく機能するためには、問題とその解決策を格納したデータベースが不可欠となります。ユークリッド空間上の点として訓練データ(タプル)を保存する最近傍法(k-NN)などの分類器とは異なり、CBRは問題解決のためのタプル、すなわち「ケース」を、より複雑な記号的表現として保存する点が大きな特徴です。CBRの主な応用分野CBRはさまざまなビジネスシーンで活

  3. 一般化線形モデル(GLM)とは?基本概念から種類、活用方法まで徹底解説

    一般化線形モデル(GLM)の基礎一般化線形モデル(GLM:Generalized Linear Models)は、線形回帰の考え方をカテゴリ型の目的変数のモデリングへ拡張するための理論的基盤を定義するものです。一般化線形モデルでは、目的変数 y の分散が y の平均値の関数として表される点が大きな特徴です。これは、y の分散が常に一定であると仮定する従来の線形回帰とは異なる点です。GLMのアルゴリズムと特徴一般化線形モデルは、従来の線形モデルを拡張した手法です。このアルゴリズムでは、対数尤度を最大化することでデータにモデルを適合させます。また、パラメータの正則化にはエラスティックネット(Ela

  4. ROC曲線とは?分類モデルの性能を評価する手法を解説

    ROC曲線とはROCは「Receiver Operating Characteristic(受信者動作特性)」の略称です。ROC曲線は、2つの分類モデルを分析・比較するための便利な可視化ツールであり、その起源は第二次世界大戦中にレーダー画像の識別を目的として発展した信号検出理論にあります。ROC曲線が示すものROC曲線は、あるモデルにおける「真陽性率(感度)」と「偽陽性率」の間のトレードオフを表します。真陽性率とは、実際に陽性であるデータのうち、正しく陽性と認識できた割合のことです。一方、偽陽性率とは、実際には陰性であるデータを誤って陽性と認識してしまった割合を指します。2クラス分類問題におい

  5. 間隔尺度変数とは?定義・標準化・距離尺度まで徹底解説

    間隔尺度(インターバルスケール)変数とは、ほぼ線形なスケールを持つ連続型データのことです。具体例としては、体重や身長、緯度・経度の座標(住宅をクラスタリングする場合など)、気温などが挙げられます。このようなデータを扱うクラスタリング分析では、使用する測定単位が結果に大きな影響を与える点に注意が必要です。本記事では、間隔尺度変数の基本概念から、標準化の手法、そして代表的な距離尺度までをわかりやすく解説します。測定単位がクラスタリング分析に与える影響例えば、身長の単位をメートルからインチへ、体重の単位をキログラムからポンドへ変更したとしましょう。同じデータでも単位が変わることで、得られるクラスタリ

  6. バイナリ変数とは?定義・種類と非類似度(ジャッカード係数)の計算方法を解説

    バイナリ変数(二値変数)とは、「0」か「1」という2つの状態のみを取りうる変数のことです。「0」はその属性が存在しないこと、「1」は存在することを意味します。例えば、患者を表す「喫煙者(smoker)」という変数において、1はその患者が喫煙していることを、0は喫煙していないことを示します。 ここで注意したいのは、バイナリ変数をあたかも間隔尺度(interval-scaled)の変数であるかのように扱うと、クラスタリングの結果が誤ったものになる可能性があるという点です。そのため、バイナリデータに適した手法を用いて非類似度を計算することが不可欠となります。 2×2分割表による非類似度の計算 バイナ

  7. k-meansアルゴリズムの仕組みを徹底解説!クラスタ分割の基本から収束条件まで

    k-meansアルゴリズムとは?k-means(k平均法)は、データマイニングや機械学習で広く利用されている代表的な非階層型クラスタリング手法です。このアルゴリズムは、入力パラメータとして指定された k をもとに、n個のオブジェクトをk個のクラスタへ分割します。その目標は、「同じクラスタ内のオブジェクト同士はできるだけ似通っている(クラスタ内類似度が高い)一方で、異なるクラスタ間のオブジェクトはできるだけ似ていない(クラスタ間類似度が低い)」という状態を実現することです。クラスタの類似度は、そのクラスタに含まれるオブジェクト群の平均値(平均ベクトル)を基準にして計算されます。この平均値は、クラ

  8. ROCKとは?リンクを活用した頑健なクラスタリングアルゴリズムを徹底解説

    ROCKとはROCK(RObust Clustering using linKs)は、カテゴリ属性を持つデータを対象とした階層型クラスタリングアルゴリズムです。「リンク」と呼ばれる概念、すなわち2つのオブジェクトが共有する共通近傍の数を分析することで、高品質なクラスタを実現します。単純な距離尺度では、カテゴリ情報のクラスタリングにおいて高品質な結果が得られないことが示されています。従来手法の課題:「局所的」アプローチの限界多くのクラスタリングアルゴリズムは、クラスタリングの各ステップで類似した点同士を統合していく、いわば「局所的」な手法を採用しています。しかしこの方法には誤りが生じやすいという

  9. DBSCANとは?密度ベースクラスタリングの基本概念と仕組みを解説

    DBSCANとは DBSCAN(Density-Based Spatial Clustering of Applications with Noise)は、「ノイズを含むアプリケーション向けの密度ベース空間クラスタリング」と呼ばれるクラスタリング手法です。k-meansのような距離に基づく手法と異なり、データの「密度」に着目することで、十分に高い密度を持つ領域をクラスタとして成長させながら、ノイズを含む空間データベースから任意の形状のクラスタを検出できます。クラスタは「密度連結な点の最大集合」として表現されます。 DBSCANの基本概念 密度ベースクラスタリングでは、以下の定義が中心的な役割

  10. DENCLUEとは?密度ベースクラスタリング手法の基礎と特徴を解説

    クラスタリングとはクラスタリングは、知識発見のための重要なデータマイニング手法のひとつです。探索的データ分析(EDA)に分類される手法であり、複数のデータオブジェクトを「クラスタ」と呼ばれる同質のグループへと分類します。DENCLUEの概要DENCLUEは「Density-based Clustering(密度ベースクラスタリング)」を表す用語です。密度分布関数の集合に基づくクラスタリング手法で、カーネル密度推定に基づくクラスタモデルを採用しています。クラスタは、推定された密度関数の局所的最大値(ローカルマキシマム)として表現されます。ただし、DENCLUEは一様分布に従うレコードには適してい

  11. STING(統計情報グリッド)とは?仕組みと特徴をわかりやすく解説

    STING(統計情報グリッド)とは STINGは「Statistical Information Grid(統計情報グリッド)」の略称で、空間データマイニングで用いられるグリッドベースのマルチ解像度クラスタリング手法です。この手法では、対象となる空間領域を矩形のセルに分割し、そのセル群を階層構造として管理します。上位レベルの各セルは、次の下位レベルにおける複数のセルへと細分化されていきます。 事前計算・保存される統計情報 各グリッドセル内の属性に関する統計データ(平均値、最大値、最小値など)は、あらかじめ計算されて保存されています。上位レベルのセルの統計パラメータは、下位レベルのセルのパラメ

  12. 閉頻繁アイテムセットを効率的にマイニングする方法とは?枝刈り戦略とクロージャーチェックを解説

    閉頻繁アイテムセットマイニングの基本アプローチ最も単純な(ナイーブな)アプローチでは、まず頻出アイテムセットの完全な集合をマイニングし、その後、既存の頻出アイテムセットの真部分集合であり、かつ同じサポート度を持つ各頻出アイテムセットを削除します。しかし、この方法では、長さ100の頻出アイテムセットを1つ得るためだけに、2100−1個もの頻出アイテムセットを導出してからでなければ、冗長なアイテムセットの削除を開始できません。そこで推奨されるのは、マイニング段階で閉頻繁アイテムセット(closed frequent itemsets)を直接探索する手法です。これには、マイニング中に閉アイテムセット

  13. アソシエーションルールクラスタリングシステム(ARCS)に含まれる手順とは?

    アソシエーションルールクラスタリングシステム(ARCS)には、主に「ビニング」と「頻出述語集合の発見」という2つの重要なステップが含まれます。以下、それぞれの手順について詳しく解説します。 1. ビニング(Binning) 量的属性は、その定義域を表す非常に広い範囲の値を持ちます。例えば、「年齢」と「収入」を軸として2次元グリッドを描くことを考えてみましょう。年齢の取り得るすべての値が一方の軸上の特定の位置に対応し、同様に収入のすべての値がもう一方の軸上の位置に対応すると、グリッドは膨大なサイズになってしまいます。 そこで、グリッドを管理可能なサイズに抑えるために、量的属性の範囲をいくつ

  14. 制約ベースのアソシエーションマイニングとは?仕組みと制約の種類を解説

    データマイニングでは、与えられたデータセットから数千件ものルールが抽出されることがあります。しかし、その大半はユーザーにとって無関係であるか、退屈なものでしかありません。どのような「方向性」でマイニングを行えば興味深いパターンに行き着くのか、また、どのような「形式」のパターンやルールを発見したいのか――これらを最もよく理解しているのは、実はユーザー自身です。制約ベースマイニングの基本的な考え方そこで有効なヒューリスティックとなるのが、ユーザーの直感や期待を「制約」として定義し、それによって探索空間を絞り込むというアプローチです。この戦略は制約ベースマイニングと呼ばれます。制約ベースのアルゴリズ

  15. メタルールとは?データマイニングでの活用方法と仕組みを徹底解説

    データマイニングとは何か データマイニングとは、リポジトリ(データ倉庫)に保存された膨大な量のデータを対象に、統計的手法や数学的手法といったパターン認識技術を用いて、有用な新しい相関関係・パターン・トレンドを発見するプロセスです。事実に基づくデータセットを分析することで、これまで気づかれていなかった関係性を明らかにし、レコードを論理的かつデータ保有者にとって有益な形で要約することを目指します。 データマイニングは、大量の情報を選択・探索・モデル化する一連の手続きであり、当初は未知であった規則性や関連性を発見して、データベースの所有者にとって明確で有益な結果を得ることを目的としています。 データ

  16. ルール制約を活用して検索空間を効率的に削減する方法

    相関ルールマイニングにおいて、ルール制約は膨大な検索空間を効率的に絞り込むための強力な手段となります。これらの制約は、その性質に応じていくつかのカテゴリに分類することができます。本記事では、代表的な分類について順に解説します。 1. 反単調制約(Antimonotonic Constraints) 最初のカテゴリは反単調制約です。例として、「sum(I.price) ≤ 100」というルール制約を考えてみましょう。Aprioriフレームワークでは、各反復kにおいてサイズkの項目集合を解析します。ある項目集合に含まれる商品の価格の合計がすでに100を超えている場合、この項目集合は検索空間から除

  17. データマイニングにおける分類の仕組みとは?二値分類・多クラス分類の基礎を解説

    分類(Classification)とは何か分類(クラス分類)とは、データセット内の要素を特定のクラスに割り当てることで、より効率的な予測や分析を支援するデータマイニング手法の一つです。分類は一般的に、ターゲットとなるクラスが2つだけ存在する場合に用いられ、これを「二値分類(バイナリ分類)」と呼びます。一方、2つ以上のクラスを予測する必要がある場合、特にパターン認識の問題においては「多クラス分類(マルチノミアル分類)」として定義されます。多クラス分類はカテゴリ型の応答データにも活用でき、複数の要素の中から、インスタンスが最も高い確率で属するカテゴリを予測したい場合に有効です。データ分類の2段階

  18. 決定木は分類にどのように使用されますか?仕組みと活用法を徹底解説

    決定木(デシジョンツリー)は、機械学習における最も直感的で広く使われている分類手法の一つです。本記事では、決定木の基本的な構造から、分類の具体的な流れ、メリット、そして代表的なアルゴリズムまで、体系的に解説します。 決定木の帰納とは何か 決定木の帰納(インダクション)とは、クラスラベルが付与された訓練データ(タプル)から決定木を学習するプロセスです。決定木はフローチャートに似た階層的な木構造をしており、以下の要素で構成されます。 内部ノード(非葉ノード):属性に対するテストを表します 枝:テストの結果(各分岐の条件)を示します 葉ノード(終端ノード):クラスラベルを表します 根ノード:木の最

  19. 属性選択尺度とは?決定木の分割基準をわかりやすく解説

    属性選択尺度の基本概念属性選択尺度(attribute selection measure)とは、クラスラベルが付与された訓練タプルからなるデータパーティションDを、単一のクラスへと「最も良く」分離する分割テストを選び出すためのヒューリスティック(発見的手法)です。分割基準の結果に従ってDをより小さなパーティションへ分割できる場合、理想的にはすべてのパーティションが純粋(pure)な状態になります。つまり、あるパーティションに属するタプルがすべて同一クラスに属することを意味します。概念的には、「最良」の分割基準とは、このような純粋なパーティションに最も近い結果をもたらすものを指します。属性選択

  20. ベイジアンビリーフネットワークはどのように学習するのか?仕組みと手法を徹底解説

    ベイジアン分類器とは ベイジアン分類器(ベイズ分類器)は統計的分類手法の一つです。与えられたサンプルが特定のクラスに属する確率といった、クラスへの所属確率を予測できます。また、大規模なデータベースを扱う際にも高い効率性と処理速度を発揮することで知られています。 分類ルールの推論と記述 クラスが定義されると、システムはその分類を支配するルールを推論しなければなりません。つまり、各クラスの記述(description)を見つけ出す必要があります。この記述は訓練セットの予測属性のみに基づくものであり、正例だけが記述を満たし、負例は満たさないようにすべきです。あるルールの記述があるクラスのすべての正

Total 1480 -コンピューター  FirstPage PreviousPage NextPage LastPage CurrentPage:38/74  20-コンピューター/Page Goto:1 32 33 34 35 36 37 38 39 40 41 42 43 44