プログラミング

 Computer >> コンピューター >  >> プログラミング >> プログラミング
  1. SOMアルゴリズムとは?自己組織化マップの仕組みと手順を徹底解説

    SOMアルゴリズムとはSOMは「Self-Organizing Feature Map(自己組織化特徴マップ)」の略称で、ニューラルネットワークの考え方に基づくクラスタリングおよびデータ可視化の手法です。ニューラルネットワークを基盤としているものの、プロトタイプベースのクラスタリングの変形として捉えれば、その仕組みは非常にシンプルに理解できます。SOMアルゴリズムの基本的な流れSOMアルゴリズムの手順は以下の通りです。重心(セントロイド)を初期化する。以下を繰り返す。次のオブジェクトを選択する。そのオブジェクトに最も近い重心を特定する。該当する重心と、所定の近傍範囲内にある他の重心を更新する。

  2. アソシエーションパターンの評価方法とは?客観的・主観的な興味深さの基準を解説

    アソシエーション分析のアルゴリズムは、膨大な数のパターンを生成する可能性があります。例えば、データセットに含まれる項目がわずか6個であっても、特定のサポート度と確信度のしきい値において、数千件ものアソシエーションルール(相関ルール)が作り出されることがあります。実際のビジネスデータベースは規模も次元も非常に大きくなりやすいため、抽出されるパターンは数千件、さらには数百万件に達することも珍しくありません。しかも、その中にはあまり価値のないパターンが多数含まれています。そのため、「どのパターンが本当に興味深いのか」を見極めることは決して簡単な作業ではありません。ある人にとって不要な情報が、別の人に

  3. 正規ラベル(カノニカルラベル)とは?グラフ同型性判定の基本を解説

    正規ラベル(カノニカルラベル)とはグラフの同型性問題を扱う標準的な手法の一つに、各グラフを「コード」あるいは「正規ラベル(カノニカルラベル)」と呼ばれる特定の文字列表現へ変換する方法があります。正規ラベルには、2つのグラフが同型である場合、それらのコードが必ず等しくなるという重要な性質があります。この性質により、グラフ同型性の判定は、各グラフの正規ラベルを分析・比較するだけで行えるようになります。グラフの正規ラベルを構築するための最初のステップは、そのグラフの隣接行列表現を求めることです。隣接行列には複数の表現が存在する隣接行列では頂点の並び順を複数の方法で決められるため、1つのグラフに対して

  4. ネガティブパターンをマイニングするためのテクニックとは?基本手法と計算上の課題

    ネガティブパターンマイニングの基本的な手法頻出しないパターン(ネガティブパターン)をマイニングするために最初に考案された手法では、各項目を対称的な二値変数として扱います。トランザクションデータに負の項目(ネガティブアイテム)を追加することで、データを二値化することが可能です。これは、元のデータを正と負の両方の項目を含むトランザクションへと変換する操作に相当します。こうして拡張されたトランザクションに対して、Aprioriなどの既存の頻出項目集合生成アルゴリズムを適用すれば、一部の負の項目集合(ネガティブアイテムセット)を導き出すことができます。この手法が有効に機能する条件ただし、このアプローチ

  5. 期待サポート値を決定する2つの手法:コンセプト階層と間接的関連付け

    データマイニングにおいてパターンの期待サポート値を決定するには、主に2つのアプローチがあります。1つはコンセプト階層(概念階層)を利用する方法、もう1つは「間接的関連付け(indirect association)」と呼ばれる近傍ベースのアプローチです。コンセプト階層に基づくサポート期待値客観的な指標だけでは、興味のない非頻出パターンを除去するのに十分とは言えません。例えば、「パン」と「ノートパソコン」がどちらも頻出アイテムである場合を考えてみましょう。アイテムセット {パン, ノートパソコン} は非頻出であり、負の相関を持つ可能性がありますが、そのサポートが低いことはドメイン専門家にとって自

  6. データマイニングにおけるクラスタリングの具体例を徹底解説

    クラスタリングとは何か物理的または抽象的なオブジェクトの集合を、同種のオブジェクトからなるクラスへとまとめるプロセスは「クラスタリング」と呼ばれます。クラスターとは、同じクラスター内では互いに類似しており、他のクラスターのオブジェクトとは性質が異なるデータオブジェクトの集合のことです。多くのアプリケーションにおいて、データオブジェクトのクラスターは一つのグループとしてまとめて扱われます。クラスタ分析は、人間が古くから行ってきた本質的な活動の一つでもあります。クラスタ分析の活用分野クラスタ分析は、レコードに対して得られたさまざまな測定値に基づいて、類似したレコードのグループ(クラスター)を形成す

  7. クラスター分析とは?基本概念からビジネス活用例まで徹底解説

    クラスター分析の基本概念クラスター分析(クラスタリング)は、人間が古くから行ってきた本質的な知的活動の一つです。さまざまな測定指標に基づいて、性質の似たレコード(データ)同士をグループ化し、「クラスタ」と呼ばれるまとまりを作り出します。その核心となる考え方は、分析の目的に役立つ形でクラスタを定義することにあります。この手法は、天文学、考古学、医学、化学、教育学、心理学、言語学、社会学など、実に幅広い分野で活用されてきました。統計学におけるクラスター分析の位置づけクラスター分析は統計学の一分野として、長年にわたり盛んに研究されてきました。この手法の最大の利点は、概念階層のような事前知識を必要とせ

  8. データマイニングにおけるクラスタリングの種類とは?主要な分類を徹底解説

    クラスタリングには、いくつかの観点から分類できる多様な手法が存在します。本記事では、データマイニングでよく知られている代表的なクラスタリングの分類について、それぞれの特徴をわかりやすく解説します。 階層型クラスタリングと分割型クラスタリング クラスタリングの種類を区別する最も基本的な視点は、クラスタの集合が「入れ子構造(ネスト)」になっているかどうか、すなわち階層的(Hierarchical)であるか非階層的・分割型(Partitional)であるかという点です。 分割型クラスタリングとは、データオブジェクトの集合を互いに重複しない部分集合(クラスタ)へ分割する手法です。すべてのデータオブジ

  9. データマイニングにおけるクラスタリングの種類とは?代表的な5つの手法を解説

    クラスタ分析(クラスター分析)は、レコードに対して行われたさまざまな測定値に基づいて、性質の似たレコード同士をグループ(クラスタ)にまとめるために用いられる手法です。分析の目的に応じて、有益な形でクラスタを定義できる点が大きな特徴です。この技術は、天文学、考古学、医学、化学、教育学、心理学、言語学、社会学など、幅広い分野で活用されています。クラスタリングの主な種類データマイニングで用いられるクラスタには、以下のような代表的な種類があります。1. 明確に分離されたクラスタ(Well-Separated)これは「クラスタ内のすべての要素が、クラスタ外のどのオブジェクトよりも、クラスタ内の他の要素に

  10. K-meansクラスタリングとは?基本概念からアルゴリズムの仕組みまで徹底解説

    K-meansクラスタリングの概要K-meansクラスタリングは、最も広く使われている分割型(パーティショニング)クラスタリングアルゴリズムです。K-meansでは、データセット内の各データを、新しく形成されるクラスタのいずれか1つに割り当てます。個々のレコード(データポイント)は、距離や類似度の尺度を用いて、最も近いクラスタに割り当てられる仕組みです。k-meansアルゴリズムは、入力パラメータとしてクラスタ数 k を受け取り、n個のオブジェクトからなる集合をk個のクラスタに分割します。その結果、クラスタ内の類似度(intracluster similarity)は高く、クラスタ間の類似度(

  11. K-Meansアルゴリズムの3大課題とは?空クラスタ・外れ値・SSE削減の解決策

    K-Meansアルゴリズムは広く利用されているクラスタリング手法ですが、実運用においてはいくつかの重要な課題が存在します。本記事では、「空のクラスタの発生」「外れ値の影響」「後処理によるSSE(二乗誤差和)の削減」という3つの主要な問題と、それぞれの具体的な対策について詳しく解説します。 1. 空のクラスタ(Empty Clusters)への対処 基本的なK-Meansアルゴリズムにおける最初の問題は、割り当てフェーズでどのデータ点も割り当てられなかった場合に「空のクラスタ」が発生しうることです。この状態が起こると、二乗誤差(SSE)が必要以上に大きくなってしまうため、代替となるセントロイド

  12. アンサンブル分類器の構築方法とは?4つの主要手法をわかりやすく解説

    アンサンブル分類器(Ensemble Classifier)の基本的な考え方は、元のデータから複数の分類器を構築し、未知の事例を予測する際にそれらの予測結果を集約するというものです。アンサンブル分類器は、いくつかの異なるアプローチによって構築することができます。 アンサンブル分類器を構築する4つの手法 1. 訓練セットを操作する方法 この手法では、元のデータを何らかのサンプリング分布に従って再サンプリングすることで、複数の訓練セットを生成します。サンプリング分布は、どのインスタンスが訓練データとして選ばれやすいかを決定するものであり、試行ごとに変化させることが可能です。生成された各訓練セッ

  13. ランダムフォレストとは?基本概念と仕組みをわかりやすく解説

    ランダムフォレストの概要ランダムフォレスト(Random Forest)は、決定木分類器のために特別に設計されたアンサンブル学習手法の一つです。複数の決定木による予測結果を統合することで最終的な予測を行います。各決定木は、それぞれ独立したランダムベクトルの値に基づいて構築される点が大きな特徴です。ランダムフォレストで使用されるランダムベクトルは、固定された確率分布から生成されます。これは、分類が難しいインスタンスに的を絞って確率分布を適応的に変化させるAdaBoostのような手法とは対照的です。バギングとランダムフォレストの関係決定木を用いたバギング(Bagging)は、ランダムフォレストの特

  14. ROC曲線とは何か?分類モデルの評価に欠かせない指標の基礎を解説

    ROC曲線の概要ROC(Receiver Operating Characteristic:受信者動作特性)曲線とは、分類器における真陽性率(TPR)と偽陽性率(FPR)のトレードオフを視覚的に表現するグラフ手法です。ROC曲線では、縦軸に真陽性率(TPR)、横軸に偽陽性率(FPR)をプロットします。曲線上の各点は、分類器によって生成された各モデルに対応しています。ROC曲線上の重要なポイントROC曲線には、よく知られた解釈を持ついくつかの重要な点が存在します。(TPR: 0, FPR: 0) — すべてのインスタンスを負クラスと予測するモデル(TPR: 1, FPR: 1) — すべてのイン

  15. サンプリングベースのアプローチとは?クラス不均衡問題への対処法を解説

    サンプリングによるクラス不均衡問題への対処サンプリングは、機械学習におけるクラス不均衡問題に対処するために広く活用されている手法です。その基本的な考え方は、データ例の分布を意図的に変化させ、訓練データセットの中で少数派クラス(レアクラス)を明確に定義できるようにすることにあります。サンプリングには、アンダーサンプリング、オーバーサンプリング、そして両方を組み合わせたハイブリッド方式など、さまざまな手法が存在します。ここでは、100件の陽性例と1,000件の陰性例を含むデータセットを例に、各手法を見ていきましょう。アンダーサンプリング(多数派クラスの削減)アンダーサンプリングでは、すべての陽性例

  16. データマイニングにおけるサポート度と信頼度の重要性とは?

    ```html サポート度が重要視される理由 データマイニングにおいて、サポート度(Support)は非常に重要な評価指標です。その理由は、サポート度が極めて低いルールは、単なる偶然で発生している可能性が高いためです。さらにビジネスの観点から見ても、ユーザーがほとんど一緒に購入しない商品の組み合わせを対象にしても利益につながらないため、低サポート度のルールは実用的な価値が乏しいと言えます。 アソシエーションルールの基本概念 アソシエーションルール(相関ルール)とは、「X→Y」という形式で表される含意の記述であり、ここでXとYは互いに素な項目集合(X∩Y=∅)を指します。アソシエーションルール

  17. サポートカウントとは?Aprioriアルゴリズムにおける支持度計数の仕組みを徹底解説

    サポートカウント(support counting、支持度の計数)とは、Aprioriアルゴリズムにおける重要な処理の一つです。具体的には、apriori-gen関数による候補枝刈り(candidate pruning)ステップを通過した各候補アイテムセットが、データセット全体でどれほどの頻度で出現するのかを判定する手順を指します。 サポートカウントの2つの基本手法 手法1:トランザクションとの総当たり比較 一つ目の方法は、すべてのトランザクションとすべての候補アイテムセットを照合し、トランザクションに含まれている候補のサポートカウントを順次更新していくというものです。 しかしこの方法は計

  18. Aprioriアルゴリズムの計算量とは?影響する要因と計算コストを徹底解説

    Aprioriアルゴリズムは、大量のトランザクションデータから頻出項目集合を抽出する代表的な手法ですが、その計算複雑性(計算量)は複数の要因によって大きく変動します。本記事では、実行時間に影響を与える主な要因と、各処理ステップにおける計算コストをわかりやすく解説します。 計算量に影響を与える4つの主要因 1. 支持度閾値(Support Threshold) 支持度閾値を低く設定すると、「頻出」と判定される項目集合の数が増加します。その結果、生成・カウントすべき候補項目集合が膨大になり、計算負荷が大幅に上昇します。 さらに、閾値が低いほど頻出項目集合の最大サイズも大きくなる傾向があります。

  19. 最大頻度アイテムセットとは?定義・具体例・メリットと課題を解説

    最大頻度アイテムセットの定義 最大頻度アイテムセット(Maximal Frequent Itemset)とは、その直接の上位集合(スーパーセット)のどれひとつとしても頻度アイテムセットではない頻度アイテムセットのことを指します。 格子構造(ラティス)上のアイテムセットは、「頻度アイテムセット」と「非頻度アイテムセット」の2つのグループに分けられます。この2つのグループを隔てる境界は「頻度アイテムセット境界」と呼ばれ、通常は破線で表現されます。 格子図における境界の考え方 境界よりも上側に位置するアイテムセットはすべて頻度アイテムセットであり、境界より下側に位置するアイテムセット(網掛けされた

  20. 頻出アイテムセットの生成方法とは?Aprioriアルゴリズムの課題と改善手法

    Aprioriアルゴリズムは、頻出アイテムセット生成における組み合わせ爆発の問題に対して効果的に対処してきた代表的な手法です。Apriori原理を活用することで、指数関数的に膨らむ探索空間を大幅に縮小することに成功しました。しかしその一方で、トランザクションデータベースに対して複数回の走査(パス)を行う必要があるため、大きなI/Oオーバーヘッドが発生するという課題を抱えています。また、トランザクションの幅(1件に含まれるアイテム数)が大きい密度の高いデータセットでは、Aprioriアルゴリズムの性能が著しく低下することが知られています。こうした弱点を克服し、アルゴリズムの効率を高めるために、こ

Total 1480 -コンピューター  FirstPage PreviousPage NextPage LastPage CurrentPage:45/74  20-コンピューター/Page Goto:1 39 40 41 42 43 44 45 46 47 48 49 50 51