プログラミング
 Computer >> コンピューター >  >> プログラミング >> プログラミング

分析的特性評価と属性関連性分析はなぜ必要か?その実行方法を解説

属性関連性分析とは

属性関連性分析とは、データの前処理において無関係な属性を除外したり、関連性の高い属性を順位付けしたりするための統計的手法です。この分析の尺度を用いることで、概念記述(クラス特徴付け)のプロセスから除外すべき無関係な属性を特定できます。そして、この前処理ステップをクラス特徴付けやクラス比較に組み込んだものが「分析的特性評価(アナリティカル・キャラクタリゼーション)」と定義されます。

データ判別(データ識別)との関係

データ判別とは、「対象クラス」と「対照クラス」と呼ばれる2つのクラス間でオブジェクトの一般的な特徴を比較し、判別ルールを作成するプロセスです。

具体的には、対象クラスのデータオブジェクトの一般的な特性を、1つまたは複数の対照クラスのオブジェクトの一般的な特性と比較します。対象クラスと対照クラスはユーザーが自由に定義できます。データ判別に用いられる手法はデータ特徴付けの手法と非常に類似していますが、決定的な違いとして、データ判別の結果には比較尺度が含まれる点が挙げられます。

属性関連性分析が必要な理由

属性関連性分析を行う主な理由は以下の通りです。

  • どの次元(ディメンション)を分析に含めるべきかを判断できる。
  • 高レベルの一般化を実現できる。
  • 属性数を削減でき、パターンを読み取りやすくなる。

属性関連性分析の背後にある基本概念は、与えられたクラスや概念に対する属性の関連度を定量化する尺度を評価することです。代表的な尺度としては、情報利得曖昧性(エントロピー)相関係数などが挙げられます。

概念記述のための属性関連性分析の実行手順

1. データ収集

クエリ処理によって、対象クラスと対照クラスの双方のデータを収集します。

2. 保守的なAOIによる予備的関連性分析

このステップでは、選択した関連性尺度を適用する対象となる次元と属性の集合を特定します。AOI(属性指向帰納法)を用いて、異なる値の数が極端に多い属性を除去することで、予備的な分析を行います。ここでは保守的な運用が求められ、属性一般化の閾値を十分に大きく設定することで、より多くの属性を選択した尺度による本番の関連性分析の対象として残せるようにします。

3. 属性の削除

選択された関連性分析の尺度を用いて、無関係または関連性の弱い属性を除去します。

4. AOIによる概念記述の生成

最後に、より緩い(保守的でない)属性一般化閾値を用いてAOIを実行します。記述的マイニング機能がクラス特徴付けである場合、元の対象クラスの作業リレーションのみが含まれます。一方、記述的マイニング機能がクラス比較である場合には、元の対象クラスと対照クラスの両方の作業リレーションが含まれます。

  1. Bash変数とは?基本の仕組みと実践的な使い方を徹底解説

    Bashでは、長い文字列をひとつの変数に割り当てることができます。これにより、コマンドの入力やスクリプト作成が格段にシンプルになります。本記事では、Bash変数の仕組みと、実際の活用方法について詳しく解説します。 変数とは何か? 変数とは、さまざまな英数字の値を格納できる「覚えやすい名前」のことです。変数を使う最大のメリットは、同じ関数や処理を異なる値に対して適用できる点にあります。スクリプトやコードを書き直す必要がなくなるため、作業効率が大きく向上します。また、個別の値を扱う代わりに共通の名前を使えるため、コードそのものも読みやすく、書きやすくなります。 リアルタイムで使える一時変数

  2. なぜメールをアーカイブすべき?その理由とMailStoreでの具体的な手順

    便利だったはずのテクノロジーが、いつの間にか脆い問題の種に変わってしまうのは驚くほど早いものです。メールを例に考えてみましょう。「メールアカウントさえ持っていれば、受信したメッセージを失うことはない」——そう思っていませんか?しかし現実には、保存メールが増えるほど目的のメッセージを探し出せなくなり、しかもすべてのメールがパソコン上の一箇所に格納されているため、データ消失のリスクにもさらされています。 もちろんパソコン自体をバックアップしていれば話は別です(まだの方は今すぐ設定しましょう)。ただ、バックアップを取ることと、メールソフトにメールを復元することは、まったくの別問題だという点に注意が