主成分分析(PCA)とは?機械学習における次元削減の基本と手順を解説
主成分分析(PCA)の概要
主成分分析(PCA:Principal Component Analysis)は、機械学習において次元削減に用いられる教師なし学習アルゴリズムの一つです。相関のある特徴量の観測値を、直交データを用いて線形に無相関な特徴量の集合へと変換する統計的手法であり、変換後の新しい特徴量は「主成分」と呼ばれます。
PCAは、探索的データ分析や予測モデリングで広く活用されている代表的なツールです。分散を抑えながら、与えられたデータセットから強固な構造を抽出するアプローチといえます。
PCAの仕組みと応用分野
PCAは各属性の分散に着目して動作します。分散が大きい属性ほどクラス間の分離を示すため、これを利用して次元を削減します。
実世界での応用例としては、以下のようなものが挙げられます。
- 画像処理
- 映画のおすすめ(レコメンド)システム
- さまざまな通信チャネルにおける電力割り当ての最適化
また、PCAは特徴抽出手法でもあるため、重要な変数を残しつつ、重要性の低い変数を除外することができます。
Karhunen-Loeve(K-L)法との関係
主成分分析は「カルフーネン・レーヴェ(Karhunen-Loeve)法」、略して「K-L法」とも呼ばれます。データを最もよく表現できる k 個の n 次元直交ベクトル(k ≤ n) を見つけ出すことができ、元のデータをはるかに小さな空間へ射影することで次元削減を実現します。
より小さな代替変数の集合を作ることで属性の本質を捉え、元のデータをその小さな集合へと射影します。
PCAの主な手順
1. 入力データの正規化
入力データを正規化し、各属性が同程度の範囲に収まるようにします。このステップにより、値域の広い属性が値域の狭い属性を支配してしまうことを防ぎます。
2. 主成分の算出
正規化された入力データに対して、基底となる k 個の正規直交ベクトルを求めます。これらは互いに垂直な方向を向く単位ベクトルであり、「主成分」と定義されます。入力データは主成分の線形結合として表現されます。
3. 重要度による並べ替え
主成分は「重要度」(強さ)の降順に並べられます。主成分は本質的にデータのための新しい軸の集合として機能し、分散に関する重要な情報を提供します。つまり、最初の軸がデータ間で最も大きな分散を示し、2番目の軸が次に大きな分散を示す、という順序になります。
4. 弱い成分の除去
成分が重要度の降順に並べられているため、分散の小さい弱い成分を取り除くことでデータサイズを削減できます。最も強い主成分を使えば、元のデータを良好な精度で近似・再構成することが可能です。
-
OLAPとは?多次元データ分析の基礎と仕組みをわかりやすく解説
OLAP(On-Line Analytical Processing:オンライン分析処理)は、アナリスト、マネージャー、経営幹部といったビジネスの意思決定に関わる人々が、生データを企業の実際の次元性を反映した情報へと変換し、高速かつ一貫性のあるインタラクティブなアクセスを通じて、多様な視点からデータの洞察を得られるようにするソフトウェア技術の一要素です。 OLAPでできること OLAPを利用すると、ユーザーはオンライン上で記述的なサマリーや比較サマリーを作成したり、さまざまな分析クエリを実行したりできます。つまりOLAPとは、分析を目的として多次元データの収集・保存・操作・再現を可能にするソフ
-
ドキュメントクラスタリング分析とは?基本概念と主要手法を徹底解説
ドキュメントクラスタリング(文書クラスタリング)とは、教師なし学習の枠組みで大量の文書ファイルを自動的に整理・分類する重要な技術です。文書を単語の出現頻度などからなるタームベクトル(項目ベクトル)として表現すれば、さまざまなクラスタリング手法を適用できます。ただし、文書空間は数百から数千にも及ぶ非常に高い次元数を持つのが特徴です。このような高次元データでは「次元の呪い」と呼ばれる問題が生じるため、まず文書を低次元の部分空間へ射影し、文書空間の意味構造を明確にしてからクラスタリングを行うのが効果的です。低次元化された意味空間上では、従来型のクラスタリングアルゴリズムをそのまま活用できます。ドキュ