データ分類とは?データマイニングにおける仕組みと手順を解説
データ分類とは何か
分類(Classification)は、データインスタンスがどのクラス(グループ)に属するかを予測するために用いられるデータマイニング手法の一つです。このプロセスは大きく2つのステップで構成されます。最初のステップでは、あらかじめ定義されたデータクラスや概念の集合を表すモデルを構築します。モデルは、属性によって定義されたデータベースのタプル(レコード)をもとに作成されます。
各タプルは、事前に定義されたクラスのいずれかに属するとみなされます。この所属を決定する属性は「クラスラベル属性」と呼ばれます。分類の文脈では、データタプルは「サンプル」「事例」あるいは「オブジェクト」とも表現されます。また、モデル構築のために分析されるデータタプルの集合は「訓練データセット」を形成し、これを構成する個々のタプルは「訓練サンプル」と呼ばれます。訓練サンプルは、対象となる母集団からランダムに選出されます。
教師あり学習と教師なし学習の違い
各訓練サンプルのクラスラベルが既知であるため、この手順は「教師あり学習」とも呼ばれます。一方、教師なし学習では訓練サンプルのクラスラベルが未知であり、学習すべきクラスの数や種類自体が事前には判明していない点が大きな違いです。
学習済みモデルの表現形式
構築されたモデルは、分類ルール、決定木、あるいは数式といった形式で表現されます。たとえば、顧客の信用情報データベースを例にとると、顧客を「優良」または「普通」の信用評価へと振り分けるためのルールを学習できます。こうしたルールは、将来のデータサンプルを分類する際に活用できるだけでなく、データベースの内容への理解を深めることにも役立ちます。
ホールドアウト法によるモデル評価
ホールドアウト法は、クラスラベル付きのテストセットを用いるシンプルな評価手法です。テストサンプルはランダムに選択され、訓練サンプルとは互いに独立しています。特定のテストセットに対するモデルの精度は、モデルが正しく分類できたテストサンプルの割合として測定されます。各テストサンプルについて、既知のクラスラベルと学習済みモデルによる予測クラスを比較することで評価を行います。
仮にモデルの精度を訓練データセットのみに基づいて推定した場合、その見積もりは楽観的になりがちです。これは、学習されたモデルがデータに過剰適合(オーバーフィッティング)する傾向を持つためです。過剰適合が起きると、訓練データ特有の異常な特徴まで学習してしまい、母集団全体には通用しないモデルになる恐れがあります。この問題を回避するために、テストセットによる検証が重要となります。
分類プロセスの2つのフェーズ
学習フェーズ: 訓練データを分類アルゴリズムが分析します。ここでのクラスラベル属性は信用評価に相当し、学習されたモデル(分類器)は分類ルールの形式で記述されます。
分類フェーズ: テストデータを用いて分類ルールの精度を評価します。精度が許容できる水準に達していると判断されれば、そのルールは新しいデータタプルの分類に適用できます。
-
データセンターとは?仕組み・用途・セキュリティ対策をわかりやすく解説
データセンターとはデータセンターとは、大量のコンピュータサーバーや関連機器を収容するために設けられた専用施設のことです。英語では「data center」と表記するのが一般的ですが、「datacenter」と一語で書かれることもあります。イメージとしては、「壁からはみ出してしまったコンピュータ室」のようなものです。データセンターには、企業ユーザーのメール、財務記録、ウェブサイトのデータなど、あらゆる種類のデータを保存することができます。データセンターは何に使われるのか?一部のオンラインサービスは規模が非常に大きく、1〜2台のサーバーでは運用できません。そうしたサービスでは、サービスを動かすため
-
情報セキュリティにおける情報分類とは?基本概念と3つの分類基準を解説
情報分類(Information Classification)とは、データを目的や重要度に応じた適切なカテゴリへ整理・分類するプロセスのことです。例えば企業内では、財務関連の文書を広報部門の文書と混在させて保管すべきではありません。それぞれ独立したフォルダに保存し、アクセス権限を付与された担当者だけが閲覧できるよう制限します。このように管理することで、保存されたデータの安全性が高まり、必要なときに素早く見つけ出せるようになります。情報セキュリティ分類の重要性情報セキュリティ分類を実施するには、まず対象となる情報を正確に把握・認識することが不可欠です。そのためには、組織内の複数の事業部門によっ