回帰と分類の違いとは?機械学習における2大手法を徹底解説
回帰(Regression)とは
回帰は、連続的な数値を持つ属性(目的変数)を予測するために用いられる教師あり機械学習手法の一種です。企業が目的変数と説明変数(予測変数)の関係性を分析する際に役立ち、売上予測や時系列モデリングなど、データ探索に欠かせないツールとして広く活用されています。
回帰では、データを関数に当てはめることで平滑化を行います。中でも基本的なのが線形回帰であり、2つの属性(変数)に対して最もよく当てはまる「最適な」直線を見つけ出し、一方の属性の値からもう一方の属性を予測します。さらに、3つ以上の属性を扱い、データを多次元空間に当てはめる重回帰分析へと拡張することも可能です。
線形回帰では、データが直線上に分布するようにモデル化されます。例えば、ある確率変数y(応答変数/目的変数)を、別の確率変数x(説明変数)の線形関数として表す場合、y = wx + b という式が用いられます。このとき、yの分散は一定であると仮定されます。
回帰問題は、入力値に基づいて出力値を計算することを扱います。分類にも応用できますが、それ以外にも需要予測など幅広い用途に利用されています。最もシンプルな構造を持つのが単回帰分析で、1つの説明変数と1つの目的変数のみを対象とします。
分類(Classification)とは
分類とは、データのクラスや概念を表現・識別するモデルを構築し、そのモデルを用いてクラスラベルが未知のオブジェクトのクラスを予測できるようにするプロセスです。構築されたモデルは、クラスラベルが既知のデータオブジェクト(訓練レコード)の集合を分析した結果に基づいて導き出されます。
各タプル(レコード)は、「クラスラベル属性」と呼ばれる属性によって決まる、あらかじめ定義されたクラスに属するものとして扱われます。分類の文脈では、データタプルはサンプル・事例・オブジェクトなどと呼ばれます。モデル構築のために分析されるデータタプル全体は訓練データセットを形成し、その個々のタプルは訓練サンプルと呼ばれ、母集団の中から選択されます。
すべての訓練サンプルに対してクラスラベルが与えられていることから、このプロセスは教師あり学習とも呼ばれます。一方、教師なし学習の場合、訓練サンプルのクラスラベルは未知であり、学習対象となるクラスを事前に特定することはできません。
回帰と分類の主な違い
回帰と分類は、どちらも教師あり学習に属する手法ですが、予測する出力の型が大きく異なります。以下の表に主な違いをまとめました。
| 回帰 | 分類 | |
|---|---|---|
| 出力値 | 連続値(例:価格、気温、売上) | 離散的なカテゴリ(例:はい/いいえ、スパム/非スパム) |
| 代表的手法 | 線形回帰、重回帰分析など | 決定木、ロジスティック回帰、SVMなど |
| 主な評価指標 | MSE、RMSE、MAEなど | 正解率、適合率、再現率など |
| 活用例 | 売上予測、株価予測 | 迷惑メール判定、画像認識 |
このように、数値そのものを予測したい場合は回帰を、データがどのカテゴリに属するかを判定したい場合は分類を選択するのが基本です。目的に応じて適切な手法を使い分けることが、機械学習プロジェクト成功の鍵となります。
-
DirectX11とDirectX12の違いを徹底解説!ゲーマーが知っておくべきポイント
DirectXは、ソフトウェアがマルチメディアコンテンツを描画し、グラフィックハードウェアと通信するために使用されるAPI(アプリケーションプログラミングインターフェース)のコレクションです。DirectXの主要な構成要素であるDirect3Dは、ソフトウェアとグラフィックスハードウェア間の通信を担っています。ハードウェアは製品ごとに異なるため、標準化された関数や呼び出しのライブラリを通じてグラフィックカードと通信することで、ゲーム開発を大幅にスピードアップできます。これは「ハードウェア抽象化」と呼ばれ、APIの最も重要な役割となっています。車に例えてみましょう。1台の車の運転ができれば、ほぼ
-
分類とクラスタリングの違いを徹底解説!教師あり・教師なし学習の基礎知識
本記事では、機械学習における「分類」と「クラスタリング」の違いについて、初心者の方にもわかりやすく解説します。どちらもデータをグループに分けるための手法ですが、その目的や仕組みには大きな違いがあります。 分類とは? 教師あり学習で用いられる手法です。 入力されたデータ(インスタンス)を、あらかじめ定義されたクラスラベルに基づいて振り分けます。 正解となるラベルが存在するため、モデルの精度を検証する際には、データセットを訓練用とテスト用に分割して評価する必要があります。 クラスタリングと比較すると、処理はより複雑になります。 代表的なアルゴリズム:ロジスティック回帰、ナイーブベイズ分類器、サポ