Python
 Computer >> コンピューター >  >> プログラミング >> Python

TensorFlowでAuto MPGデータセットを使ってモデルをデータに適合させる方法

TensorFlowはGoogleが提供する機械学習フレームワークです。オープンソースとして公開されており、Pythonと組み合わせてアルゴリズムやディープラーニングアプリケーションなどを実装できます。研究用途から本番環境まで幅広く活用されています。

Windowsに「tensorflow」パッケージをインストールするには、以下のコマンドを実行します。

pip install tensorflow

テンソル(Tensor)はTensorFlowにおける基本的なデータ構造です。フロー図の中で各ノードをつなぐ役割を担っており、このフロー図は「データフローグラフ」と呼ばれます。テンソルとは、要するに多次元配列あるいはリストのことです。

回帰問題の目的は、価格や確率、雨が降るかどうかなど、連続値または離散値の出力を予測することにあります。

ここで使用するデータセットは「Auto MPG」です。1970年代〜1980年代の自動車の燃費データを含んでおり、重量、馬力、排気量などの属性が収録されています。これらの情報をもとに、特定の車両の燃費効率を予測します。

以下のコードはGoogle Colaboratory上で実行しています。Google Colab(Colaboratory)はブラウザ上でPythonコードを実行できるサービスで、事前の設定が一切不要で、GPU(グラフィックス処理装置)にも無料でアクセスできます。ColaboratoryはJupyter Notebookをベースに構築されています。以下がコードスニペットです。

コード例

print("The training data is being fit to the model ")
history = hrspwr_model.fit(
train_features['Horsepower'], train_labels,
epochs=150,
verbose=0,
validation_split = 0.3)

hist = pd.DataFrame(history.history)
hist['epoch'] = history.epoch
hist.tail()

コード出典: https://www.tensorflow.org/tutorials/keras/regression

出力結果

TensorFlowでAuto MPGデータセットを使ってモデルをデータに適合させる方法

解説

  • 「fit」関数を使用して、訓練データをモデルに適合させます。

  • 「epochs」属性で学習の繰り返し回数(エポック数)を指定します。ここでは150エポックに設定しています。

  • 「verbose=0」を指定すると、学習中の進捗ログが非表示になります。

  • 「validation_split = 0.3」とすると、訓練データの30%が検証用データとして確保され、過学習のチェックに役立ちます。

  • 「history」オブジェクトには、入力データに関連する統計情報(損失や精度など)の推移が記録されます。

  • 記録された履歴はPandasのデータフレームに変換されます。

  • 「tail()」により、データの末尾部分がコンソールに表示されます。

  • さらに、学習の経過は可視化され、損失の変化などを確認できます。

  1. TensorFlowとAuto MPGデータセットでデータを分割・検査し、自動車の燃費を予測する方法

    TensorFlowとは TensorFlowは、Googleが提供する機械学習フレームワークです。オープンソースとして公開されており、Pythonと組み合わせてアルゴリズムやディープラーニングアプリケーションなどを実装するために広く使われています。研究用途から本番環境まで幅広く活用されており、複雑な数学的演算を高速に実行するための最適化技術を備えているのが特徴です。これは内部でNumPyと多次元配列を利用しているためで、この多次元配列は「テンソル(tensor)」と呼ばれます。 TensorFlowは深層ニューラルネットワークの構築をサポートしており、高いスケーラビリティを持つほか、多くの

  2. Pythonの回帰モデルに非線形データを適合させる方法をわかりやすく解説

    データの可視化には、Seabornライブラリを使用します。回帰モデルを構築する際には、必ず多重共線性(マルチコリニアリティ)の有無をチェックしましょう。これは、連続変数のあらゆる組み合わせ間に存在する相関関係を把握しておく必要があるためです。もし変数間に多重共線性が確認された場合は、データから除去する対策が求められます。 現実世界のデータは非線形であることが多い 実際のビジネスや研究の現場で扱うデータは、多くの場合非線形です。したがって、こうした非線形データをモデルへ適切に適合させる仕組みを見つけることが重要になります。本記事では、統計学で有名なAnscombe(アンスコム)のデータセットを用