Python
 Computer >> コンピューター >  >> プログラミング >> Python

Pythonによるデータ分析と可視化入門!pandas・matplotlibの使い方を解説


このチュートリアルでは、Pythonのpandasmatplotlibなどのモジュールを使ったデータ分析と可視化の方法を学びます。Pythonはデータ分析に非常によく適した言語です。まずは以下のコマンドでpandasとmatplotlibをインストールしましょう。

pip install pandas
pip install matplotlib

インストールが完了すると成功メッセージが表示されます。まずpandasについて学び、その後でmatplotlibを見ていきましょう。

pandasとは

pandasはPythonのオープンソースライブラリで、データ分析のための豊富なツールを提供しています。ここでは、データ分析に役立つpandasの主要な機能をいくつか紹介します。

DataFrame(データフレーム)の作成

DataFrameを作成するには、複数の行データが必要です。具体的な作成方法を見てみましょう。

サンプルコード

# pandasパッケージをインポート
import pandas as pd
# 行データを作成
hafeez = ['Hafeez', 19]
aslan = ['Aslan', 21]
kareem = ['Kareem', 18]
# リストをDataFrameに渡す
# 列名もあわせて指定する
data_frame = pd.DataFrame([hafeez, aslan, kareem], columns = ['Name', 'Age'])
# DataFrameを表示
print(data_frame)

実行結果

上記のプログラムを実行すると、以下のような出力が得られます。

Name Age
0 Hafeez 19
1 Aslan 21
2 Kareem 18

pandasを使ったCSVデータの読み込み

対象のリンクからCSVファイルをダウンロードしてください。CSVファイル内のデータは、カンマ(,)で区切られた行形式で保存されています。pandasを使ってデータを読み込み、活用する方法を見ていきましょう。

サンプルコード

# pandasパッケージをインポート
import pandas as pd
# pd.read_csv()メソッドでデータを読み込む
data = pd.read_csv('CountryData.IND.csv')
# head()メソッドで先頭の5行を表示
print(data.head())

実行結果

上記のプログラムを実行すると、以下のような出力が得られます。

Pythonによるデータ分析と可視化入門!pandas・matplotlibの使い方を解説

続いて、shape属性を使ってデータの行数と列数を確認してみましょう。

サンプルコード

# pandasパッケージをインポート
import pandas as pd
# pd.read_csv()メソッドでデータを読み込む
data = pd.read_csv('CountryData.IND.csv')
# 行数と列数を表示
print(data.shape)

実行結果

上記のプログラムを実行すると、以下の出力が得られます。

(29, 16)

この例では、29行×16列のデータであることがわかります。さらに、describe()メソッドを使うと、NaN(欠損値)を除外したうえで、平均・標準偏差・最小値・最大値などのさまざまな統計量を一度に計算できます。実際に試してみましょう。

サンプルコード

# pandasパッケージをインポート
import pandas as pd
# pd.read_csv()メソッドでデータを読み込む
data = pd.read_csv('CountryData.IND.csv')
# 各種統計量を表示
print(data.describe())

実行結果

上記のプログラムを実行すると、以下のような統計情報が出力されます。

Pythonによるデータ分析と可視化入門!pandas・matplotlibの使い方を解説

データのグラフ描画

データからグラフを作成するには、matplotlibパッケージを使用します。matplotlibを使って、さまざまな種類のグラフを作成する方法を見ていきましょう。

サンプルコード

# グラフ作成用にpyplotモジュールをインポート
import matplotlib.pyplot as plot
# pd.read_csv()メソッドでデータを読み込む
data = pd.read_csv('CountryData.IND.csv')
# 「Time period」列のヒストグラムを作成
data['Time period'].hist(bins = 10)

実行結果

上記のプログラムを実行すると、ヒストグラムオブジェクトの情報が表示され、グラフが生成されます。

<matplotlib.axes._subplots.AxesSubplot at 0x25e363ea8d0>

Pythonによるデータ分析と可視化入門!pandas・matplotlibの使い方を解説

このように、matplotlibパッケージを使えば、ヒストグラムだけでなく折れ線グラフ・棒グラフ・散布図など、さまざまな種類のグラフを簡単に作成できます。

まとめ

本チュートリアルでは、Pythonのpandasとmatplotlibを使ったデータ分析と可視化の基本を学びました。DataFrameの作成方法、CSVファイルからのデータ読み込み、shapeやdescribe()による統計情報の取得、そしてヒストグラムの描画まで、一連の流れを理解できたかと思います。チュートリアルに関してご不明な点がありましたら、コメント欄でお気軽にお知らせください。

  1. Pythonによるデータ分析と可視化入門|pandasの基本を徹底解説

    Pythonによるデータ分析と可視化の概要 Pythonには、データ分析と可視化のための強力なライブラリが数多く用意されています。代表的なものとしては、NumPy、pandas、matplotlib、seabornなどが挙げられます。本記事では、その中でも中心的な役割を果たすpandasについて詳しく解説します。pandasはNumPyをベースに構築されたオープンソースライブラリで、高速なデータ分析やデータのクリーニング・前処理を効率的に行えます。さらに、pandas自体にも便利な可視化機能が組み込まれています。 pandasのインストール方法 pandasをインストールするには、ターミナル

  2. Pythonで学ぶ探索的データ分析(EDA)の基本と実践

    データ分析において、探索的データ分析(Exploratory Data Analysis:EDA)は必ず最初に行うべきステップです。EDAを実施することで、以下のようなことが可能になります。データセットへの深い洞察を得るデータの背後にある構造を理解する重要なパラメータや、それらの間の関係性を抽出する前提となる仮説を検証するサンプルデータセットを使ったEDAの理解PythonでEDAを理解するために、サンプルデータはWebサイトから直接取得するか、ローカルディスクから読み込むことができます。ここでは、公開されているUCI Machine Learning Repositoryから「赤ワインの品質