Python
 Computer >> コンピューター >  >> プログラミング >> Python

Python・Pandasで列ごとに階層化した箱ひげ図を作成する方法

PythonとPandas、Matplotlibを組み合わせることで、データを列の値ごとに階層化(グループ化)した箱ひげ図(ボックスプロット)を簡単に作成できます。この記事では、その具体的な手順をコード例とともに解説します。

作成手順

  • 図のサイズを設定し、サブプロット間および周囲のパディングを調整します。

  • 2次元でサイズ変更可能、かつ異なる型のデータも格納できる表形式データから、Pandasデータフレームを作成します。

  • データセットのヒストグラムを計算します。

  • 列ごとに階層化された箱ひげ図を作成します。

  • 図を表示するには、show()メソッドを使用します。

コード例

import pandas as pd
import numpy as np
from matplotlib import pyplot as plt

# 図のサイズを設定
plt.rcParams["figure.figsize"] = [7.50, 3.50]
plt.rcParams["figure.autolayout"] = True

# Pandasデータフレームを作成
df = pd.DataFrame({"column1": [4, 6, 7, 1, 8], "column2": [1, 5, 7, 8, 1]})

# ヒストグラムを計算
_, breaks = np.histogram(df.column1, bins=5)

# 箱ひげ図を作成
ax = df.boxplot(column='column1', by='column2')

# グラフを表示
plt.show()

出力結果

上記のコードを実行すると、column2の値ごとにグループ化されたcolumn1の箱ひげ図が表示され、各グループにおけるデータの分布や外れ値をひと目で確認できます。

Python・Pandasで列ごとに階層化した箱ひげ図を作成する方法


  1. Python・PandasでDataFrameの列の分散を計算する方法

    データ分析において、分散はデータのばらつき具合を把握するための重要な統計量です。Pandasでは、var()メソッドを使うことで、DataFrameの列(カラム)の分散を簡単に計算できます。この記事では、実際のコード例を通じて、var()メソッドの基本的な使い方から、複数のDataFrameへの応用までを解説します。1. Pandasライブラリのインポートまず、必要なPandasライブラリをインポートします。import pandas as pd2. DataFrameの作成次に、「Car(車種)」と「Units(台数)」の2つの列を持つDataFrameを作成します。dataFrame1 =

  2. Python Pandas – 列名を指定してDataFrameのサブセットを作成する方法

    PythonのPandasで、列名を指定してDataFrameのサブセット(部分データ)を作成するには、角括弧「[ ]」=インデックス演算子を使用します。DataFrameに対して角括弧の中に目的の列名を記述するだけで、その列を簡単に抽出できます。 dataFrame[column_name] ライブラリのインポート まず、必要なライブラリをエイリアス付きでインポートしましょう。 import pandas as pd DataFrameの作成 続いて、商品在庫レコードを含むPandas DataFrameを作成します。 dataFrame = pd.DataFrame({ Produ