Python・PandasでDataFrameを年ごとにグループ化する方法
PandasのDataFrameをグループ化するには、groupby()メソッドを使用します。グループ化の基準となる列は、Grouper関数を使って指定します。本記事では、車販売記録のデータを例に、年間隔でデータをグループ化し、「登録価格(Reg_Price)」の合計を計算する方法を解説します。
サンプルDataFrameの作成
まず、次のような3つの列を持つPandas DataFrameを用意します。「Date_of_Purchase(購入日)」列が含まれている点がポイントです。
# Date_of_Purchase列を含むDataFrame
dataFrame = pd.DataFrame(
{
"Car": ["Audi", "Lexus", "Tesla", "Mercedes", "BMW", "Toyota", "Nissan", "Bentley", "Mustang"],
"Date_of_Purchase": [pd.Timestamp("2021-06-10"),
pd.Timestamp("2019-07-11"),
pd.Timestamp("2016-06-25"),
pd.Timestamp("2021-06-29"),
pd.Timestamp("2020-03-20"),
pd.Timestamp("2019-01-22"),
pd.Timestamp("2011-01-06"),
pd.Timestamp("2013-01-04"),
pd.Timestamp("2014-05-09")
],
"Reg_Price": [1000, 1400, 1100, 900, 1700, 1800, 1300, 1150, 1350]
}
)
Grouperを使って年単位でグループ化する
次に、groupby()関数の中でGrouperを使用して「Date_of_Purchase」列を選択します。頻度(freq)は「3Y」、つまり3年間隔でグループ化するように設定しています。
コード例
以下が完全なコードです。
import pandas as pd
# Date_of_Purchase列を含むDataFrame
dataFrame = pd.DataFrame(
{
"Car": ["Audi", "Lexus", "Tesla", "Mercedes", "BMW", "Toyota", "Nissan", "Bentley", "Mustang"],
"Date_of_Purchase": [pd.Timestamp("2021-06-10"),
pd.Timestamp("2019-07-11"),
pd.Timestamp("2016-06-25"),
pd.Timestamp("2021-06-29"),
pd.Timestamp("2020-03-20"),
pd.Timestamp("2019-01-22"),
pd.Timestamp("2011-01-06"),
pd.Timestamp("2013-01-04"),
pd.Timestamp("2014-05-09")
],
"Reg_Price": [1000, 1400, 1100, 900, 1700, 1800, 1300, 1150, 1350]
}
)
print("DataFrame...\n", dataFrame)
# Grouperでgroupby()内のDate_of_Purchase列を選択
print("\nGroup Dataframe by 3 years...\n",
dataFrame.groupby(pd.Grouper(key='Date_of_Purchase', axis=0, freq='3Y')).sum())
実行結果
上記のコードを実行すると、次のような出力が得られます。
DataFrame...
Car Date_of_Purchase Reg_Price
0 Audi 2021-06-10 1000
1 Lexus 2019-07-11 1400
2 Tesla 2016-06-25 1100
3 Mercedes 2021-06-29 900
4 BMW 2020-03-20 1700
5 Toyota 2019-01-22 1800
6 Nissan 2011-01-06 1300
7 Bentley 2013-01-04 1150
8 Mustang 2014-05-09 1350
Group Dataframe by 3 years...
Reg_Price
Date_of_Purchase
2011-12-31 1300
2014-12-31 2500
2017-12-31 1100
2020-12-31 4900
2023-12-31 1900
出力の見方
結果を見ると、購入日は3年ごとの区切り(ビン)にまとめられ、各区間の末日がインデックスとして表示されます。そして、その期間内に含まれるレコードの「Reg_Price」の合計値が計算されていることがわかります。
補足:Pandas 2.2以降での注意点
Pandas 2.2以降では、年単位の頻度エイリアス「Y」は非推奨となり、代わりに「YE」の使用が推奨されています。新しい環境で実行する場合は、「3Y」を「3YE」に置き換えてください。
-
【Python】Pandas DataFrameからサブセット(列の一部)を選択する方法
Pandas DataFrameのサブセット選択とは? Pandasでは、DataFrameから必要な列や行だけを取り出す操作を「サブセットの選択」と呼びます。大きなデータセットから目的のデータだけを抽出できれば、分析や前処理の効率が大幅に向上します。 この記事では、CSVファイルを読み込んだDataFrameから、1つの列、および複数の列を選択する基本的な方法を解説します。 使用するCSVファイルの内容 今回使用する「SalesData.csv」は、Microsoft Excelで開くと以下のような内容になっています。 CSVファイルからDataFrameを作成する まず、pd.rea
-
PythonでPandas DataFrameを棒グラフとして可視化する方法
データ分析において、PandasのDataFrameを視覚的に表現することは非常に重要です。この記事では、CSVファイルから読み込んだデータをmatplotlibを使って棒グラフ(バーチャート)として表示する方法を解説します。 前提条件:サンプルデータ 今回は以下のような内容のCSVファイル(SalesData.csv)を使用します。 Car Reg_Price 0 BMW 2000 1 Lexus 1500 2 Audi 1500 3 Jaguar 2000 4 Mustang