Python
 Computer >> コンピューター >  >> プログラミング >> Python

Python・PandasでDataFrameを年ごとにグループ化する方法

PandasのDataFrameをグループ化するには、groupby()メソッドを使用します。グループ化の基準となる列は、Grouper関数を使って指定します。本記事では、車販売記録のデータを例に、年間隔でデータをグループ化し、「登録価格(Reg_Price)」の合計を計算する方法を解説します。

サンプルDataFrameの作成

まず、次のような3つの列を持つPandas DataFrameを用意します。「Date_of_Purchase(購入日)」列が含まれている点がポイントです。

# Date_of_Purchase列を含むDataFrame
dataFrame = pd.DataFrame(
    {
        "Car": ["Audi", "Lexus", "Tesla", "Mercedes", "BMW", "Toyota", "Nissan", "Bentley", "Mustang"],

        "Date_of_Purchase": [pd.Timestamp("2021-06-10"),
            pd.Timestamp("2019-07-11"),
            pd.Timestamp("2016-06-25"),
            pd.Timestamp("2021-06-29"),
            pd.Timestamp("2020-03-20"),
            pd.Timestamp("2019-01-22"),
            pd.Timestamp("2011-01-06"),
            pd.Timestamp("2013-01-04"),
            pd.Timestamp("2014-05-09")
        ],

        "Reg_Price": [1000, 1400, 1100, 900, 1700, 1800, 1300, 1150, 1350]
    }
)

Grouperを使って年単位でグループ化する

次に、groupby()関数の中でGrouperを使用して「Date_of_Purchase」列を選択します。頻度(freq)は「3Y」、つまり3年間隔でグループ化するように設定しています。

コード例

以下が完全なコードです。

import pandas as pd

# Date_of_Purchase列を含むDataFrame
dataFrame = pd.DataFrame(
    {
        "Car": ["Audi", "Lexus", "Tesla", "Mercedes", "BMW", "Toyota", "Nissan", "Bentley", "Mustang"],

        "Date_of_Purchase": [pd.Timestamp("2021-06-10"),
            pd.Timestamp("2019-07-11"),
            pd.Timestamp("2016-06-25"),
            pd.Timestamp("2021-06-29"),
            pd.Timestamp("2020-03-20"),
            pd.Timestamp("2019-01-22"),
            pd.Timestamp("2011-01-06"),
            pd.Timestamp("2013-01-04"),
            pd.Timestamp("2014-05-09")
        ],

        "Reg_Price": [1000, 1400, 1100, 900, 1700, 1800, 1300, 1150, 1350]
    }
)

print("DataFrame...\n", dataFrame)

# Grouperでgroupby()内のDate_of_Purchase列を選択
print("\nGroup Dataframe by 3 years...\n",
      dataFrame.groupby(pd.Grouper(key='Date_of_Purchase', axis=0, freq='3Y')).sum())

実行結果

上記のコードを実行すると、次のような出力が得られます。

DataFrame...
         Car   Date_of_Purchase Reg_Price
0       Audi          2021-06-10 1000
1      Lexus          2019-07-11 1400
2      Tesla          2016-06-25 1100
3   Mercedes          2021-06-29 900
4       BMW          2020-03-20 1700
5     Toyota          2019-01-22 1800
6     Nissan          2011-01-06 1300
7    Bentley          2013-01-04 1150
8    Mustang          2014-05-09 1350

Group Dataframe by 3 years...
Reg_Price
Date_of_Purchase
2011-12-31 1300
2014-12-31 2500
2017-12-31 1100
2020-12-31 4900
2023-12-31 1900

出力の見方

結果を見ると、購入日は3年ごとの区切り(ビン)にまとめられ、各区間の末日がインデックスとして表示されます。そして、その期間内に含まれるレコードの「Reg_Price」の合計値が計算されていることがわかります。

補足:Pandas 2.2以降での注意点

Pandas 2.2以降では、年単位の頻度エイリアス「Y」は非推奨となり、代わりに「YE」の使用が推奨されています。新しい環境で実行する場合は、「3Y」を「3YE」に置き換えてください。

  1. 【Python】Pandas DataFrameからサブセット(列の一部)を選択する方法

    Pandas DataFrameのサブセット選択とは? Pandasでは、DataFrameから必要な列や行だけを取り出す操作を「サブセットの選択」と呼びます。大きなデータセットから目的のデータだけを抽出できれば、分析や前処理の効率が大幅に向上します。 この記事では、CSVファイルを読み込んだDataFrameから、1つの列、および複数の列を選択する基本的な方法を解説します。 使用するCSVファイルの内容 今回使用する「SalesData.csv」は、Microsoft Excelで開くと以下のような内容になっています。 CSVファイルからDataFrameを作成する まず、pd.rea

  2. PythonでPandas DataFrameを棒グラフとして可視化する方法

    データ分析において、PandasのDataFrameを視覚的に表現することは非常に重要です。この記事では、CSVファイルから読み込んだデータをmatplotlibを使って棒グラフ(バーチャート)として表示する方法を解説します。 前提条件:サンプルデータ 今回は以下のような内容のCSVファイル(SalesData.csv)を使用します。 Car Reg_Price 0 BMW 2000 1 Lexus 1500 2 Audi 1500 3 Jaguar 2000 4 Mustang