Python
 Computer >> コンピューター >  >> プログラミング >> Python

【Python】Pandasのgroupby.first()でグループごとの最初の値を取得する方法

はじめに

Pandasでは、groupby()メソッドでデータをグループ化した後、first()メソッドを使うことで、各グループの最初に出現する値を簡単に取得できます。本記事では、具体的なサンプルコードと実行結果をもとに、その使い方をわかりやすく解説します。

必要なライブラリのインポート

まず、Pandasをエイリアス(別名)付きでインポートします。慣例として「pd」という名前を使うのが一般的です。

import pandas as pd

サンプルDataFrameの作成

次に、「Car(車種)」「Place(地域)」「Units(台数)」の3つの列を持つDataFrameを作成します。

dataFrame = pd.DataFrame(
    {
        "Car": ['BMW', 'Lexus', 'BMW', 'Tesla', 'Lexus', 'Tesla'],
        "Place": ['Delhi', 'Bangalore', 'Pune', 'Punjab', 'Chandigarh', 'Mumbai'],
        "Units": [100, 150, 50, 80, 110, 90]
    }
)

列を基準にグループ化する

ここでは「Car」列をキーとしてDataFrameをグループ化します。これにより、同じ車種のデータがそれぞれ1つのグループにまとめられます。

groupDF = dataFrame.groupby("Car")

グループごとの最初の値を計算する

first()メソッドを呼び出すことで、各グループの最初の値を取得できます。さらに、reset_index()でインデックスを振り直すと、結果がより見やすくなります。

res = groupDF.first()
res = res.reset_index()

完全なサンプルコード

以下に、ここまでの手順をすべてまとめた完全なコードを示します。

import pandas as pd

dataFrame = pd.DataFrame(
    {
        "Car": ['BMW', 'Lexus', 'BMW', 'Tesla', 'Lexus', 'Tesla'],
        "Place": ['Delhi', 'Bangalore', 'Pune', 'Punjab', 'Chandigarh', 'Mumbai'],
        "Units": [100, 150, 50, 80, 110, 90]
    }
)

print("DataFrame ...\n", dataFrame)

# Car列を基準にDataFrameをグループ化
groupDF = dataFrame.groupby("Car")

# 各グループの最初の値を計算
res = groupDF.first()
res = res.reset_index()

print("\nFirst of group values = \n", res)

実行結果

上記のコードを実行すると、以下のような出力が得られます。重複している車種については、最初に出現した行の値が表示されていることが確認できます。

DataFrame ...
     Car       Place  Units
0    BMW       Delhi    100
1  Lexus   Bangalore    150
2    BMW        Pune     50
3  Tesla      Punjab     80
4  Lexus  Chandigarh    110
5  Tesla      Mumbai     90

First of group values =
     Car      Place  Units
0    BMW      Delhi    100
1  Lexus  Bangalore    150
2  Tesla     Punjab     80

まとめ

groupby()first()を組み合わせることで、グループ化されたデータから各グループの先頭レコードを簡単に抽出できます。重複データの中から最初の値だけを取り出したい場合に非常に便利なテクニックなので、データ分析の際にぜひ活用してみてください。

  1. Python Pandas入門:interpolate()メソッドでNaN値を補間して埋める方法

    はじめにPandasでは、interpolate()メソッドを使うことで、DataFrame内の欠損値(NaN)を補間によって効率的に埋めることができます。このメソッドは、前後の値をもとに線形補間を行い、データの流れを保ちながら自然な形で欠損値を推定します。ここでは、Microsoft Excelで開いた以下のようなCSVファイルを例に説明します。このデータには一部NaN値が含まれています。1. CSVファイルからデータを読み込むまず、read_csv()関数を使って、CSVファイルのデータをPandas DataFrameに読み込みます。dataFrame = pd.read_csv(C:\

  2. 【Python Pandas】fillnaで欠損値(NaN)を後方の値で埋める方法(bfill)

    はじめに PandasのDataFrameには、データの読み込みミスや入力漏れなどによって欠損値(NaN)が含まれることがあります。このような欠損値を処理する方法のひとつが、「後ろにある有効な値を前方向きに引き継いで埋める」という後方補完(Backward Fill)です。 本記事では、fillna()メソッドのmethodパラメータにbfillを指定して、null以外の値を後方から伝播させる方法を解説します。 bfillの基本的な使い方 後方補完を行うには、fillna()メソッドの引数に以下のように指定します。 fillna(method=bfill) bfillは「backward f