-
【Python Pandas】DataFrameの行数・列数を取得する方法|shape属性の使い方を解説
PandasのDataFrameにおける行数と列数を確認するには、shape属性を使用します。shape属性はタプル形式で「(行数, 列数)」を返してくれるため、データサイズの把握に非常に便利です。本記事では、CSVファイルを読み込んだDataFrameを例に、shape属性を使って行数と列数をカウントする方法を解説します。前提条件:CSVファイルの準備まず、デスクトップ上に以下のパスでCSVファイルが保存されているものとします。C:\Users\amit_\Desktop\CarRecords.csvCSVファイルの読み込みpandasのread_csv()関数を使って、CSVファイルをDa
-
Python・Pandas DataFrameの統計サマリーを取得する方法
Pandas DataFrameの統計サマリーとはDataFrameの要約統計量(統計サマリー)を取得するには、describe()メソッドを使用します。このメソッドを呼び出すだけで、件数(count)、平均値(mean)、標準偏差(std)、最小値(min)、四分位数(25%・50%・75%)、最大値(max)といった主要な統計情報を一括して確認できます。1. pandasライブラリのインポートまず、以下のようにpandasライブラリをエイリアス「pd」付きでインポートします。import pandas as pd2. CSVファイルからDataFrameを作成次に、read_csv()メソ
-
PythonのDataFrameから欠損値(NaN)を削除する方法|dropna()メソッドの使い方
pandasのDataFrameに含まれる欠損値(NaN)を削除するには、dropna()メソッドを使用します。このメソッドは、NaNが含まれる行を簡単に取り除くことができるため、データクレンジングの際に非常に便利です。必要なライブラリのインポートまず、必要なライブラリであるpandasをインポートします。import pandas as pdCSVファイルを読み込んでDataFrameを作成次に、CSVファイルを読み込み、DataFrameを作成します。dataFrame = pd.read_csv(C:\\Users\\amit_\\Desktop\\CarRecords.csv)drop
-
【Python・Pandas】DataFrameの列名を変更する方法 – rename()メソッドの使い方
PandasのDataFrameで列名(カラム名)を変更するには、rename()メソッドを使用します。rename()メソッドのcolumnsパラメータに、「変更前の列名: 変更後の列名」のペアを辞書形式で指定することで、任意の列名を簡単に変更できます。 例えば、「Car」列を「Car Name」という名前に変更したい場合は、以下のように記述します。 dataFrame.rename(columns={Car: Car Name}, inplace=False) 基本的な流れ まず、CSVファイルを読み込んでDataFrameを作成します。 dataFrame = pd.read_csv(C
-
【Python・Pandas】既存の列からデータフレームに新しい列を作成する方法
Pandasのデータフレームに新しい列を追加する操作は、データ分析において非常によく使われる基本テクニックです。この記事では、すでに存在する列を利用して新しい列を作成する方法を、具体的なコード例と実行結果とともにわかりやすく解説します。 1. CSVファイルを読み込んでデータフレームを作成する まずは、read_csv()メソッドを使ってCSVファイルを読み込み、データフレームを作成しましょう。 dataFrame = pd.read_csv(C:\\Users\\amit_\\Desktop\\SalesRecords.csv) 2. 既存の列から新しい列を作成する 次に、既存の列「Reg_
-
【Python Pandas】条件に基づいてDataFrameの行を抽出する方法を解説
Pandasでは、条件を設定することでDataFrameから目的の行だけを簡単に抽出できます。条件の指定には、比較演算子(<、>、==など)や論理演算子(&、|など)を組み合わせて使用できます。 この記事では、「登録価格が1000未満」という条件でDataFrameの行を抽出する具体例を、コードと実行結果あわせて紹介します。 1. pandasライブラリのインポート まず、必要なpandasライブラリをインポートします。 import pandas as pd 2. CSVファイルを読み込んでDataFrameを作成 read_csv()メソッドを使ってCSVファイルを
-
Python Pandas入門:Seabornで棒グラフを作成し、バーのスタイルをカスタマイズする方法
Seabornの棒グラフ(Bar Plot)とは Seabornの棒グラフは、点推定値とその信頼区間を長方形のバーとして視覚的に表現するためのグラフです。作成には seaborn.barplot() 関数を使用します。さらに、facecolor(塗りつぶし色)、linewidth(線の太さ)、edgecolor(枠線の色)というパラメータを指定することで、バーの見た目を自由にカスタマイズできます。 使用するデータセット 本記事では、次のCSVファイル「Cricketers2.csv」をデータセットとして使用します。このファイルには、クリケット選手の役割(Role)や試合数(Matches)な
-
Seabornのlineplot()でデータセット全体を渡して折れ線グラフを描画する方法(Python・Pandas)
Seabornのラインプロット(lineplot)は、色や線種などのセマンティックなグルーピングを柔軟に指定できる折れ線グラフを描画するための機能です。これには seaborn.lineplot() を使用します。通常は x 軸・y 軸に使う列を指定しますが、データセット全体をそのまま渡したい場合は、x と y の値を明示せず、lineplot() に DataFrame 全体を設定するだけで描画できます。使用するデータセットここでは、以下のCSVファイル「Cricketers2.csv」をデータセットとして使用します。必要なライブラリのインポートまず、必要なライブラリをインポートします。im
-
【Python・pandas】グループ化された水平棒グラフをプロットし、すべての列を表示する方法
pandasのDataFrameからグループ化された水平棒グラフを作成し、すべての列を一度に表示したい場合は、plot.barh()メソッドを使います。x軸・y軸の値を個別に指定しないことで、DataFrame内の数値型の列が自動的に検出され、それぞれがグループ化された状態で描画されます。必要なライブラリのインポートまず、データ操作用のpandasと、グラフ描画用のmatplotlibをインポートします。import pandas as pd import matplotlib.pyplot as pltサンプル用のDataFrameを作成するここでは、「車種名」「排気量」「登録価格」の3つの
-
【Python Pandas】fillnaで欠損値(NaN)を後方の値で埋める方法(bfill)
はじめに PandasのDataFrameには、データの読み込みミスや入力漏れなどによって欠損値(NaN)が含まれることがあります。このような欠損値を処理する方法のひとつが、「後ろにある有効な値を前方向きに引き継いで埋める」という後方補完(Backward Fill)です。 本記事では、fillna()メソッドのmethodパラメータにbfillを指定して、null以外の値を後方から伝播させる方法を解説します。 bfillの基本的な使い方 後方補完を行うには、fillna()メソッドの引数に以下のように指定します。 fillna(method=bfill) bfillは「backward f
-
Python Pandas入門:interpolate()メソッドでNaN値を補間して埋める方法
はじめにPandasでは、interpolate()メソッドを使うことで、DataFrame内の欠損値(NaN)を補間によって効率的に埋めることができます。このメソッドは、前後の値をもとに線形補間を行い、データの流れを保ちながら自然な形で欠損値を推定します。ここでは、Microsoft Excelで開いた以下のようなCSVファイルを例に説明します。このデータには一部NaN値が含まれています。1. CSVファイルからデータを読み込むまず、read_csv()関数を使って、CSVファイルのデータをPandas DataFrameに読み込みます。dataFrame = pd.read_csv(C:\
-
【Python・Seaborn】箱ひげ図の上にスウォームプロットを重ねてデータポイントを可視化する方法
データの分布を可視化する際、箱ひげ図だけでは個々のデータポイントの位置を確認できません。そこで、箱ひげ図の上にスウォームプロットを重ねて描画すると、分布の要約統計と実際のデータポイントを同時に確認でき、より深い分析が可能になります。 実装方法はシンプルです。まず boxplot() を呼び出し、その後に同じx軸・y軸の値を指定して swarmplot() を呼び出すだけです。 Seabornの箱ひげ図とスウォームプロットとは Seabornの箱ひげ図(Box Plot)は、カテゴリごとのデータ分布を示すためのグラフです。中央値、四分位範囲、外れ値などを一目で把握できます。描画には seabor
-
Python Pandas:read_csvのskipinitialspaceでCSV読み込み時の先頭スペースをスキップする方法
PandasでCSVの先頭スペースをスキップするには?PandasでDataFrameを読み込む際、データの先頭にある余分な空白(初期スペース)を取り除きたい場合は、read_csv()メソッドのskipinitialspaceパラメータを使用します。このパラメータをTrueに設定すると、区切り文字(カンマなど)の直後にある空白が自動的にスキップされます。CSVファイルの中には、カンマの後に不要なスペースが混ざっているケースが少なくありません。そのまま読み込むと、列名や値の先頭に空白が残り、条件検索やグループ化の際にデータが正しく一致しない原因となります。skipinitialspace=Tr
-
【Python】Pandas DataFrameからnull(欠損値)行を削除する方法|dropna()の使い方
PandasのDataFrameからnull(NaN)行を削除するには、dropna()メソッドを使用します。この記事では、NaNを含むCSVファイルを読み込み、dropna()で欠損値を含む行を取り除くまでの手順を、サンプルコードと実行結果とともにわかりやすく解説します。前提:NaNを含むCSVファイル今回の例では、一部にNaN(null値)が含まれる以下のようなCSVファイル(CarRecords.csv)を使用します。手順1:read_csv()でCSVファイルを読み込むまずpandasをインポートし、read_csv()を使ってCSVファイルを読み込みます。ここではデスクトップ上に保存
-
Python Pandasのnotnull()メソッドでNULL値(NaN)を確認する方法
Pandasのnotnull()メソッドは、ブール値(True / False)を返すメソッドです。DataFrameにNULL値(NaN)が含まれている場合はFalseを返し、NULL値でない場合はTrueを返します。ここでは、NaN(NULL値)をいくつか含む次のCSVファイルを例にして説明します。CSVファイルの読み込みまず、read_csv()を使ってCSVファイルを読み込みます。dataFrame = pd.read_csv("C:\\Users\\amit_\\Desktop\\CarRecords.csv")NULL値以外(有効なデータ)の確認notnull(
-
Python Pandas入門:データフレームからマルチインデックスを作成する方法
Pandasのデータフレーム(DataFrame)からマルチインデックス(MultiIndex)を作成するには、MultiIndex.from_frame() メソッドを使用します。このメソッドを使うと、既存のデータフレームの列をそのまま階層的なインデックスへと変換でき、多次元データの扱いが格段に便利になります。マルチインデックス作成の基本手順1. リストからなる辞書を用意するまず、サンプルデータとして車種と購入日を持つ辞書を作成します。d = {Car: [BMW, Lexus, Audi, Mercedes, Jaguar, Bentley], Date_of_purchase:
-
【Pandas】共通の列をキーにデータフレームをマージし、一致しない値はNaNにする方法
2つのPandasデータフレームを共通の列(キー)で結合(マージ)するには、merge()関数を使用し、onパラメータに共通の列名を指定します。さらに、一致しない値に対してNaNを設定したい場合は、howパラメータにleft(左結合)またはright(右結合)を指定します。 merge()関数のポイント on:結合のキーとなる共通の列名を指定します。 how:結合方法を指定します。leftは左側のデータフレームの行をすべて残し、rightは右側の行をすべて残します。相手側に一致する値がない場合はNaNで埋められます。 なお、デフォルトのinner(内部結合)では一致しない行が削除されるため
-
Python Pandas – merge()で2つのDataFrameからデカルト積(直積)を作成する方法
PandasでDataFrame同士をマージするにはmerge()関数を使用します。両方のDataFrameに対してデカルト積(直積)を実行したい場合は、merge()関数の「how」パラメータに以下のように指定します。how = crossデカルト積とはデカルト積(直積)とは、一方のDataFrameの各行と、もう一方のDataFrameのすべての行を組み合わせた結果を指します。例えば、4行のDataFrameと3行のDataFrameをクロス結合すると、4 × 3 = 12行の結果が得られます。Pandasライブラリのインポートまず、エイリアス(別名)を付けてPandasライブラリをインポ
-
Python Pandas – DataFrameを1対多(1:m)の関係でマージする方法
PandasでDataFrame同士をマージするには、merge()関数を使用します。このとき、1対多(one-to-many)の関係を明示的に指定したい場合は、merge()関数の「validate」パラメータに以下のいずれかを設定します。validate = one_to_many または validate = 1:m「one-to-many」を指定すると、左側のデータセットにおいてマージキーが一意であることが検証されます。もしキーが重複していた場合はエラーが発生し、意図しない結合を事前に防ぐことができます。サンプルDataFrameの作成まず、1つ目のDataFrameを作成しましょう。
-
Pandasのvalue_counts()で値の名前と出現回数(カウント)を抽出する方法
Pandasのvalue_counts()メソッドを使うと、SeriesやDataFrameの各列に含まれる一意な値とその出現回数(カウント)を簡単に抽出できます。戻り値は、出現回数が多い順にソートされたSeriesとして返されます。サンプルDataFrameの作成まず、4つの列を持つDataFrameを作成しましょう。import pandas as pd dataFrame = pd.DataFrame({ Car: [BMW, Mustang, Tesla, Mustang, Mercedes, Tesla, Audi], Cubic Capacity: [2000,