PythonのPandas Series(系列データ構造)から上位n個の要素を取得する方法
PandasのSeries(系列データ構造)から先頭の「n」個の要素を取り出すには、スライス演算子「:」を使用します。これまで解説してきたように、「:」によるスライシングは、Seriesの要素に対して範囲を指定し、その範囲内のデータを後から表示する際に役立ちます。
具体的な例を見てみましょう。
サンプルコード
import pandas as pd
my_data = [34, 56, 78, 90, 123, 45]
my_index = ['ab', 'mn' ,'gh','kl', 'wq', 'az']
my_series = pd.Series(my_data, index = my_index)
print("The series contains following elements")
print(my_series)
n = 3
print("Top 3 elements are :")
print(my_series[:n])実行結果
The series contains following elements ab 34 mn 56 gh 78 kl 90 wq 123 az 45 dtype: int64 Top 3 elements are : ab 34 mn 56 gh 78 dtype: int64
コードの解説
必要なライブラリをインポートし、扱いやすいように別名(エイリアス)を付けています。
データ値のリストを作成し、後ほどpandasライブラリの「Series」関数にパラメータとして渡します。
次に、カスタマイズしたインデックス値をリストに格納します。これもパラメータとして渡されます。
Pythonのインデックス演算子「:」を使うことで、Seriesから特定の範囲の値にアクセスできます。
「:」演算子は下限値と上限値の間に記述します。書式は [下限 : 上限] の形です。
このとき、下限の値は範囲に含まれますが、上限の値は除外されます。
下限が指定されていない場合は、自動的に0とみなされます。
上限が指定されていない場合は、len(データ構造) - 1 とみなされます。
今回の例では、下限が0、上限が3であることを意味するため、先頭から3つの要素が取得されます。
最後に、その結果がコンソールに出力されます。
補足:head()メソッドを使う方法
先頭のn個の要素を取得する目的であれば、Pandasには専用のhead()メソッドも用意されています。my_series.head(n)のように呼び出すことで、同じ結果をより簡潔なコードで得られます。用途に応じて、スライスとhead()を使い分けるとよいでしょう。
-
PythonのSeabornライブラリでcountplotを使ってデータを可視化する方法
Seabornは、データの可視化を支援するPythonライブラリです。カスタマイズされたテーマと高水準のインターフェースを備えており、美しいグラフを簡単に作成できます。 これまでのプロットでは、データセット全体をグラフ上に描画してきました。一方、棒グラフ(bar plot)を活用すると、データ分布の中心的な傾向(中央傾向)を把握することができます。 barplot関数は、カテゴリ変数と連続変数の関係を表現するのに役立ちます。データは長方形のバーとして描画され、バーの長さがそのカテゴリにおけるデータの割合を示します。 barplotの特殊なケースがcountplotです。countplotは、第
-
Pythonでscikit-learnライブラリを使って画像の解像度を取得する方法
はじめに:データ前処理とはデータ前処理とは、さまざまなリソース(または単一のリソース)から収集したすべてのデータを、共通のフォーマットや統一されたデータセットにまとめる作業のことです。現実世界のデータは決して完璧ではないため、欠損セル、エラー、外れ値、列間の不整合などが含まれている可能性があります。また、画像が正しく配置されていなかったり、不鮮明だったり、ファイルサイズが過大だったりすることもあります。前処理の目的は、こうした不整合やエラーを取り除き、データを分析可能な状態に整えることにあります。画像の解像度を取得するには、組み込み関数「shape」を使用します。画像を読み込むと、そのピクセル