PythonでCSVファイルから特定の列を抽出する方法(Pandas活用)
PythonでCSVファイルから特定の列だけを抽出してリストとして扱いたい場合、Pandasのread_csv()メソッドを使うと簡単に実現できます。usecols引数に列名のリストを指定することで、必要な列のみを効率的に読み込むことが可能です。
手順
抽出したい列名をリストとして作成します。
read_csv()メソッドを使って、CSVファイルをデータフレーム(DataFrame)として読み込みます。
抽出したデータを表示します。
plot()メソッドを使ってデータフレームをグラフ化します。
図を表示するためにshow()メソッドを呼び出します。
コード例
import pandas as pd
from matplotlib import pyplot as plt
plt.rcParams["figure.figsize"] = [7.00, 3.50]
plt.rcParams["figure.autolayout"] = True
columns = ["Name", "Marks"]
df = pd.read_csv("input.csv", usecols=columns)
print("Contents in csv file:\n", df)
plt.plot(df.Name, df.Marks)
plt.show()
サンプルデータ(input.csv)
この例で使用するCSVファイルには、以下のようなデータが含まれています。
| Name(名前) | Marks(点数) |
|---|---|
| Arun | 98 |
| Shyam | 75 |
| Govind | 54 |
| Javed | 92 |
| Raju | 87 |
実行結果
コードを実行すると、CSVファイルから「Name」と「Marks」の2列だけが抽出され、コンソールにはデータフレームの内容が出力されます。同時に、matplotlibによって各名前の点数を示す折れ線グラフが表示されます。このようにusecolsを活用すれば、大きなCSVファイルからも必要なデータだけを素早く取り出せます。

-
PythonでPDFからハイパーリンク(URL)を抽出する方法
Pythonには、さまざまな処理に対応できる豊富なライブラリが揃っています。PDFからデータやメタ情報を抽出したいときに便利なのが、PyPDF2パッケージです。PyPDF2は使い方がシンプルで、PDFからのデータ抽出、ドキュメント内のキーワード検索、ハイパーリンクやURLなどのメタ情報の取得など、多彩な機能を提供しています。 この記事では、PyPDF2を使ってPDFドキュメントからハイパーリンクを抽出する方法を解説します。 ハイパーリンク抽出の手順 コマンドシェルでpip install PyPDF2を実行し、ローカル環境にPyPDF2をインストールします。 Pythonスクリプト内でPy
-
PythonでPDFをCSVに変換する方法|tabula-pyの使い方を徹底解説
Pythonは、膨大なパッケージライブラリを擁することで広く知られています。本記事では、これらのライブラリを活用して、PDFファイルをCSVファイルへ変換する方法を詳しく解説します。CSVファイルとは、行と列という形式で整理されたデータの集合体のことです。PythonのライブラリにはPDFをCSVに変換できるパッケージが複数存在しますが、ここではtabula-pyモジュールを使用します。tabula-pyの主要部分はJavaで実装されており、まずPDFドキュメントを読み込み、その内容をPythonのDataFrame、さらにJSONオブジェクトへと変換する仕組みになっています。tabula-p