BeautifulSoupを使ってPythonでWebサイトのドメイン名を抽出する方法
BeautifulSoupは、Webページからデータを解析(パース)するために使われるPythonのサードパーティ製ライブラリです。さまざまなリソースからデータを抽出・活用・加工する「Webスクレイピング」を支援するツールとして広く利用されています。また、自然言語処理(NLP)アプリケーションの開発をサポートしたり、データを分析して有益なインサイトを抽出したりすることにも役立ちます。
自然言語処理(NLP)とは、機械学習の一分野であり、テキストデータを扱い、機械学習モデルの入力として渡せるように前処理を行う手法を研究する領域です。
Webスクレイピングは、研究目的のデータ収集や、市場トレンドの把握・比較、SEOモニタリングなど、幅広い用途に活用できます。
Windows環境にBeautifulSoupをインストールするには、以下のコマンドを実行します。
コード例
pip install beautifulsoup4
import requests
from bs4 import BeautifulSoup
from urllib.request import urlopen
import urllib
url = 'https://en.wikipedia.org/wiki/Algorithm'
parsed_uri = urllib.request.urlparse(url)
domainName = '{uri.scheme}://{uri.netloc}/'.format(uri=parsed_uri)
print("The domain name is : ")
print(domainName)出力結果
The domain name is : https://en.wikipedia.org/
解説
必要なパッケージをインポートし、エイリアスを設定します。
対象となるWebサイトのURLを定義します。
「netloc」属性と「scheme」属性を使ってドメイン名を組み立てます。
「urlparse」関数を呼び出してURLを解析し、ドメイン名を取得します。
取得したドメイン名をコンソールに出力します。
なお、「urllib.parse.urlparse」はPythonの標準ライブラリに含まれるため、URLからのドメイン名抽出自体はBeautifulSoupなしでも実行可能です。ただし、実際にページ内のリンクを収集してドメイン一覧を作成するといった処理では、HTMLの解析に便利なBeautifulSoupと組み合わせて使うのが一般的です。
-
PythonのSeabornライブラリで棒グラフ(barplot)を使う方法をわかりやすく解説
Seabornは、データの可視化を支援するPythonライブラリです。洗練されたカスタムテーマと高水準インターフェースを備えており、少ないコード量で美しい統計グラフを作成できるのが大きな特徴です。 棒グラフ(barplot)とは これまでの散布図などのプロットでは、データセット全体をグラフ上に描画していました。一方、棒グラフ(bar plot)を利用すると、データ分布の中心的な傾向(中央傾向)を直感的に把握することができます。 barplot関数は、カテゴリ変数と連続変数の関係を表現するために使用します。データは長方形のバーとして描画され、バーの高さ(長さ)がそのカテゴリにおける値の大きさや割
-
Pythonでscikit-learnライブラリを使って画像の解像度を取得する方法
はじめに:データ前処理とはデータ前処理とは、さまざまなリソース(または単一のリソース)から収集したすべてのデータを、共通のフォーマットや統一されたデータセットにまとめる作業のことです。現実世界のデータは決して完璧ではないため、欠損セル、エラー、外れ値、列間の不整合などが含まれている可能性があります。また、画像が正しく配置されていなかったり、不鮮明だったり、ファイルサイズが過大だったりすることもあります。前処理の目的は、こうした不整合やエラーを取り除き、データを分析可能な状態に整えることにあります。画像の解像度を取得するには、組み込み関数「shape」を使用します。画像を読み込むと、そのピクセル