Python
 Computer >> コンピューター >  >> プログラミング >> Python

PythonでASCII範囲内の文字列をフィルタリングする方法

文字列がASCII範囲内に収まっているかどうかを判定するには、各文字のUnicodeコードポイントを取得する「ord」関数と、すべての要素が条件を満たしているかを確認する「all」関数を組み合わせて使用します。

以下に具体的な実装例を示します。

サンプルコード

my_string = "Hope you are well"

print("The string is :")
print(my_string)

my_result = all(ord(c) < 128 for c in my_string)

if(my_result == True):
    print("The string contains ASCII characters")
else:
    print("The string doesn't contain all ASCII characters")

実行結果

The string is :
Hope you are well
The string contains ASCII characters

コードの解説

  • まず対象となる文字列を定義し、コンソールに表示します。

  • 文字列内の各文字に対して「ord」関数を呼び出し、そのUnicode値が128未満であるかどうかを順番にチェックします。

  • すべての文字のUnicode表現が128未満であれば、ブール値「True」が返されます。

  • 反復処理が完了した後、このブール値を条件分岐で評価します。

  • 評価結果に応じて、対応するメッセージがコンソールに出力されます。

補足:より簡潔な判定方法

Python 3.7以降では、文字列オブジェクトが標準で持つ isascii() メソッドを使うことで、同じ判定を1行で行うことができます。

print(my_string.isascii())  # True または False を返す

また、「フィルタリング」という目的であれば、正規表現モジュール「re」を使ってASCII範囲外の文字を除去する方法も有効です。

import re

filtered = re.sub(r'[^\x00-\x7F]+', '', my_string)
print(filtered)

用途に応じて、判定には all() + ord()isascii()、実際に文字を取り除きたい場合には正規表現を使い分けるとよいでしょう。

  1. Pythonで文字列がASCIIのみで構成されているかどうかを確認する方法

    Pythonで文字列がすべてASCII文字だけで構成されているかどうかを判定したい場面は少なくありません。ここでは、代表的な2つの方法をわかりやすく解説します。 方法1:all()とord()を使って1文字ずつチェックする 最もシンプルな方法は、文字列内の各文字を順番に調べ、その文字コード(Unicodeコードポイント)が128未満であるかを確認することです。ASCIIは0〜127のコードポイントで定義されているため、すべての文字がこの範囲内であれば、その文字列はASCIIのみで構成されていると判断できます。 def is_ascii(s): return all(ord(c) <

  2. Pythonの文字列操作入門|作成・インデックス・スライス・フォーマットの基本をわかりやすく解説

    文字列はPythonにおける最も基本的なデータ型のひとつです。英字・数字・記号など、任意の文字を組み合わせたものが文字列として扱われます。このチュートリアルでは、文字列の作成方法から、インデックスやスライスによる操作、フォーマットの使い方まで、さまざまな場面で役立つ基本操作を体系的に解説します。 Pythonで新しい文字列を作成する Pythonで文字列を作成するのはとても簡単です。シングルクォート()またはダブルクォート()で文字の並びを囲むだけで宣言できます。また、複数行にわたる長い文字列を作りたい場合は、トリプルクォート( または )を使用します。 double_quotes = My